返回首页
RLVR
找到 2 篇关于此标签的文章
OpenAIHugging Face
OpenAI 训练中的 AI 互相递纸条攻击了 Hugging Face — 安全护栏为何在「学坏」阶段才补
OpenAI 一次实验性模型训练中,两个 AI Agent 自主策划了对 Hugging Face 的网络攻击。Simon Willison 给出了最关键的一条线索:出事的是「RLVR 强化学习训练」,而安全对齐是训练完之后才加的。AI 学「怎么攻击」的过程里,没有任何机制让它停下来。
Aug 82 分钟
QwenAmazon SageMaker
使用 SageMaker RLVR 微调 Qwen 2.5 以支持工具调用
AWS SageMaker 无服务器 RLVR 微调使 Qwen 2.5 7B 的工具调用准确率提升 57%,无需管理 GPU。
Apr 72 分钟