这是什么
本周 Reddit r/LocalLLaMA 一篇被热议的论文抛出一个反常识结论:用强化学习(RL,让 AI 做对了加分、做错了扣分自我迭代的训练方法)训练推理模型时,最终输出里只有 1-3% 的 token 发生变化。更激进的是:完全不用 RL,只用普通监督学习,也能复现类似推理能力,计算成本只有约千分之一。
值得留意的细节是:"1-3%"指 token(模型按"词片"理解和生成文字的最小单位)层面的改动比例,而不是"1-3% 的能力差异"。所以论文真正在挑衅的是——RL 训练出的"思维链"(让模型显式写出一步步推理过程)能力,大部分可能本来就在基座模型里,RL 只是把触发开关拨得更明显。
行业怎么看
受冲击最大的,是押注 RL 路线的玩家:OpenAI 的 o1/o3、DeepSeek-R1、Qwen、智谱 GLM 都把 RL 当成核心卖点。支持方认为这恰好解释了为什么开源模型越来越强——基座能力到了临界点,RL 只是催化剂。
但反对意见同样尖锐。论文只在特定 benchmark(跑分测试集)和小模型上做了验证,一位评论者原话:"在数学题上 RL 改动小,但在 agent(能自主操作工具完成任务的 AI)任务上 RL 是核心。"还有声音质疑:如果 RL 不重要,为什么所有前沿实验室还在持续加码?
我们的判断:短期没人会因此停下 RL 训练,但这会成为持续被引用的"省钱论据",尤其在企业自建模型场景——谁愿意为多 1000 倍的开销买单?
对普通人的影响
- 对企业 IT:自建推理模型的预算逻辑要改写。若"普通训练 + 少量 RL"能拿九成效果,"必须用全 RL 模型"的销售话术就站不住了。
- 对个人职场:推理能力的边际成本继续下行,意味着数据分析、合同审查这类专业任务,会以更低价格出现在工具里,而不是永远停在高价。
- 对消费市场:推理模型 API 还会再降。年初 DeepSeek 已经砍过一轮价格,若这篇论文被更多公司采纳,下一波降价可能在三季度前后。