这是什么
9月24日,Amazon 团队公开了 Rufus-Air 训练手册:把 GLM-4.5-Air-Base(1060 亿参数的开源基座模型)按顺序做监督微调、推理、代码、指令、通用 Agent、编码 Agent、搜索 Agent 和 RLHF(基于人类反馈的强化学习)共 8 个阶段,同时公布数据筛选、奖励设计、阶段排序、基础设施的全部细节。
值得普通人留意的,不是"8 步"这个数字,而是一条更朴素的原则——我们把它总结为"先硬后软、设门晋级":早期只用能明确判对错的硬奖励(数学答案、代码测试通过与否),后期才引入依赖主观感受的软奖励(回答讨不讨人喜欢)。每步设门禁,目标能力涨不到 2% 不晋级,通用能力倒退超 1% 立刻回滚。
行业怎么看
支持者认为,这份手册把行业常被省略的工程细节摆回桌面:数据过滤、奖励可靠性、阶段门禁、回滚机制——比又一个跑分榜单更有长期价值。中小团队不必复刻 1060 亿参数训练,但能抄走"奖励排序、难度过滤、阶段门禁、可回滚检查点"这套工程骨架。
反对意见同样明确。"开放"不等于低成本,复现仍需巨额算力和严格的数据版本管理;没有新增人工标注和内部教师蒸馏,意味着某些能力上限被悄悄封死;"竞争性结果"不等于对所有模型和语言都最优。我们也注意到一个隐忧:只追"每阶段都涨"的指标,可能让模型学会讨好裁判,而非真正学会任务本身。
对普通人的影响
- 对企业 IT:采购 AI 服务时,可以问供应商"你们的奖励是硬指标还是软裁判"——这是区分工程成熟度的实在问题。
- 对个人职场:用 AI 做代码或文档审查,可验证的部分(代码跑不跑得通、数据对不对)会更可靠,涉及语气和风格的部分仍需人工把关。
- 对消费市场:消费级 AI 产品的体验差异,本质上来自背后训练阶段的设计,不全是"参数大小"的锅。