找到 1 篇关于此标签的文章
Amazon 公开了一份叫 Rufus-Air 的训练手册,把大模型后训练拆成 8 个阶段。核心主张是先用可验证奖励建立能力,再用主观奖励微调。这条'先硬后软、设门晋级'的原则,对想用 AI 的企业比具体步骤更值得抄。