这是什么
本周 Reddit 机器学习板块一份热帖问出一个关键问题——大模型什么时候能自己训练下一代?我们注意到,2024-2025 年,这不再是脑洞,而是 OpenAI、DeepSeek、Sakana 三家头部实验室在悄悄做的事:让 AI 训练 AI。
具体表现:OpenAI o1/o3 训练中,模型被用来生成推理链(推理过程的文字记录)作为训练数据;中国 DeepSeek R1 走类似路径,用模型自己生成的思考过程替代部分昂贵的人类标注;日本 Sakana AI 推出"AI Scientist",声称以约 15 美元一次的成本,自动完成机器学习研究全流程。
关键边界:现阶段仍是"AI 辅助人类训练 AI",并非真正自举(bootstrapping,指模型完全自主迭代下一代,不需人类参与)。Sakana 仍需人类科学家审核,OpenAI 也未公开承认完全脱离人类反馈。
行业怎么看
乐观派认为这是规模化 AI 研究的必经之路。人工标注成本高、速度慢,用 AI 生成训练数据能把模型迭代周期从几个月压缩到几周。Sakana 创始人 David Ha 公开称之为"研究自动化"的雏形。
反对意见同样有力。2024 年发表于《Nature》的一项研究警告:纯合成数据训练会导致"模型崩溃",模型逐步丢失对长尾内容(出现频率低但确实存在的信息)的覆盖,输出越来越像"AI 套 AI"。Anthropic 创始人 Dario Amodei 也公开表达过类似担忧,认为在没有人类价值锚定(让 AI 输出与人类价值观对齐)的情况下,这条路径风险尚未被充分认识。
对普通人的影响
对企业 IT:未来 12-18 个月,企业采购 AI 模型时,"训练数据来源"会成为新的尽调(尽职调查)项,完全合成数据训练出的模型可靠性需要被独立验证。
对个人职场:又一次工具迭代。先理解"AI 训练 AI"这条产业链的人,在评估 AI 产品、做技术决策时会有信息差优势。
对消费市场:底层成本下降会传导到消费者端 AI 应用价格;短期内"AI 内容泛滥"是更直接的体验问题,识别信息真伪的难度上升。