我们注意到一个被低估的事实:预训练吃掉 90% 算力,但真正决定模型聪不聪明的,是那个只占 5% 的中训阶段。掘金一篇技术长文把这事讲清楚了。
这是什么
这篇技术长文把大模型训练拆成"流水线"。典型流程分四段:预训练(让模型见过世界)、中训(往数学、代码、推理方向加压)、SFT 监督微调(教模型听指令)、对齐(用 RLHF 即人类反馈强化学习,或 DPO 即直接偏好优化,让回答"有用、无害、诚实"),旁路还有蒸馏——把大模型能力浓缩到小模型。参考 DeepSeek-V3、Qwen2.5、LLaMA-3.1、Kimi K1.5 的公开披露,结论是:中外头部玩家的训练流程已经趋同。
行业怎么看
文章面向训练工程师,但揭示了一个值得非技术读者关注的成本结构:预训练吃掉 90%+ 的 GPU-hours(GPU 运算小时数),中训 5% 左右,SFT 不到 1%,对齐的算力占比最小、工程复杂度最高。
"钱花在哪"和"能力长在哪"不是一回事。中国大模型能在算力受限下追上来,关键不是预训练堆卡(那拼的是资本和供应链),而是在中训、SFT、对齐这些"小算力、高技巧"环节做差异化。DeepSeek R1 用 GRPO(一种去掉 critic 的强化学习方法)在推理上打出名堂,正是这种打法的体现。
反对意见同样存在。把流水线讲得这么"工业化",可能掩盖基础研究的重要性。当大家都在抄同一套 SFT+DPO+蒸馏模板时,下一代突破反而可能出在不按套路出牌的小团队或学术实验室。
对普通人的影响
对企业 IT:训练流程标准化后,"自建大模型"的工程门槛比想象中低,但复杂度集中在对齐和稳定性,多数场景下买第三方 API 仍更划算。
对个人职场:理解"模型不是一次训完",有助于判断供应商话术——"自研基础模型"的能力到底来自预训练还是中训,前者要资本,后者要数据和方法论。
对消费市场:开源模型在快速追平闭源,Qwen、Kimi、DeepSeek 这条线的产出意味着 AI 服务边际成本会继续下降,应用层比模型层更值得关注。