本周 Reddit LocalLLaMA 社区有个值得关注的帖子:独立开发者用 86.5B tokens(不到 Qwen2.5-1.5B 所用 18T 的 1/200)从零训练出 3.87B 参数的 MoE 模型 Apex-2,在 HumanEval+ 代码基准上几乎追平前者。这件事告诉我们:训练 AI 大模型的门槛,正在从「大公司专属」滑向「认真研究的个人也能上手」。
这是什么
Apex-2 是独立开发者 YOON1v 从零训练的小型 AI 模型——没有基于任何已有大模型起步。它用 86.5B token 做预训练(业内头部模型通常用 10T-20T),又在 2.5B token 上做了监督微调(SFT,即用人类写好的问答对训练模型理解指令)。训练设备是一台 GH200 显卡(NVIDIA 的高端 AI 芯片),用 DiLoCo(一种跨机器协同训练方法)从 1 张扩展到 2 张。
MoE(Mixture of Experts,「混合专家」)是一种「按需调用子网络」的架构——3.87B 总参数里,每次推理只激活 1.45B,相当于用更少的「算力成本」做更多事。
关键数字:HumanEval(让 AI 写函数并通过测试)43.9 分、MBPP(类似编程题)56.3 分;HumanEval+ 41.5、MBPP+ 48.9。作为对比,Qwen2.5-1.5B 用 200 倍数据量,才在 HumanEval+ 上打成平手。
行业怎么看
支持者认为这件事说明数据效率正在快速跃升——架构创新(MoE+DiLoCo)让小团队也能产出特定领域可用的小模型。如果这个趋势成立,未来企业内部训练专属 AI 的成本会从「几百万起」降到「几十万甚至更低」。我们注意到,这一波效率提升的红利,对中小软件公司和垂直行业服务商最直接。
反对意见同样尖锐。代码只是 AI 能力的一个切片——Apex-2 的 MMLU(综合知识测试,相当于 AI 的「通识考试」)只有 28.6%,远低于主流模型的 70% 以上;GSM8K(小学数学应用题)32.4、MATH-500 21.0,数学和推理依然薄弱;上下文窗口也只有 4k token,处理长文档会力不从心。简单说:能写代码不等于能当通用助手,这和真正能落地工作的成熟模型仍有数量级差距。
还有一层隐忧:原帖作者坦承 DPO(一种让 AI 更贴合人类偏好的微调方法)让回答变长却拉低了所有基准,他直接放弃了这个训练阶段。这种「能跑通但不稳定」的实验结果,离产品化还有相当距离。
对普通人的影响
对企业 IT:垂直任务(代码生成、客服回复、文档摘要)的小模型成本会继续下降,未来中小企业为单一场景训练专属 AI,可能不再是天方夜谭。
对个人职场:AI 工具的「分场景」会越来越明显——写代码的 AI 会更便宜、更本地化,但写报告、做决策的通用 AI 仍是大公司的天下。
对消费市场:手机、智能家居、车机的本地 AI 会因为这种高效小模型而变强——你下次换手机时,「端侧大模型」可能从卖点变成标配。