Ornith 1.5 是个号称 350 亿参数的开源大模型(MoE 架构,即把参数切成多个"专家",每次推理只激活一部分计算,所以比同尺寸稠密模型更快)。这周被人扒出来:它附带的 MTP 预测头(Multi-Token Prediction,让模型一次预测多个词以加速输出的模块)从出厂起就是随机初始化——压根没训练过。一个宣称可商用的模型,带着半成品组件就发了版。

这是什么

MTP 是当前主流大模型常用的加速技术:正常一次预测下一个词,MTP 让模型一次预测后面几个词,跳过即可提速。这次出问题的就是这个预测头。Ornith 1.5 用的 MoE 架构把 350 亿参数分成若干"专家",每次推理只激活约 30 亿(A3B 里 3B 的来源)。两个技术单独看都不新鲜,但组合后没经过完整测试就直接发版,是这次事故的直接原因。

行业怎么看

社区主流反应是感谢这位扒帖的人——开源模型的品控一直靠用户社区"用脚投票",这次能快速被发现,说明社区监督机制有效。但值得警惕的是:如果不是有人逐层检查权重(模型的内部参数),这个 bug 可能永远躺在那。闭源模型(OpenAI、Anthropic、字节、阿里)也有类似问题,但内部 QA 流程至少能挡一道;开源生态里这道关卡,是缺失的。 也有反对声音:有人认为这恰恰说明开源的好处——你可以随时验证厂商有没有偷工减料。闭源模型你连看都看不到,谈何品控?但这个论点忽略了一个前提:能逐层检查权重的技术用户,全球可能不到一万人。剩下 99% 的人拿什么判断?

对普通人的影响

企业 IT:如果你们在评估用开源大模型降本,这次是个提醒——开源不等于免费,也不等于可靠,需要专门的工程团队做验证。 对个人职场:日常用 ChatGPT、文心一言这类闭源产品反而更省心;个人玩开源模型可以,但别拿它跑生产任务。 对消费市场:接下来会有一波开源大模型对比评测,可以看,但记得问一句"评测方检查过权重吗"。