本周 Reddit 的 LocalLLaMA 板块上,用户 frankentriple 做了一件有点意思的事:他发现开源模型 Ornith 1.5 35B 里有个没训练好的"加速零件"(MTP head,多 token 预测头,让模型一次猜好几个字),于是拆掉它,换上别家训练好的版本。同样任务完成时间从 21 秒降到 14 秒,提速 33%。这事值得关心——它说明本地 AI 圈的技术深度,可能比很多人以为的强。
这是什么
Ornith 是一个开源大模型,35B 总参数、3B 活跃参数(属于 MoE 混合专家架构,每次推理只调用一小部分),能装在普通游戏显卡上。1.5 版本发布后,社区发现 MTP 头没训练——相当于车装了个没调好的涡轮。frankentriple 在别处找到训练好的 MTP 权重,嫁接到 APEX 版本(一种模型压缩格式)上。
结果反直觉:每秒生成 token 数从 60 涨到 64(+3%),完成任务时间却降了三分之一。原因是 MTP 让模型更准地预判下一步,减少返工。这位用户用 AI 控制 HAM 业余无线电设备,这点速度差异就是设备响应快不快的问题。
行业怎么看
正面看:本地 AI 社区正在做大厂不愿做的活。MTP 训练、调优、移植——不性感、没 PR 价值,但能把模型从"能跑"变成"真能用"。用户能完成这种操作,说明生态足够成熟。
反对与风险:这事得打个问号。"墙钟时间降 33%、token 数只涨 3%"差距过大,测量方法可能不严谨,或只是特定任务碰巧受益;"嫁接 MTP 头"是实验性操作,换个模型未必有效;Ornith 是社区小项目,离 Llama、Qwen 这类主流开源模型还远。一个案例不等于趋势。
对普通人的影响
对企业 IT:现阶段参考意义有限。但若场景是工业控制、嵌入式这类延迟敏感、又不想上云的任务,本地小模型 + 社区优化方案开始变得可考虑。
对个人职场:跑得动 35B 模型的人仍是少数。但开源 AI 的"动手门槛"在持续下降,未来一两年,普通白领工作流里出现本地 AI 工具不是不可能。
对消费市场:消费者暂时无感。但本地 AI 越成熟,云端 AI 厂商的定价空间就越小——这是间接影响。