本周 llama.cpp(本地跑大模型最主流的开源工具)收到一个 PR:让模型自己决定一次"猜"几个字(业内叫 MTP,多 token 预测)。结果很分裂——写代码时速度最高翻倍,但普通散文场景反而慢约 3%。这是一件"对开发者重要、对多数人隐身"的更新。
这是什么
所谓 MTP,就是让大模型一次输出多个字(token),而不是传统的一个一个蹦。这是过去一年推理加速的重要方向之一。代价是:猜多了容易猜错,猜少了又浪费算力。之前的做法是用户手动调一个深度参数(常见的填 3 或 6),现在这个 PR 引入了一个"自适应"模式,让系统根据上下文自动选择深度。
实测数据上:密集散文约慢 3%,写代码快 10-15%,调用"思考阶段"已写过的代码时能快 50% 以上,极端情况下接近翻倍。推荐配置是深度上限设 12,由系统在 3-12 之间动态调整。
行业怎么看
支持者认为,这是本地 LLM 工具链走向"少折腾"的一个标志:以前用户要在十几个参数里反复试错,现在关键的一个可以交给机器。社区已有开发者留言准备实测。
反对意见同样成立:3% 的回退在生产环境里不是小数字——一个每天处理几亿 token 的服务,3% 就是实实在在的算力账单。此外,MTP 主要受益于原生支持该能力的模型(如 DeepSeek 系列),普通开源小模型用不上。简单说,这是一项"硬件和模型都对路才赚得到"的技术,通用价值有限。
对普通人的影响
对企业 IT:已经在本地或私有云跑大模型推理的团队,理论上可以省下一笔调参人力,部分代码类工作负载的吞吐会有可见提升。
对个人职场:非技术岗位基本无感;一线开发者的体验会更顺,但不会改变"AI 工具"在你电脑里的存在感。
对消费市场:短期不会传导到 C 端产品。这属于底层加速器,离用户能感知的"AI 变快"还有几层封装。