这是什么
本周 r/LocalLLaMA 用户 nonlinearsystems 在 Mac Studio M5 Ultra(256GB 统一内存)上做了一场同尺寸长上下文模型的对比:阿里 Qwen3.8-Flash-Next(用 oMLX 跑 182GB 量化权重)对 Laguna-S-2.1 GGUF(128GB 8bit)。两者都开 262K 上下文与"思考模式",并验证每次跑没有缓存复用。
关键数据在 200K 长度这一档:Qwen 把整份文档"读完"(业内叫预填/Prefill)只用 47 秒,Laguna 要 455 秒——慢了将近 10 倍。Qwen 的预填速度稳定在每秒 4,200 token 左右、随长度线性增长;Laguna 呈超线性衰减,因为它走的是传统二次注意力路线。生成速度——也就是用户实际等待的部分——Qwen 在 59-74 tok/s 之间,Laguna 从 68 跌到 34。题目正确率打平,4 题对 4 题。
Qwen 跑得快的核心是一项叫 MTP(Multi-Token Prediction)的推理技术:模型在每一步不只预测下一个 token,而是同时预测多个候选 token 再择优,吞吐量约翻倍。
行业怎么看
支持方认为,这次跑分证明两件事:第一,苹果芯片正在成为严肃的长上下文推理平台,本地部署不再只是极客玩具;第二,中国开源模型在长上下文效率上已具备工程级优势,不再只是参数规模的比拼。
质疑方则指出三点风险。其一,这是单人、单机的测试,温度、提示词、思考预算的设置都未经同行复核,结论的普适性要打折扣。其二,4,200 tok/s 是预填速度——读文档确实飞快——但用户真正等待的生成速度只有 59-74 tok/s,实际体验并没有数字看起来那么夸张。其三,开发者本人披露过一次"模型烧光 8K 思考预算却一个字没输出"的事故,16K 重试才救回来,说明 MTP 在边界场景下仍有可靠性问题。
还有一个被低估的现实门槛:跑这套测试需要 M5 Ultra 加 256GB 内存的整机,价格不菲,不是每家企业 IT 部门都愿意或敢于投入。
对普通人的影响
对企业 IT:本地跑长上下文模型开始具备工程可行性,处理合同、财报、招股书这类敏感文件不必上传到第三方云,对数据合规是好事。但硬件门槛不低,决策时不能只看跑分数字。
对个人职场:知识工作者短期感受不到直接影响。但金融、法律、咨询、审计这类日常处理大量长文档的领域,未来 12-18 个月工具形态可能变化,值得提前关注。
对消费市场:普通用户继续用 ChatGPT、文心一言、豆包就好。但要留意——如果本地 AI 真的普及,云端订阅制的商业模式会面临改写压力。