开发者 A-Rahim 这周宣布:用推测解码(speculative decoding,简单说就是"小模型先猜、大模型只负责核对")让 Meta 上月发布的 Muse Glimmer 30B 模型在 M4 Pro 笔记本上提速最高 3.3 倍,输出和原版完全一致。这事为什么值得关心:本地跑大模型开始从极客玩具变成"普通人也能上手"的工具。
这是什么
项目叫 mlx-dspark,开源放在 GitHub。A-Rahim 在他的 M4 Pro 上实测:8-bit 量化版本从 8.2 token/秒(每秒生成的文字片段数)提到 18-26 token/秒——数学场景 3.27 倍、代码 2.5 倍、聊天 2.22 倍。关键是大模型会逐 token 核对草稿,所以输出和原模型一字不差,相当于用 4-bit 的资源跑出了 8-bit 的效果。
行业怎么看
正面看,这是开源社区反超大厂的一次示范。Meta 自家的 DFlash 在 Mac 上只能做到 1.5-1.8 倍,而且限于 4-bit 版本。
但我们要指出三个限制。第一,30B 参数(粗略理解为"模型脑细胞规模")对硬件不友好,8-bit 跑起来约 40GB 内存,意味着你得有 48GB 统一内存的 Mac——M4 Pro 高配或 M4 Max 起,价格两万出头。第二,token/秒从 8 提到 26 听着不错,但云端 API 动辄上百,本地跑的优势在隐私和长期成本,不在响应速度。第三,这套优化只对 Apple Silicon 有效,绝大多数 Windows 用户暂时用不上。
对普通人的影响
对企业 IT:如果客户数据敏感到不能上云(医疗、法律、内部财务),本地大模型开始变成可选项——买几台高配 Mac 当推理服务器,长期看可能比持续付云 API 划算。
对个人职场:暂时不用动。本地跑 30B 只是"能跑",离"好用"还远。除非工作高度涉密,否则云端 API 仍是更省心的选择。
对消费市场:值得留意一个长期信号——"AI 友好"会成为笔电的新卖点。今天 48GB 内存要加价上万,明天可能就像当年独立显卡一样变成标配。