这是什么
mlx-dspark 是一个开源工具,把 DeepSeek 的"投机解码"(speculative decoding)技术移植到苹果芯片上。所谓投机解码,是用一个略小的模型先猜几个 token,大模型只负责验收——猜对了就批量放行,所以同样算力下速度能翻倍。
实测数据来自开发者本人:在 M4 Pro 48GB 笔记本上跑 Qwen 27B(阿里通义千问的中等尺寸开源模型),8-bit 量化下平均提速 2.45 倍,代码任务最高 3.18 倍,每秒生成约 20 个 token。最关键的是,输出 token 与原始解码完全一致——"无质量损失"是逐 token 比对验证的,不是宣传话术。
项目附带一个原生 Mac 应用和兼容 OpenAI / Anthropic 协议的本地服务器,意味着你能用 Claude Code 的界面,但后端跑的是本地 Qwen。
行业怎么看
乐观派看到的是:本地大模型第一次接近"日常够用"。二十几 token/秒对代码、文案、翻译等迭代型工作流不再是"卡到怀疑人生",加上数据不出本地、零 API 费用,对中小企业和受监管行业(医疗、法律、金融)的吸引力是真实的。
我们提醒三条保留意见。第一,27B 仍是大模型,显存门槛高,非苹果 M 系列芯片用户基本无感。第二,3 倍提速是峰值,真实使用波动大,工程体验仍远不如直接调云端 API。第三,这是工程优化,不是模型能力突破——Qwen 27B 本身的智能上限没变,能解决的问题没变。
对普通人的影响
对企业 IT:合规与成本账可以重算了。以前"本地跑大模型"是奢侈品,1-2 万块的 Mac mini 集群方案第一次有了讨论价值。
对个人职场:写代码、做长文档翻译等需要来回迭代的任务,本地化后延迟和隐私顾虑都下降。但"Mac 能跑"不等于"Mac 够用",它能跑不等于比云端便宜。
对消费市场:苹果"AI PC"叙事第一次有了实锤支撑点。M 系列芯片 + 本地模型 + 原生应用,硬件-软件-模型闭环正在成形,Windows-on-ARM 阵营压力陡增。