我们看到一个有意思的数字:一位开发者用 Anthropic 的 Claude(当前最强的 AI 编程助手之一)花几天时间改写了 Splash 开源推理引擎,让它专门适配苹果 M5 Max 芯片。结果——并发请求最高提速 50%,单请求提速约 25%。这件事不只是 Mac 跑 AI 更快,而是 AI 现在已经能写出足够好的底层性能代码。
这是什么
Splash 是让大模型在 Mac 上本地跑起来的关键软件(类似"驱动"),属于本地推理(不依赖云端服务器、在自己电脑上运行 AI 模型)生态里较快的引擎。这位开发者 fork 了 Splash(意思是"复制一份原代码、自己改造"),针对 M5 Max 的 40 核 CPU 做了四件事:
第一,用 Splash 自带的 tuner(自动调参工具)专门为 M5 Max 选最优计算路径,单请求速度提升约 20%。第二,给 M5 的 tensor unit(矩阵计算加速单元,AI 推理的核心硬件)写了新的 verify kernel(验证计算正确性的底层程序),并发时提速 10-19%。第三,给 35B 参数量级的 Qwen3.6 模型调优,并发提速 18-22%。第四,借鉴 TensorFold 的写法,让模型重写已知文本时直接复制原片段,整文件编辑提速最高 42%。
实测下来,生成速度从每秒 45-51 个 token(AI 处理文字的最小单位,可理解成"字")提升到 56-64 个,质量没变,结果比特级一致。
行业怎么看
支持的声音认为,本地推理的天花板又一次被推高。中小公司、研究机构、对数据敏感的金融医疗法律团队,过去要么付高价买云厂商算力,要么忍受本地慢速——现在多了一个"Mac 工作站 + 优化引擎"的选项。
需要冷静的声音也有不少:
第一,M5 Max 截至发稿没有正式发布,数据来自开发者在测试机上的自测,不能简单等同于消费级真实体验。第二,Splash 这类引擎极度依赖社区维护,开发者愿不愿意长期跟 M5 系列同步是个问号——一个人的 fork 没有 SLA。第三,跑 4-bit 量化(把模型压缩到四分之一大小,代价是精度下降)能换到的速度,对企业生产环境够不够用要打问号,很多场景下吞吐量和精度要同时兼顾。
更值得讨论的是这位开发者的工作方式:性能调优、写代码、跑分测试一气呵成,几天交付。AI 写性能敏感代码的水平,已经过了"能跑"的阶段,开始进入"能调优"的阶段。
对普通人的影响
- 对企业 IT:私有化部署大模型的硬件成本可能继续下行,但要评估 Mac 集群的兼容性和长期维护风险。
- 对个人职场:在 Mac 上跑本地 AI 助手处理文案、代码、报告这类任务,会越来越接近云端体验,不必每次都联网。
- 对消费市场:带 NPU(神经网络处理单元,专用 AI 加速芯片)的消费电脑会成为新标配,但短期对多数人影响有限,更多是给"经常跑模型的人"准备的。