开发者给 40 核 M5 Max 重新调了一遍推理引擎的内核(最底层的运行规则),让本地大模型在 Mac 上的生成速度又快了两成。数字不显眼,但暴露了一个被掩盖的成本——苹果芯片想跑赢 AI,每代硬件都得手工作业一遍。
这是什么
引擎叫 Splash(一种让你电脑直接跑大语言模型、不靠云端的本地推理程序)。它的默认参数本来是在 16 核、20 核 M5 和 32 核 M4 Max 上测出来的,搬到 40 核 M5 Max 上反而不是最优解。
开发者用一种叫「split-K」的排布——把每一行计算拆成四份并行、最后再合并——专门优化了模型生成文本那一步(业内叫 decode,即逐字吐出回答的过程),拿到了 +20% 的速度。
工具已经开源(GitHub: incoai/splash),但门槛不低:要 macOS 26 + Xcode 26 从源码编译,跑完自动测试还得人工确认结果,定位仍是极客向。
行业怎么看
正面判断:Apple Silicon(苹果自研芯片)在 AI 推理上有结构性优势——统一内存让 CPU/GPU 共享大容量显存,能效比高,是少数能在笔记本和工作站级别跑 700 亿参数模型的消费硬件,市场稀缺。
但反对和风险也很明确:
- 不是免费午餐:+20% 是用「每代芯片都得手调一次」换来的,普通用户根本玩不转。
- 速度优势很快被吃掉:模型本身迭代飞快,新一代模型出来,Splash 这种调优红利可能几个月就被抹平。
- 生态被切碎:苹果只支持自家 Metal 接口(类似 NVIDIA 的 CUDA),开发者不能用一套通用代码覆盖所有平台,工作量翻倍。
硬件赢在起点,软件生态正在拖后腿。
对普通人的影响
对企业 IT:采购评估多一栏——能不能本地跑 100 亿以上参数级模型,开始成为选型指标,尤其涉及敏感数据、不能走云的场景。
对个人职场:一台 3 万元左右的 M5 Max Mac 跑本地大模型,开始从「极客玩具」变成可选项;但目前仍要求你会编译代码,离插电即用还有距离。
对消费市场:Mac 作为「AI PC」的故事有了新论据,但短期受众仍是开发者小圈子;苹果要真走通这条路,得像当年吸引 iPhone App 开发者那样,把工具链再降一层。