一个数字:50 tokens/秒——本周开源项目 Splash 1.1.0 在 Apple Silicon 上做到了本地流畅运行 270 亿参数大模型。这意味着企业不必再为每一次 AI 调用向云端付费。

这是什么

Splash 是 incoai 团队开发的 Apple Silicon(苹果自研 M 系列芯片)本地 AI 推理引擎。本周 1.1.0 版本新增对 GGUF(一种开源模型压缩格式)和 MLX(苹果官方机器学习框架)的支持。

Reddit 用户实测显示:在 64GB 内存的 M5 Pro 上运行 Qwen3 系列 270 亿参数模型(参数可粗略理解为模型的"脑容量",270 亿属于中等偏上水平),可达约 50 tokens/秒(大致相当于人流畅阅读的速度)。

行业怎么看

支持者称这是 Apple Silicon 本地推理的"突破"。一位用户写道,这是他第一次在 Mac 上感到 agentic 设置(让 AI 自动完成多步任务)真正可用。

但我们注意到几个保留意见:

  • 实测机型是售价 2 万+ 的顶配 M5 Pro 64GB,绝大多数用户触达不到
  • 270 亿参数模型在回答质量上仍弱于云端千亿参数旗舰
  • 项目早期,社区规模小,长期维护存疑
  • 本地推理仍以极客玩家为主,主流企业 IT 部门尚未真正介入

对普通人的影响

对企业 IT:敏感数据(合同、客户、内部文档)有了"不出公司"的 AI 处理路径,金融、医疗、法律行业可以重新评估是否要把所有调用送云端。

对个人职场:知识工作者未来可能在公司配的 Mac 上直接跑自己的 AI 助手,出差、离线场景下的可用性会显著提升。

对消费市场:本地 AI 普及后,"每月 200 元的 ChatGPT 会员"未必还是必选项,苹果等硬件厂商可能成为新的受益方。