这周我们注意到一个有意思的进展:一位独立开发者(GitHub: npanj)发布了一套名为 Slipstream 的推理引擎(专门用来驱动大模型吐字的程序),让 95.5GB 的开源大模型 Qwen3.8-Flash-Next 在 64GB 统一内存的 Mac 上跑到 41-52 token/s(每秒吐出的字片段数),比主流方案 llama.cpp(开源社区最常用的本地推理引擎)快 76%。
关键是数据——在 3,086 次真实编程请求测试里,速度稳定在 33-44 token/s,即使上下文(context,模型一次能“读”多少字)拉到 13 万 token 也不掉。此前 llama.cpp 同样硬件、同等长度已显著变慢。
项目完全开源,模型和引擎都可直接下载。意味着 13 万 token 的长文档、长代码库处理,在一台普通价位的 Mac 上就能本地完成。
这是什么
Slipstream 本质上是一个针对 Apple Silicon(苹果自研芯片)重写的 C++ 推理引擎。它做了两件事:一是把超大模型分块放在 SSD 上边读边算(专家流式加载),二是用投机式解码(让一个小模型先猜、大模型再验证,减少计算量)来提速度。两项叠加,速度和稳定性同时提升。
模型 Qwen3.8-Flash-Next 是 Qwen 团队的稀疏架构实验版(MoE,即“混合专家”,模型由许多“子专家”组成、每次只调动其中一部分),95GB 是因为参数总量大但单次激活比例低。
行业怎么看
正面声音认为这是 Apple Silicon AI 生态的里程碑——统一内存架构(CPU 与 GPU 共享同一块内存)配合 SSD 流式读取,首次让消费级硬件具备了“端侧大模型”(在本地设备上运行、不依赖云端)的实用速度。
但反对意见同样明确:95GB 模型要从 SSD 反复读取,本质是用硬盘 I/O(输入输出吞吐)换 GPU 时间,对 SSD 寿命和系统响应有隐性压力;项目单人维护,无 SLA(服务等级承诺)、无企业支持;Qwen3.8-Flash-Next 是为稀疏架构定制的实验性模型,在真实业务负载上的适用性尚未验证。一种更冷静的看法:这是工程师的优秀作品,离企业级部署标准还差两三年。
对普通人的影响
对个人职场:以后敏感文档(合同、内部报告、客户数据)可以不出本机就跑大模型,不用担心上传云端。但要自己装命令行、配权限、调参数——目前还属于“会 Python 的人”的福利。
对企业 IT:一台 2-3 万的 Mac 工作站,理论上能跑出接近云端小模型的生产力。对数据合规要求高的行业(金融、医疗、政务)这是值得跟踪的成本选项,但还不到上生产环境的程度。
对消费市场:Mac 卖“AI 生产力”的叙事有了真实背书,但离消费者开箱即用还很远。2026 年我们更可能看到的,是云厂商把这种能力打包成“一键包月”的托管服务卖给中小企业,而不是个人装机。