本周 Reddit 开发者用 M5 Ultra Mac Studio(96GB 统一内存)跑 Qwen 3 系列量化模型(4-bit 与 8-bit 混合量化,512k 上下文),112M tokens 的开发任务里完成 1700 次子 Agent 调度、89% prompt 缓存命中。这不是又一次跑分 — 是消费级工作站第一次跑出工程级本地 Agent 表现。

这是什么

开发者用一个 27B Qwen 模型做调度(orchestrator,即决定下一步调用哪个子任务),PC 上跑;同时把一个小模型挂在 Mac 当子任务推理服务器。两者配合完成一个完整软件开发任务:规划、写代码、测试、提交。

关键数字:4 段共 512k tokens 上下文,KV cache(推理时缓存的中间状态)占 90GB;4 路并发聚合 prefill(读上下文阶段)约 3,200 tokens/s,decode(生成回答阶段)约 170 tokens/s;89% prompt cache hit。

89% 才是重点:Agent 工作流反复回到同一段长上下文做决策,缓存命中率决定成本与速度。9 成输入是前文复用,等于每花 1 块钱推理只有 1 毛 1 是真新计算。

行业怎么看

正方认为这是本地 AI 的临界点:5 万一台机器、不上传数据、按月无限用 — 对中小企业私有化部署(把模型装在公司内网、不走云端)有真实吸引力。开源模型 + Apple Silicon 路线正在拉低门槛。

但反方意见也成立:

  • 170 tokens/s 是 4 路聚合,每路实际 43 — 聊天够用,实时语音勉强
  • 高度定制:自研推理框架、AI 辅助写量化代码、混精度策略 — 不是开箱即用
  • 任务偏向编码场景,吃到长上下文缓存红利,换成客服未必能复现

硬件到了,工具链还没到。

对普通人的影响

对企业 IT:统一内存架构让私有化部署的成本曲线正在变化。算清账:5 万硬件 + AI 工程师 vs 月费几千的云 API,看调用量。

对个人职场:现阶段对非技术用户仍是黑盒。能动手调的人拿到效率红利,调不动的人只能等厂商打包。

对消费市场:Mac Studio 不是消费品,但趋势会向下传导 — 未来两年主流笔记本可能都能跑中等规模本地模型。云端订阅费会承压。