本周 r/LocalLLaMA 上一位开发者晒出数据:他把 Qwen-Flash-Next(q4 量化版本)跑在自己的 64GB M5 Mac mini 上,达成 17.5 token/s 解码速度,但 27% 的时间 GPU 在空转——等 SSD 把需要的专家模块读进来。

这个数字背后,是一个被反复回避的事实:本地跑大模型的硬件门槛,远比厂商宣传的高。

这是什么

Qwen-Flash-Next 是个 MoE(Mixture of Experts,混合专家)架构的模型。可以把它想象成一家公司里有几十个专家员工,每次回答问题只调用其中几个,所以总参数虽大,每次推理并不需要全部加载。

但即便是 MoE,整个模型依然超过 64GB。这位开发者的做法是:把最常用的专家留在内存里(命中率 75%),其余的从 SSD 流式读取,相当于用硬盘当扩展内存。结果是 SSD 比内存慢太多,GPU 经常等米下锅。

行业怎么看

社区把它当成里程碑:390 token/s 的预填充速度、72% 的预取准确率,已经逼近消费级硬件的天花板,靠软件优化硬生生把不可能变成可能。

但反对意见同样清醒。云厂商会指出,这种方案意味着单次推理延迟不可预测、稳定性差,根本服务不了真实业务。一位 AI 基础设施工程师私下告诉我们:跑得起来和跑得能用是两回事,企业不可能让客户等 SSD 加载。值得警惕的是,开源模型迭代太快,今天的优化下个月就可能作废。

对普通人的影响

对企业 IT:想本地部署大模型的公司要重新算账。一台 64GB Mac mini 已是两万多元人民币的勉强够用档,离生产级还差很远。

对个人职场:在 Mac 上用 AI 工具是可行的,但别指望替代云端——速度、稳定性和成本都不在一个量级。

对消费市场:厂商力推的 AI PC 概念,还要再等一两年硬件迭代,才能真正装得下顶级开源模型。