一个开源团队这周公布了一组让算力圈重新评估边界的数字:1770 亿参数的 Qwen3.8-Flash-Next 大模型,仅靠一张 16GB 消费级显卡(RTX 5060 Ti,国内约 4000 元)加 32GB 内存和一块 NVMe SSD,就跑出每秒 9-10 个 token 的速度。这意味着过去两年的算力定价逻辑,可能需要重新讨论。

这是什么

过去两年跑大模型几乎离不开数据中心级 GPU——一张 H100 售价几十万元,企业部署私有模型先要跨过百万级硬件门槛。我们梳理下来,这次突破的关键是 SSD 流式读取。

Qwen3.8-Flash-Next 采用「混合专家」(MoE)架构——把模型拆成几十个「小专家」,每次回答只激活一部分。177B 参数里大部分平时用不上,团队把不常用的「冷」专家留在 SSD,需要时再读进显卡内存和普通内存。

最终分配:4.4GB 权重放显卡显存,6-8GB 放内存,剩下约 99GB 留在 SSD 按需读。每个 token 触发约 480 个专家,75% 命中内存,读一次 SSD 约 270MB。

速度上,每秒 9-10 个 token 已达「能看」水平;首次输入(prefill)每秒处理 49 个 token。作为对比,同一台机器上 llama.cpp(主流开源推理框架)只能跑 4.9 tok/s,差不多慢一倍。

行业怎么看

我们注意到,支持者认为这是 AI「民主化」的又一次落地:算力不再是大公司专利,中小企业甚至个人都可能跑千亿级模型。但反对声音同样值得听。

第一,硬件门槛只是看起来低。目前只支持 RTX 50 系显卡(Blackwell 架构),老显卡跑不起来;操作系统只测了 Windows 11 和 WSL2,Linux 服务器场景没覆盖;解码方式只支持最简单的逐字选最优一种,生成质量受限。

第二,真正的生产环境不是单机。电商双十一要服务几十万用户,一台家用电脑做不到;模型训练仍需算力集群,这次突破只解决「推理」(让已训练好的模型回答问题)这一环。

第三,工具链还脆弱,团队自己承认 tool call(让模型调用外部工具)还不稳定,距离企业级可用仍有距离。

对普通人的影响

对企业 IT:短期内不必推翻现有采购计划,但下次续费 GPU 云服务时,「我们真的需要 H100 吗?」这个问题可能会被更频繁地提出——部分推理任务或许用消费级硬件就够。

对个人职场:再过 12-18 个月,「在自己办公电脑上跑不联网的私有 AI」可能从极客玩具变成普通白领愿意尝试的工具——前提是显卡和硬盘换代。

对消费市场:更便宜的本地 AI 意味着硬件厂商和应用公司之间的合作可能重新洗牌,但云端大公司的优势不会立刻消失。