海外一位用户在 RTX 5090(约 1.6 万元人民币的消费级显卡)上跑通阿里通义千问团队发布的 Qwen3.8-Flash-Next 模型,解码速度 40 token/秒,显存只用掉 27GB。值得关心的是:这个数字意味着,一台万元级台式机正在具备运行千亿参数大模型的可能——本地 AI 从极客玩具开始向实用工具靠拢。

这是什么

本周 r/LocalLLaMA 论坛一位用户用一块 RTX 5090 加普通 NVMe 固态硬盘,跑通了 Qwen3.8-Flash-Next 模型。解码速度 40 token/秒(token 是模型处理文字的最小单位,约对应一个汉字),显存只用掉 27GB。

这个模型采用了"混合架构"——一部分参数从 SSD 流式读取,不要求全部装进显存(GPU 自带的运算内存)。过去认为"必须堆 H100 服务器"才能跑的千亿参数大模型,现在可能装进一台高端台式机就跑得动。

行业怎么看

支持者认为这是开源阵营对闭源云端的一次重要回击:本地部署意味着数据不出门、月费变电费、长期成本可控。对金融、医疗、法律这类受合规约束的行业,吸引力尤其大。

但反对声音同样值得听。一位长期关注本地推理的开发者指出:40 token/秒的生成速度,意味着打一千字要等半分钟,体感远不如云端 GPT-4o 或 Claude 的流式响应;而 RTX 5090 加 64GB 内存的整机成本超过两万,回本周期不短。更关键的是,模型本身仍是几周前的快照,云端模型每周迭代的能力差距,本地部署要自己追。

对普通人的影响

  • 对企业 IT:数据敏感或受合规约束的中小企业,多了一种不依赖海外 API(应用编程接口)的备选方案,但运维门槛仍是真问题。
  • 对个人职场:技术爱好者的"玩具门槛"在降,但要把它变成生产力工具,仍需要工程化能力,普通文职白领现阶段用云端更省事。
  • 对消费市场:高端显卡和大容量 SSD 短期内仍是受益方,但若本地 AI 真正普及,云端订阅服务的定价权会被削弱。