这周 Reddit LocalLLaMA 上一个数字值得记住:65 token/s。一位开发者用自写的推理引擎,把阿里开源的 Qwen3.8-Flash-Next 模型在一张 12GB 的 RTX 5070 上跑出了每秒 65 token 输出、430+ token 读取。这个速度比普通人阅读速度(4-5 token/s)快 10 倍以上。

这是本周我们看到的最有信号意义的本地化突破之一。不是因为 65 这个数字本身,而是因为 12GB 显存是大量已有笔记本和工作站的标配。当这个门槛被踏过去,「本地跑得动一个能用的开源大模型」就从极客玩具变成了普通知识工作者的可选项。

这是什么

这位开发者针对 Qwen3.8 模型专门写了推理引擎(让模型真正「跑起来、吐出文字」的程序),配合 RCO-GSQ 这种 2-bit 量化技术(量化 = 把模型参数压小,让小显卡也能跑),让原本要专业显卡的模型挤进了一张 4000-5000 元的游戏显卡。已开源、一键安装,目前仅支持英伟达。

它验证了一条路径:开源权重 + 社区专门优化 + 消费级硬件,本地 AI 的成本曲线在快速下降。

行业怎么看

支持者判断直接:中国开源模型叠上全球社区优化,本地 AI 的成本下降比云端 API 更陡。5000 元显卡 + 64GB 内存就能跑出接近云端体验,对私有部署敏感的中小企业有现实意义。

但我们注意到两个反对声音。第一,65 token/s 是在 Q2_0 这种极端量化下实现的,模型回答质量相比原版有明显折损——「跑得动」不等于「跑得好」。第二,「一个人针对一个模型写一套引擎」的工程模式是脆弱的,开发者本人的精力决定它能不能持续维护,云端 API 的稳定性优势仍在。

对普通人的影响

对中小企业 IT:有数据不能上云的硬约束,5000-8000 元就能搭一个可用的本地 AI 工作站,不再是「几十万起步」。

对个人职场:程序员、研究员、分析师用一个周末加一张消费级显卡,就能自建不联网的 AI 助手处理敏感文档。

对消费市场:要让 AI 进入普通家庭,光「跑得动」还不够,还要「装得上、跑得稳、用得起」。今天的 65 token/s 是技术拐点,不是消费拐点。