218 tokens/秒——本周Reddit LocalLLaMA社区一位开发者用两张消费级RTX 3090(单卡24GB显存,二手约3000元),把阿里千问团队的27B参数大模型(Qwen3.8-27B)跑出了这个单请求解码速度。值得关心的是,原本需要H100(英伟达数据中心级GPU,单卡约25万元)集群才能流畅运行的负载,如今落到了两张消费卡上。

这是什么

发帖人把模型量化(用更低精度存储参数,牺牲少许精度换体积和速度)到INT4(4位整数),用vLLM(开源大模型推理框架)+ DFlash2(投机解码草稿模型:让小模型先猜词,大模型再批量验证)提速。峰值显存22.3 GB/卡,总占用约45 GB,逼近两张3090的极限。预填速度(即模型"读完"提示词的速度)在1万token输入时达1342 tokens/秒。值得注意的是,DFlash2草稿模型本身就要吃掉约13.5 GB显存——空间是被精巧腾挪出来的。

行业怎么看

乐观者认为这是大模型"民主化"加速的信号:很多企业推理场景,几十万消费级显卡就能顶住,不必一上来就上百万的H100集群。但我们也要泼一盆冷水——发帖人自己fork了vLLM打了补丁才跑通,本质是极客成果,不是开箱即用方案。INT4量化会损失精度,金融、法律、医疗等严谨场景未必适用。另一个被忽视的风险是:两张3090靠PCIe总线和打了补丁的P2P通信,长时间高负载下的稳定性如何,发帖人没交代。

对普通人的影响

对**企业IT**:涉及内部文档问答、摘要这类对精度容忍度较高的任务,先用两张3090跑通验证再决定是否上云,可能更省,也能避开数据外传的合规风险。 对**个人职场**:客户合同、内部数据等敏感信息处理,本地27B模型开始变得可用,但前提是愿意投入硬件和调试时间。不愿折腾的,云端方案依然更现实。 对**消费市场**:硬件成本一旦下沉,下一代家用AI盒子、AI工作站会继续降价,按月订阅的AI服务定价也会被进一步压低。