本周有人用两张 RTX 5090 显卡(约 3 万元)+ vLLM 推理框架(vLLM 是开源的大模型推理加速工具,原本主要服务企业云端部署),跑通了阿里通义千问(Qwen)27B 参数开源模型。这件事值得关心,是因为本地大模型从「只能跑 7B 小玩具」升级到了「27B 能干活」的阶段,硬件门槛实质性下移。
这是什么
这件事发生在 Reddit 的本地大模型社区 r/LocalLLaMA 上。用户配置是 CachyOS(一个性能向 Linux 发行版)+ 两张 RTX 5090 + vLLM。
vLLM 把请求批处理、显存调度做了工程封装,过去主要服务企业云端,现在能跑在消费级硬件上,意味着「工业级推理体验」不再是大厂专属。
27B 在开源模型里属于中等身材——比 7B、8B 强一档,能处理复杂写作、代码、文档分析;又比 70B 旗舰小一圈,硬件扛得住。这个量级被业内视为「本地能跑 + 真的能用」的甜点区间。
行业怎么看
开源阵营普遍兴奋。Qwen、Llama、Mistral 等开源模型快速迭代,配合 vLLM 这类工具,「在家跑 AI」从技术演示变成可选项。本地部署好处明确:数据不出门、长期成本可控、不被云厂商 API 涨价绑架。
但冷静声音也不少。第一,27B 在严肃场景(法律合同、医疗诊断、金融分析)的准确度仍不如云端旗舰,本地跑得动不等于跑得好。第二,企业真正关心的是运维稳定性——模型更新、显存管理、故障排查都需要专人维护。第三,两张 RTX 5090 加起来近 3 万元,加上电费和折旧,对中小企业未必比订阅云服务划算。
还有一层隐忧:消费级高端显卡本身供货紧张、价格虚高,如果本地 AI 真普及,硬件供需矛盾会被进一步放大。
对普通人的影响
对企业 IT:金融、医疗、政府等数据敏感行业多了「不上云也能用 AI」的备选方案,但更适合有技术团队的公司,普通中小企业直接上 27B 本地部署仍偏激进。
对个人职场:开发者、研究人员、内容创作者可以在自己的工作站跑更强大的模型,省下 API 调用费;普通员工暂时用不到,工作场景仍以云端工具为主。
对消费市场:短期会拉动一波高端显卡和工作站销量,长期看 AI 硬件可能分化出「训练卡」和「家用推理卡」两条产品线,普通消费者不必现在就升级设备。