这是什么
本周我们注意到一组值得记下来的数字:阿里通义千问 Qwen3-27B 模型(NVFP4 4-bit 量化——把模型参数从高精度压缩到 4-bit 以减小体积、加快推理)跑在单张 RTX 5090 上,45 万 token 上下文、每秒 120 token、保留视觉能力、整机 400 瓦。以前要堆多卡服务器的中端模型,现在一张消费级显卡就够了。
具体配置由开发者 u/t4a8945 在 Reddit LocalLLaMA 板块公开:
- 上下文长度:单会话 19.6 万 token,全局 KV 缓存 45.1 万 token(KV-cache 是模型「短期记忆」区,越大能处理越长文档)
- 速度:平均每秒 120 token,最快档(4K 上下文)达每秒 1.3 万 token
- 功耗限制:400 瓦,相当于一台普通台式机满负载
- 附加能力:保留视觉理解,支持 3 路并发会话
RTX 5090 是英伟达 2025 年初推出的消费级旗舰显卡,零售价约 1.6–2 万元人民币。
行业怎么看
支持方把这组数字解读为本地化部署的「米价拐点」。过去企业想私有化一个中端大模型,要么走云厂商租赁(年付数十万到百万级),要么自建多卡服务器(硬件投入百万级)。现在 2 万元以内的显卡就能跑出可用的 27B,门槛降了一个数量级。对数据敏感行业(金融、医疗、政务),本地推理(让模型在自家服务器上跑、数据不外传)从此具备真实可行性。
但反对意见同样值得听。其一,NVFP4 是英伟达独占的 4-bit 格式,只支持 RTX 50 系及更新的 Blackwell 架构,老显卡跑不了;其二,作者自己也承认 vLLM(开源推理引擎)首次配置「not user-friendly」,普通 IT 团队搭不起来,需要懂 Linux 和推理优化的专人;其三,27B 只能算「中端」,真正的前沿模型依然只能跑在云端;其四,400W 长期运行每月电费约 300 元,对比云 API 月费不一定省钱。
对普通人的影响
- 企业 IT:2–3 万元硬件即可跑出「够用」的本地模型,但运维成本和人才缺口可能比硬件还高;建议先做小规模试点。
- 个人职场:程序员、独立咨询等可以用本地机器处理敏感代码或客户数据,不上云;非技术岗位暂时无需关心。
- 消费市场:笔记本端(RTX 5090 移动版)尚未普及,「个人 AI 主机」今年不会进入主流;等移动版上市后才值得普通人重新评估。