通义千问 27B 模型(参数可粗略理解为"脑容量",27B 即 270 亿)这周在单张消费级显卡 RTX 3090 上跑到 138 token/秒(token 即模型处理的最小文字单位)——三周前还只有 82,本地大模型的成本曲线正被开源社区悄悄拉平。这位开发者同时给出:64 路并发(同时处理多个用户请求)峰值 942,长对话第二轮延迟从 23 秒压到 1 秒。
这是什么
速度之外更重要的是第二轮延迟。23 秒到 1 秒意味着本地 AI 助手从"等得起"变成"用得顺"。这来自四项工程优化:一次预测多个 token、复用对话开头、复用历史中已生成的片段、给混合架构(同时含 Transformer 和 Mamba 两种神经网络)做缓存。每一项都和模型能力无关,只关乎"怎么把模型跑得更快"。
行业怎么看
支持方会说:这印证了一个判断——本地大模型的成本曲线正被开源社区悄悄拉平。一张 24GB 显存的消费卡(市场价约 1500-2000 元)已经能撑起中型团队的内部 AI 助手,电费可能比云端 API 月费便宜一个量级。
但我们也要冷静:这是单一开发者在自家机器上的调优结果,生产稳定性、长上下文可靠性、模型本身能力边界都未经规模验证;RTX 3090 被限在 250 瓦功耗下,散热和噪音是真实问题;阿里对推理侧投入远少于训练侧——几乎所有优化都来自社区而非官方。一个 Reddit 帖子不等于一个产业拐点,但方向是清楚的。
对普通人的影响
对企业 IT:自建 AI 助手的硬件门槛正从"机房级 GPU"降到"桌面级显卡",今年值得重新算一笔总拥有成本(电费、折旧、人力加总)。
对个人职场:长对话延迟一旦做到 1 秒级,本地 AI 写代码、改文档、整会议纪要的体验会接近 ChatGPT,而数据不出门——对律师、医生、研发岗是第一次"真正能用"。
对消费市场:能跑 27B 模型的显卡从"游戏卡"变成"小公司服务器",二手 RTX 3090 行情值得观察。