本周 Reddit 一条实测让编辑部停下来看:阿里千问社区版 27B 模型在两块消费级 RTX 3090 显卡上几小时内一次性写完一款 80 年代复古网页小游戏 RetroCraft,包含完整 HTML、JS、CSS 代码并打包成可执行程序,平均生成速度约 71 token/秒(token 即模型处理的最小文本单位)。信号很明确:国产开源大模型在消费级硬件上跑出了可见的实用水准,本地 AI 编程开始走出极客圈。

这是什么

作者用的是本地部署:两张 RTX 3090(二手约 2000-3000 元/张,2020 年消费旗舰)+ llama-swap 模型调度工具 + OpenCode 开源编程助手。 三个关键细节: 一是规模 27B(270 亿参数),Q8 量化(从高精度压到 8 位以瘦身)。这是消费显卡"勉强够用"的临界点。 二是作者保留模型的"思考过程"(thinking tokens,推理时的内部草稿),让推理链贯穿整个任务。结果明显好于关闭该功能的版本——这是近半年开源社区的新玩法。 三是速度波动大:单轮 10-464 token/秒之间跳动。平均 71 token/秒够用,但不会永远丝滑。

行业怎么看

社区反馈普遍正面。71 token/秒属"够用"档——人眼读代码约 5-10 行/秒,AI 输出不再卡瓶颈。 但保留意见也要说: 单次成功不等于稳定复现。编程智能体(能自主规划并执行多步任务的 AI)在复杂任务上仍需反复调提示词和重试。 硬件门槛不低。两块 3090 加主机总成本 1-2 万元,且需懂 CUDA 配置、量化参数、推理调优,对非技术用户是劝退门槛。 "Qwen 3.8"并非阿里官方版本号,是社区魔改版。普通用户想复现,路径不清晰,文档和兼容性都成问题。 MTP(多 token 预测,一次生成多个文字单位提速)技术较新,跨任务稳定性还需更多样本验证。

对普通人的影响

对企业 IT:金融、医疗、政府等数据合规要求高的行业,有了"国产开源 + 本地部署"双重保障,不必再把代码传到海外 API。中小 IT 团队采购总成本比想象中低。 对个人职场:AI 编程助手可能从每月几十美元订阅(Cursor、Copilot),走向一次性硬件投入。但距离非技术用户开箱即用,还需 1-2 年产品化。 对消费市场:消费级显卡需求会增加,RTX 5090 等新品价格短期难降。