本周 Reddit LocalLLaMA 板块一条帖子引发关注:一位用户把阿里通义千问(Qwen)的 27B 参数模型跑在两张消费级显卡(RTX 3090 和 RTX 3060,玩家常用的型号)上,连续 20 小时做 Agent 编程——让 AI 自主拆解任务、调用工具、修改代码,而非简单问答。整个过程速度稳定在 60-63 tokens(token 是大模型处理文字的最小单位,中文大致 1-2 个字对应 1 个 token)每秒,没有崩。

这是什么

Agent 编程是这两年大模型行业的重点方向:AI 不只是回答问题,而是能拆解任务、连续执行、多步操作,比如「帮我修这个 bug 并跑测试」。 过去能做这件事的,主要是闭源大模型(不公开模型权重、只能通过 API 付费调用,如 GPT、Claude),或需要企业级显卡(A100/H100,单张十几万人民币)。这次有意思的是两件事同时成立: 第一,27B 参数的 Qwen 经过量化(quantization,把高精度参数压缩到低精度以减小体积)后,能在两张二手消费级显卡上稳定工作 20 小时。 第二,它干的不是聊天,而是 Agent 类任务——这是 2025 年被普遍认为「需要更大模型」才能做好的领域。

行业怎么看

支持者的判断很清楚:开源模型(公开模型权重、可免费下载和修改)正在逼近闭源的能力天花板,而成本结构完全不同。本地部署意味着数据不出门、不按 token 计费(按调用量付费)、不会被服务方断供。 但需要冷静的一面:这是一个用户自发的非标准化测试——20 小时不崩不代表生产环境稳定;60 token/s 对长任务依然偏慢;个人显卡的显存和算力天花板有限,复杂 Agent 任务依然吃力。「能跑」和「能商用」之间还有相当距离,对中小企业 IT 选型来说,不宜把这个单一案例当作采购依据。

对普通人的影响

企业 IT:中小公司、做敏感数据的团队,可以开始认真评估「本地部署开源模型 + 自建 Agent」的方案,不再完全依赖海外 API。 对个人职场:懂技术的白领有了低门槛实验场——一张二手 RTX 3090(现价大约三四千块)就能跑 27B 级 Agent,不必向公司申请 API 预算。 对消费市场:硬件厂商、模型压缩工具、私有部署服务商是这条线索的潜在受益方;普通用户的日常感受短期不会变,本地跑 Agent 仍是少数技术爱好者的游戏。