本周 Reddit 用户 WonderRico 在 r/LocalLLaMA 板块放出一份针对阿里开源模型 Qwen 3.8 27B 的本地实测。值得关心的不是分数本身,而是它在「Agentic Coding」(让 AI 自主规划并执行写代码任务)场景下,用「中等推理强度」跑出了比上一代 3.6 更低的请求数(一半)和更少的生成 token(少三分之一),整体效率追平 DeepSeek Flash 量级。模型参数 270 亿,能在单张消费级专业显卡上跑起来。

这是什么

这份报告和我们看过的 Chatbot Arena 跑分不太一样 — 它专门针对 Agent 写代码(即给 AI 一个目标,让它自己拆解、写代码、调试、跑测试),测试了不同量化精度(即将模型参数压缩以降低显存占用的技术方式)、推理引擎以及推理强度档位下的表现。核心结论:Qwen 3.8 27B 在「medium 中等推理强度」下,任务完成率比 3.6 更高,但所需请求数几乎减半、生成 token 减少约三分之一。这意味着同样写完一段代码,新版本硬件成本和时间成本都更低。模型本身的 27B 参数规模,确保它能在单张 RTX 4090 或类似显卡上完成本地部署。

行业怎么看

积极的一面:中国开源模型在「Agent 写代码」这一具体任务上,已经可以和 DeepSeek 闪速级别正面对抗。对于金融、政务、制造业这些不能把代码上传到云端的企业,本地跑 AI 写代码从「理论上可行」变成了「可以开始试用」。

需要冷静的点是两个:第一,阿里主推的「xhigh 极强推理」模式在实测中并未带来明显的能力提升,反而用了接近 4 倍的 token — 营销话术和真实跑分之间存在温差,企业采购时不要被「最强模式」标签迷惑。第二,这只是一份社区级个人跑分,样本、任务设计、对比基准都未经同行评审;更值得注意的是,测试中 NINFER(一种本地推理引擎)版本还出现了模式配置异常的 bug,说明本地推理引擎生态仍不成熟,出现诡异结果时大概率是工具问题,不是模型本身问题。

对普通人的影响

对传统企业 IT:27B 级别的模型能在自有服务器上跑,意味着数据合规要求高的行业(金融、医疗、政务)可以不上云就用 AI 写代码,这是过去一年最大的工程门槛被实质性削低。

对个人职场:写代码、跑数据分析的人用这类工具时,单次任务成本会显著下降(少一半请求 = 便宜一半),但也会迫使一部分「只会写模板代码」的中初级岗位向「会审查、会调试 AI 输出」转型。

对消费市场:短期内影响有限,但当 AI 写代码边际成本接近免费时,企业内部的 SaaS 软件支出会开始收缩,这部分成本传导到消费端大概需要 12-18 个月。