这是什么

本周 Reddit 一位用户做了对照测试:把同一段代码修复任务分别交给阿里通义(Qwen)两个本地模型——Qwen 3.8 27B(参数量 270 亿的「小模型」)和 Qwen 3.8 Flash Next(阿里最新主打「快速响应」的版本)。

结果反直觉:27B 用 5-10 分钟完成修复;Flash Next 跑了 2.5 小时。用户事后看时间线发现,Flash Next 实际约 30 分钟就把代码改完,剩下的两小时在反复跑测试、再无新动作。

背景:用户用双 RTX 5090(英伟达消费级旗舰显卡)本地跑模型;自承不是程序员,代码本身是 AI 生成的,他只是让 AI 修 AI 的代码。

行业怎么看

支持「小模型够用」的解读正在增多。这佐证了过去半年开源社区的观察——在不少真实任务上,规模适中的模型性价比反而压过参数更大、生成更快的旗舰。对部署成本敏感的企业 IT,这是好消息。

但反向声音至少有三条。其一,这是单次测试、单台机器、单一任务,不足以得出「小模型全面胜出」;Flash Next 的设计目标可能是更复杂、需要多轮自我验证的任务,在简单 bug 修复上反而杀鸡用牛刀。其二,那「浪费」的两小时未必真浪费——如果它在跑更严格的边界测试,在生产环境可能更稳妥。其三,用户自承对编程不熟,无法判断两份修复方案的质量是否真的等价。

我们倾向于把这件事归为「信号」,不是「证据」。它提示:评估 AI 工具时,「每秒吐多少字」正在变得不那么重要,真正该看的是「任务从开始到能用的总时长」。

对普通人的影响

对企业 IT:选模型别只看「参数大、跑得快」,更要看任务闭环时间。引入 AI 助手做代码、数据处理时,第一周做小规模 A/B(两组对照)测试,比直接采购旗舰款更稳。

对个人职场:使用 AI 工具时,「快」不等于「完成」。如果它长时间不输出新东西,不一定是偷懒——可能在做内部校验,可考虑主动打断或换模型试试。

对消费市场:普通用户写代码、做 PPT,不必追「最强模型」。中端模型在多数日常场景已够用,省下的可能是订阅费,也可能是等待的耐心。