我们注意到一组数字: 在 35 个"一次生成"(oneshot, 即给一次指令就出成品)任务测试中, 阿里通义千问 27B 模型的三个版本, 平均得分从 2.46 爬到 2.74, 再到 3.00。三代之间的进步幅度不大, 但方向稳定——开源大模型没有撞墙。

这是什么

这次测试来自 Reddit 的 LocalLLaMA 社区, 比较的是 Qwen 27B(参数规模 270 亿, 可以在单张消费级显卡上跑)三个版本, 看它们"给一次指令就生成可用的代码或图像"的能力。

具体看: 旧版本画不出像样的鹈鹕, 新版本画出来了; 旧版本写不出能玩的 2048 小游戏, 新版本可以; 旧版本画不出 Wolfenstein(德军总部)那种简单 3D 场景, 新版本能大致还原。评测由 Claude 系列模型打分。

这些事情听起来像玩具, 但"一次到位"的能力对企业 IT 是硬指标——客户不会等你 debug 五轮。

行业怎么看

支持的声音: 27B 这个尺寸持续进步, 说明开源大模型没有撞墙, 阿里的迭代节奏稳健, 对不愿把数据交给闭源 API 的公司来说是个好消息。

反对的声音也得说: 35 个任务、用大模型给大模型打分, 样本量和方法学都比较粗——2.46 到 3.00 是真实进步, 还是评分模型的随机波动? 一些从业者私下认为, "用 Claude 评 Qwen"这种评测本身就有系统偏向。社区里流传的 Qwen3.5/3.6/3.8 版本号也并非阿里官方正式发布, 严谨度要打个折。

对普通人的影响

对企业 IT: 27B 级别模型可以在公司自有机房部署, 数据不出门, 对金融、医疗、制造业是个比"上云调用 API"更安心的选项——这条新闻说"接近够用", 但还没到"放心用"。

对个人职场: 写代码、做原型这类工作的"一次性成功率"在缓慢提高, 你可能不需要再花一下午帮 AI 改 bug 了, 但也别指望它现在就替代程序员。

对消费市场: 短期内, 你手机里的 AI 助手、客服机器人不会有明显变化, 它们多数还跑在更小或更旧的模型上; 模型升级传到消费端, 通常有 6-12 个月的延迟。