这是什么

我们注意到,Reddit r/LocalLLaMA 板块这周一个'猜模型'游戏被热转——用同一句话让 5 个大模型画 3D 动漫少女,结果显示开源模型(Qwen)已经跟 Claude、GPT 坐到同一张桌子上了。

具体玩法:用户用同一句提示词'make me a 3d scene of an anime girl',让 5 个大模型一次性生成结果——不允许循环迭代、不允许看图修正、不能开浏览器,纯粹拼推理能力。被测的 5 个模型包括 Claude Opus 4.7、Sonnet 4.6、GPT 5.6 Sol、Qwen 3.8 27b、Claude Opus 5(部分版本号未公开或为命名约定)。作者自己也承认这是'垃圾内容测试',但关键观察是:所有模型在这道题上都明显挣扎,3D 构图、人物比例、空间关系几乎是通用弱项。

行业怎么看

支持方认为:这种'一句话裸测'比跑 benchmark(标准测试集)更接近真实使用场景,能暴露模型在空间推理、指令遵循上的真实差距。Qwen 3.8 27b 作为开源模型能跟 Claude、GPT 同一张桌子上较量,是国内开源生态正在逼近闭源前沿的信号,Anthropic 和 OpenAI 再不能'闭门造车'了。

但反对声音明确:单一提示词测试的偶然性极大,样本量是 1。'动漫少女'这种题材本来就不是各家主力优化方向,测试结果只能说明'裸测'差距,不能说明综合能力。一位长期跑 benchmark 的从业者评论:'用 5 张图定输赢,评测公司都得关门。'

另一个值得留意的侧面信号:闭源模型出现了密集的版本号跳跃(Claude Opus 4.7、5,Sonnet 4.6,GPT 5.6 Sol),暗示 Anthropic 和 OpenAI 正在加速产品迭代节奏。对企业 IT 采购来说,这意味着模型选型的'折旧周期'在变短——签 3 年长约前要慎重。

对普通人的影响

对企业 IT:如果你们正在评估 AI 工具,把模型选型决策周期从'年'压缩到'季度'已是更稳妥的节奏。闭源厂商版本号密集出现,今天的旗舰可能半年后就被自家下一代压下去。

对个人职场:日常工作里,不同模型在'一次性生成'上的差距确实存在。内容创作者或设计师用同一提示词跑 3-4 个模型对比,已经比过去明智得多——尤其当你想用本地开源方案(如 Qwen)省成本时。

对消费市场:消费级 AI 工具(ChatGPT、Claude.ai、通义)的'开箱即用体验'还会持续分化。短期内用户会同时开几个订阅来挑着用,而不是只押一家。