这是什么

Nonobench v1.2 是国外开发者 mauricekleine 维护的逻辑推理基准,专门用"数织谜题"(一种靠行与列数字提示来还原黑白格图案的逻辑题)考 AI。最新一版跑了 43 个模型,关键结果有三条:第一,闭源的 GPT-6 Astra 在 15×15 题目上拿下 30/30,是该基准的首个满分;第二,开源阵营里表现最好的 DeepSeek V4 Pro 综合得分 83%、排名并列第四,但面对新加入的 20×20 Hard 模式(10 道题,每题唯一解),所有开源模型——包括它——全部 0 分;第三,闭源阵营里 Opus 5.5 在 Hard 模式答对 8/10,已经是目前的天花板。

行业怎么看

看好者认为,这次结果戳破了一个幻觉:模型"能聊天"和"会推理"是两种能力。数织题不靠记忆,只靠一步步推,开源模型做不到,意味着在合同审查、流程自动化这类严肃场景里它们还不可靠。也必须提反对意见:批评者指出 Hard 模式只有 10 道题,样本量太小,"全军覆没"可能被放大;况且数织本身是非常窄的游戏化任务,模型在这种小众谜题上的表现,未必能预测它们在真实办公场景里的可靠性。还有一个容易被忽略的细节:DeepSeek V4.1 Flash 跑完全部测试只花了 0.84 美元——便宜是真便宜,便宜到交白卷也没什么实际意义。开源阵营需要证明的不只是跑得动,还要跑得对。

对普通人的影响

对企业 IT:选型时若涉及流程自动化或多步规则推理,开源模型目前还不具备"独立完成"的能力,建议闭源为主、开源做边缘场景或备用。对个人职场:让 AI 帮你写邮件、做摘要可以,让它独立审合同、做判断、跑流程,现在依然要人盯着,别被演示视频骗了。对消费市场:这次测试再次拉响警报,AI 厂商宣传的"会思考"和实际能力之间存在落差,普通用户在选付费 AI 产品时,别只看厂商 demo,回到自己的真实任务上测一测更靠谱。