60 年前由俄罗斯科学家 Mikhail Bongard 设计的视觉推理题,本周被研究者 Matthew Hodges 重新摆上 AI 评测台。我们注意到一个不太乐观的信号:当下最强的多模态大模型(包括 GPT-5、Claude、Gemini 这一档),在这套老题面前集体失分。这在提醒整个行业:AI「看见」和「看懂」之间的距离,可能比厂商愿意承认的更大。
这是什么
Bongard Problems 是一组视觉谜题,每道题给两组图形,区别只在某个抽象规则——比如「图形是否封闭」「是否包含三条线」——你得自己找出那个隐藏特征。它诞生于 1967 年,长期是认知科学和哲学里讨论「什么是理解」的经典道具。
为什么最近又被翻出来?因为主流视觉基准已经「卷」成了数据游戏,模型靠记忆训练分布拿高分,但 Bongard Problems 强调的是跨域抽象推理——这恰恰是大模型的传统弱项。Hodges 在博客里指出,换一套图、换一种提问方式,成绩能差出三成。
行业怎么看
支持者认为这题戳中了要害。多伦多大学教授、认知科学家 Melanie Mitchell 多年追踪 Bongard Problems 上的模型表现,发现 GPT-4V、Claude 3 这一级模型准确率仍不到 60%,远低于人类近乎 100% 的水平。她认为这说明「视觉理解」这件事,主流评测根本没能覆盖到位。
反对意见同样尖锐。一派研究者认为,Bongard Problems 本身的「人类中心」色彩太重——它按人类直觉设计,未必能衡量 AI 真正需要的能力;硬把它当基准,有「拿人类的尺子量机器」的偏差。另一派更务实:模型表现不稳,是因为题目的呈现方式(线条粗细、对比度、提示词)干扰太大,把「抽象能力」和「感知鲁棒性」混在了一起,分数说明不了哪一项才是真问题。
对普通人的影响
对企业 IT:如果你们在选型「视觉 AI」供应商,别只看标准 demo 集,多追问一句:遇到需要看穿表面规则的场景怎么办——这是当下模型集体翻车的盲区。
对个人职场:用 AI 做图表、做配图时,「排得好看」它能搞定,但「为什么这张比那张更说明问题」这种抽象判断,目前还是要人来兜底,别被工具忽悠了。
对消费市场:未来一年会有大量「AI 看图」「AI 拍照问答」类消费产品上线,Bongard Problems 这种隐形成本会成为分水岭——过得去的产品和过不去的,体验差距会非常直观。