这是什么
NVIDIA 一款名为 AVO 的模型,本周在 ARC-AGI-3 的 183 个关卡、25 个公开环境里拿下 100% 通过率——且全程没有拿到任何指令、规则或目标提示。这是过去两年主流大模型都折过戟的「通用推理」考试,这次却传出了满分。
ARC-AGI(Abstraction and Reasoning Corpus)由前 Google 研究员 François Chollet 设计,主旨是测 AI 能不能从极少的例子里「悟」出规则,而不是死记硬背。它被业内视为通用智能的最重要试金石之一。
最新一代 ARC-AGI-3 把难度再上一档:不再是静态图谜题,而是交互式关卡——模型要像打开一个陌生游戏,自己摸清目标、操作、规则,再完成任务。AVO 在这种条件下拿了满分。
行业怎么看
乐观派的反应很直接:如果这条成绩是真的,它打脸了过去两年最主流的怀疑——「LLM 只是统计鹦鹉、不会真正推理」。Chollet 本人长期坚持,纯 Transformer 架构过不了 ARC,必须靠组合性、系统性才能拿下。AVO 的满分意味着推理研究的方向标可能要重新校准。
但编辑部也得摆出几个保留意见:
第一,消息源是 r/LocalLLaMA 的一个帖子,提交者是普通用户,没有 NVIDIA 官方公告、没有论文链接、没有第三方独立验证。基准测试领域的「满分」声明,过去被打脸的不止一次。
第二,183 个关卡集中在 25 个环境里,环境多样性是否足够、是否容易被针对性训练过,仍有疑问。
第三,「无指令」的具体边界:是给了一段任务描述但没给规则,还是真的从零开始?基准测试里这种小字眼往往决定性质。
对普通人的影响
对企业的 IT 部门:意义在于「方向标」,不是「立刻可用」。能跑通 ARC 不等于能跑通你公司的流程审批、知识库问答。
对个人职场:推理能力真正落到日常工作里,估计还要 1-2 年。今天的 ChatGPT、文心一言、通义千问依然是主力。
对消费市场:消费级 AI 的体验不会因为这个分数突然跳变。智能助手、翻译、写作这些场景暂时不受影响。