本周一篇题为《Beyond recall and the illusion of competence》的文章在开发者社区被反复转发,提出的问题很尖锐:今天说某个 AI 模型「能力强」,很多时候其实只是在说它「记性好」。
这是什么
「Recall」(记忆/复述)和「competence」(真实能力)是评测领域的经典分歧。传统 benchmark(标准测试题库)大多考模型能不能答对某道题、答得像不像标准答案,本质上是在测它的「背诵+匹配」。但企业真正想用 AI 干的活——读合同、查数据、写报告——没有标准答案,看的是模型在变化中能不能做对事。
文章认为这种错位制造了「能力幻觉」:模型在测试里像优等生,进入真实工作流就掉链子。这个判断在企业一线已经被反复验证——大量 Agent 项目(让 AI 自主完成多步骤任务的系统)卡在落地,症结不是技术不够好,是「测试时灵、运行时傻」的落差太大。
行业怎么看
支持「换评测赛道」的一方:业内多位研究者(包括 Andrej Karpathy 在多次公开演讲中)都指出,编程类 benchmark 已被「刷分」到几乎失去区分度。模型在测试集上拿 90% 以上,放进真实代码库连续工作几小时,错误率显著上升。一些头部实验室近半年的发布已经悄悄转向展示真实使用数据,而不是单纯贴测试分数。
反对/风险的声音:我们也不必从一个极端跳到另一个极端。完全抛弃 benchmark 会让行业失去可比性——没有统一标尺,你怎么判断 A 模型比 B 模型强?更现实的路径是分层:基础能力用 benchmark 看趋势,落地能力用真实任务评估。但「真实任务评估」成本高、难标准化,目前没有广泛接受的方案。
另一个值得警惕的风险是:跑大规模真实任务测试需要数据和工程投入,大厂能玩,中小公司只能继续依赖公开 benchmark——这会让评测差距进一步变成产品差距。
对普通人的影响
对企业 IT:选 AI 供应商时别只看厂商给的「准确率 95%」,要求对方提供和你业务相关的实测案例,否则容易买到「考试型选手」。
对个人职场:如果你所在岗位被 AI 冲击,先评估自己做的是「标准答案型」工作(易被替代)还是「开放情境型」工作(AI 还做不好),后者短期更安全。
对消费市场:接下来一年你会看到越来越多 AI 产品宣传从「准确率 X%」转向「真实场景表现」,方向是对的——但也要警惕新话术包装的旧能力,别被换皮概念再忽悠一次。