20,168 道 Python 题这周悄悄上线,专门测试本地大模型(跑在自己电脑、不联网的小模型)修代码 bug 的能力。这件事真正戳中的是 AI 评测行业一个老问题:模型在可见测试里拿满分,换到隐藏用例就翻车。

这是什么

Failure Map,一个面向本地代码模型的开放测试集。20,168 道 Python 调试任务覆盖 254 个类别,每个任务附带标准库实现、明确契约(事先约定的输入输出规则)、已知失败的修复样本、可执行的边界检查。

三道典型题:去重逻辑会把合法事件误删;缓存过期时间少算 1 个单位,原本有效的记录被当成过期;翻页代码把 > 改成 >=,同一条记录被返回两次。题目免费下载,提供统一的 prompt 模板和评分脚本。

行业怎么看

支持者认为,本地模型跑代码任务成本低、代码不出企业内网(隐私敏感场景的刚需),社区急需一份公开、可复现的评测标准,来防止厂商自吹自擂。

质疑和风险也不少。第一,作者自己承认「还没测过任何本地模型」— 这是一张空考卷,邀请社区往里填分数,分发可信度取决于后续数据沉淀。第二,作者反复强调「可见测试通过」不等于「隐藏用例通过」,潜台词是:业界很多跑分就是让模型看得到答案再考,分数系统性虚高。第三,hidden-test 要跑出有意义的结果需要算力和工程投入,小团队和独立开发者玩不转,可能形成新一轮评测霸权。第四,2 万题标准化后会不会被针对性地优化训练?这是 NLP 评测里的老问题,叫「data contamination」(数据污染)。

对普通人的影响

对企业 IT:采购「AI 写代码」工具时,要求厂商在闭卷(不暴露测试集)环境下出分,否则分数再漂亮也只是营销话术。

对个人职场:用本地模型写脚本、查 bug 的人越来越多,他们更可能先用这种公开测试集在自家代码上验证一遍再上生产。

对消费市场:未来一年号称「代码能力超过 GPT-4」的本地模型会持续冒出来,普通用户没能力复现评测,看得见的分数别太当真。