一份 30 道结构化评测题、五类覆盖事实/流程/代码/对比/边界——这是掘金作者陈映博给企业 AI 项目体检的「考试卷」样本。核心判断:评测集(用来给 AI 打分的题库)不是问题清单,是带字段、有分类、有难度、有边界 case 的测试资产,决定你能测出什么、漏掉什么退化。

这是什么

陈映博在《AI 应用生产化手册》第 2 篇指出三件常踩的事:随手问的 10 个题不能代表真实用户、覆盖能力说不清、同一答案昨天 4 分今天 3 分——评分漂移。解法是把评测集当测试资产来设计:多样性、难度分层、边界 case(故意挑易翻车的题)、可标注(每题带预期答案和评分依据)。

配套开源仓库给出 30 题初稿:8 条事实、4 条流程、4 条代码、4 条对比、8 条边界 case、2 条硬题。难度简单 6/中等 15/困难 9,故意让困难+边界占 57%——评测的使命是抓退化,不是晒正确率。

另一关键区分:「黄金集」(Golden Set)锁死不变,做回归门禁防退化;「演进集」随业务反馈扩充跟进。两者缺一不可——黄金集一改,基线就漂了。

行业怎么看

「评测要结构化」共识度高。但有相反声音值得记:硅谷一些团队更信「ship and measure」——直接放上线看真实反馈,认为精心打磨评测集是另一种「开卷考试」,失败模式永远在测试覆盖外。

我们的判断:两条路径不冲突。评测集不是替代真实反馈,是给「上线即崩」装保险。文章自己也点出几个真实坑——评测集泄漏(题目溜进提示词或知识库里)、幸存者偏差(只收答得好的题)、边界 case 判分器太笨把「正确拒答」判成「没回答」。评测基建是工程学科,不是拍脑袋的事。

对普通人的影响

企业 IT:选 AI 厂商时多问一句——你们有没有结构化评测集和回归报告?看 demo 不够,要看真实场景通过率。

个人职场:让 AI 写方案/内容时,厂商若能给你一张量化评分卡,会比一句「还行」更可信——透明化将成为 AI 工具的新卖点。

消费市场:AI 产品的「质检透明度」会逐步标准化,看评测通过率会比看 demo 更重要——这是消费者层面正在发生的一个低调度变化。