这是什么
这周掘金一篇实战文章给出的思路是:与其祈祷 AI 别出错,不如专门为它出刁钻题。作者用 LangSmith 建了一套 12 题的考卷,把退货 7 天、价保 7 天、换货 15 天、保修 1 年堆在一起——数字越像,越是 RAG 系统最容易串台的雷区。再加一道「满 99 包邮但大件冷链除外」的边界题,专门测 AI 会不会丢掉括号里的例外条款。
核心动作只有两步:先建题库,再每改一版系统就跑一遍,看分数升降。软件工程里这叫「回归测试」,被搬进了 AI 项目。
行业怎么看
支持派:这才是 AI 项目工程化的标志。过去大家比模型参数、跑分榜单,真到落地才发现——评估体系才是日常工作量,通常占项目三成以上。一线传出的共识是:题库设计水平,决定了 AI 产品的下限。
反对派:这 12 题全是「几天」「几点」的事实型问题,打分容易。但企业里 80% 的客户提问其实是模糊的(「你们服务怎么样」),分数漂亮不等于用户满意。还有更尖锐的质疑:谁来决定题库出 12 道还是 120 道?业务规则一变,题库就成了需要持续维护的负担——这是新成本,不是免费午餐。
对普通人的影响
对企业 IT:别只盯着模型选型,题库怎么出、谁来出、怎么打分,才是真正的工作量。
对个人职场:未来会冒出「评测集工程师」这类岗位,不是算法博士也能做,但需要细致和业务理解。
对消费市场:下次 AI 客服给你一个标准得不像人的答案,它大概率是在套题库,不是真的笨——这是行业现状,不是它故意冷。