这是什么
一个客服 Agent 内部测试准确率 90 多分,老板拍板上线,一周后用户工单爆炸、截图满群飞。Gartner 2026 年报告的数据更扎心:缺乏系统化评测体系的 Agent 项目,上线后故障率是成熟项目的 4.2 倍;预计 2027 年,40% 的 Agentic AI(能自主规划步骤、调用工具完成任务的 AI)项目会被直接砍掉。
Agent 评测看似软件测试,本质不是。传统测试假设输入确定输出就确定;Agent 不一样——多步规划、调外部工具、有随机性,同一问题今天对明天可能错。Anthropic 工程团队的判断很直接:「没有 eval(评测)的开发,投入生产就开始崩溃」。核心原则就一句:评产出,不评路径。
行业怎么看
评测工具分两类,不能混用。AgentBench、SWE-Bench 属于 benchmark(标准测试集),跑通用能力;DeepEval、LangSmith、OpenAI Evals 属于评测框架,测自家业务表现。选错了,工具再好也白搭。
但反对意见值得提:benchmark 离真实业务太远。做客服 Agent 去跑 AgentBench 的卡牌游戏场景,分数再高也说明不了任何线上能力。Anthropic 自己承认,手动测试能走远,但撑不住生产环境。这条路目前没有银弹,更多是工程纪律——评测有没有嵌进 CI(持续集成,每次改代码自动跑),业务 case 有没有持续维护。
另一个隐性风险:LLM-as-Judge(用一个大模型给另一个大模型打分)本身有偏差,指标体系搭得再漂亮,分数可能只是幻觉。Agent 评测不是买工具,是建体系。
对普通人的影响
对企业 IT:选 Agent 供应商时,Demo 分数不再可信,得追问对方有没有端到端的评测流水线,能不能在生产环境跑影子流量对比。
对个人职场:最先被压缩的可能不是「会用 Agent 的人」,而是只会写功能断言的传统测试岗。多步推理、随机性场景评估是新的能力缺口。
对消费市场:接下来一年你会看到更多客服、教育类 AI 应用上线后频繁回滚或更新——不是产品不行,是评测没跟上。