这是什么

本周 Databend 抛出一个数据:他们在 1171 个执行步骤上对比了三个 AI Agent,发现即便最终测试都通过,路径长度和空转次数可以差出几倍。Jev 是其中关键工具,由 TypeSafe 开发,Databend 把它接在自家数据库上。

Jev 不像通用大模型那样写开放式评语,而是按预定义的结构化问题给每一步打分:这一步是否推进任务、是否重复之前动作、是否触及问题根因。判定结果直接写回 Databend 数据库,团队继续用 SQL(数据库查询语言)做跑偏率、模型对比分析。

行业怎么看

支持者认为这是补空白。过去两年行业都在拼'能不能跑通',现在该轮到'跑得稳不稳、烧多少 token(AI 调用按字数计费)'。Databend 算了一笔账:每天一百万个执行步骤,用 GPT-4.1 mini 这类通用模型做评审要 1000-3500 美元;Jev 把成本压到一个数量级以下。

也有反对意见。一种观点认为这套基建更适合有自研 Agent 的大厂,大多数企业直接调用现成产品(Cursor、Devin 等)就够了,不必自己造轮子。另一种担忧是:Jev 这类小模型的判断准确性在更复杂任务上还未充分验证,开放性根因分析它仍然做不了,仍要靠大模型兜底。

对普通人的影响

对企业 IT:如果公司正在自研或深度定制 AI Agent,'通过率'之外要把'路径成本'算进账 — 同一任务下两个 Agent 的 token 消耗可能差十倍。

对个人职场:日常用 AI 写代码、做研究时,留意不同工具的隐性成本:同一个任务,有的工具反复读文件、重试多次,账单会偷偷涨。

对消费市场:短期内无直接影响。但行业对'过程可见性'的关注,未来 AI 助手类产品可能公开更多使用数据,便于企业选型。