这是什么
本周开源团队 PipesHub 在 Google 的 FRAMES 基准(一套测试 AI 多步推理查资料能力的题库,824 道题)上做了一件事:拿同一套模型和文档,搭了 18 种 RAG(即让 AI 边查资料边回答)方案,对比一个最简 Agent 循环(让 AI 自己决定何时再查一次)。结果:最好的 RAG 方案答对 78.9%,Agent 循环 92.7%,差 14 个百分点——后者几乎等于“直接把答案塞给 AI”。
编辑部的判断:这事不是说 RAG 没用了,而是传统 RAG 的调优(重排序、混合检索、查询拆解)已经接近天花板。真正拉开差距的,是给 AI“再来一次”的权限。
行业怎么看
支持者认为这印证了过去一年的行业转向——单一检索增强不够,AI 必须有工具调用和循环推理能力,才能处理真实业务问题。实验中还有一个细节值得记:模型有时会用“记忆”补空白,即使你明确告诉它只能基于检索到的文档作答,而且这些补出来的答案还带引用,看起来很像回事。
但反对意见同样值得听。第一,这是 PipesHub 本人(在做一个 Agent 类开源产品)在单一数据集上的测试,方法论可能存在偏差;第二,Agent 循环靠多次调用 AI,成本远高于一次 RAG,对预算敏感的项目未必适用;第三,FRAMES 是研究型基准,真实业务问答复杂度通常没那么高,14 个百分点放到生产环境大概率会缩水。
对普通人的影响
对企业 IT:过去两年花大力气搭的传统 RAG 系统,尤其是客服、知识库类项目,可能需要重新评估;“让 AI 多想几步”或许比“把检索做更花哨”更划算。
对个人职场:用 AI 查资料做研究,与其一次性问完,不如让 AI 分步追问、自己决定何时再搜——这是当下成本最低、效果最稳的提效方式。
对消费市场:短期无明显变化,但 Agent 模式会推高 AI 产品后端成本,未来面向消费者的 AI 助手订阅费可能上调。