Mistral 把 AI 查复杂文档的准确率从 26.7% 拉到 86%,但平均响应时间从 1-2 秒变成 71 秒。这不是普通升级,是检索范式从'找片段'到'拼证据链'的转变。值得关心的是:哪些场景愿意为准确率多等一分钟,哪些不愿意。
这是什么
Mistral 在 8 月 20 日发布的 Agentic Search 不是一个新模型,而是一种新的检索方式。传统 RAG(让 AI 检索文档片段后再生成答案的流程)面对复杂文档有三个明显短板:单次检索拿不到跨章节信息、模型没有回溯验证能力、检索深度固定。Agentic Search 给 AI 五个工具(search、open、navigate、read、grep),让模型自主规划步骤、反复跳转验证。在 FinanceBench 基准测试(368 份 SEC 文件、53,900 页、150 道多跳推理题)上,准确率从 26.7% 升到 86%,提升 59 个百分点。
行业怎么看
支持者认为这是金融合规、法律尽调、合同审查的刚需解法。招股书、年报里的关键信息常藏在脚注、附注、交叉引用里,传统 RAG 命中的是片段,Agentic Search 拼出的是证据链。同时,完整导航循环的 Token 消耗比纯搜索循环还少约三分之一,长期成本可能更低。
反方意见也很直接:71 秒平均延迟、154 秒 p90(90% 的请求不超过该值)延迟,对客服、实时对话场景不可接受;循环次数取决于问题复杂度,SLA(服务等级承诺)难以稳定签出;模型自主调用工具,调试和审计更复杂——「AI 凭什么信自己查出来的东西」会成新问题。
对普通人的影响
对企业 IT:招股书、年报、合同密集的行业(券商、律所、审计)值得重新评估文档检索方案,准确率本身就是竞争力。
对个人职场:律师、分析师、审计师等岗位的 AI 工具会变好用,但客户对错误的容忍度也会同步降低,工具不会让你失业,但会让你更快被追责。
对消费市场:普通用户短期内不会直接感受到变化,但 B2B 服务(如法律 SaaS、合规平台)的输出质量会提升,下游消费产品间接受益。