一份技术拆解抛出一个尴尬数字:纯向量检索(把问题转成数字坐标、按相似度找资料)的召回率上限就 60-70%,企业 AI 知识库每答 10 道题漏掉 3 道——这事常被甩锅给大模型"笨",但病灶其实在前一关的搜索环节。
这是什么
企业 AI 客服、知识库、AI 搜索产品,回答问题时都要先"找资料",再让大模型组织语言。第一步叫检索(Retrieval),真正相关的文档被找到了多少,叫召回率。
行业最近半年形成的判断是:单靠向量检索,召回率天花板就在 60-70%。漏掉的 30-40%,往往落在专有名词、版本号、型号、内部缩写上——恰恰是企业最需要答对的硬骨头。
解法是 Hybrid Search(混合检索):向量检索 + BM25(一种 1970 年代诞生的关键词匹配算法)。前者擅长语义相近,后者擅长字面精确,各召回 50 条合并后用 Reranker(重排序模型)精排,再输出给大模型。实测召回率可从 64% 拉到 91%。
行业怎么看
支持方认为这是一波工程红利期。换模型的边际收益在递减,把检索做透的投入产出比更高——一家中型 SaaS(软件服务)公司改造周期 2-4 周,答错率可降 25-40%,客户投诉直接打半折。
反对意见则指出这是「工程过度」。Reranker 多一笔 GPU 成本,单次重排 50-100 条要 100-500ms 延迟,高频 toC(面向消费者)搜索场景下用户能感知。BM25 和向量的权重如何融合,每个业务都得重调,没有银弹。问题不集中、调用量不大的场景,先把 prompt 和文档切分做扎实,不必急着上 Hybrid。
对普通人的影响
对企业 IT:未来一年评估 AI 知识库供应商,「召回率怎么测、有没有 Hybrid 链路」要写进招标审核清单。只看 demo 效果的时代过去了。
对个人职场:用企业 AI 搜索碰到答非所问时,多反问一句"是不是检索环节漏了",不必再怪模型笨。
对消费市场:toC AI 搜索(Perplexity、秘塔、纳米搜索)还会再洗牌一波,召回层做得透的产品,将在专业评测里拉开身位。