5万字制度文档的实测里,递归分块把检索准确率从62%拉到79%,回答准确率从55%提升到76%;我们的判断是,企业做RAG(检索增强生成,让大模型先检索资料再回答)时,真正拉开差距的不是模型大小,而是知识库工程是否做细。
这是什么
这篇文章不是教程,而是一份企业级知识库架构选型笔记。核心观点很直接:所谓“上传文档+搜索+生成答案”的简化流程,在企业里很容易失效,因为PDF表格会碎、页眉页脚会污染内容、相近问题会检索出不同材料,最后导致答案不稳、来源不清、用户不敢信。
作者把问题拆成七个环节:文档处理、分块、向量化、检索、重排、生成、引用。其中最值得注意的是前两步:文档解析和分块。前者决定你喂给系统的是不是干净材料,后者决定系统能不能把正确片段找回来。
行业怎么看
这类经验和行业现实是对得上的:企业知识库项目常常不是败给“模型不够聪明”,而是败给脏数据、坏切片和不稳定检索。文章给出的结论也很鲜明——递归分块比固定长度分块更适合正式场景,混合检索比单一向量检索更稳。
但反对意见也成立。第一,这套方案工程很重,OCR、表格解析、重排和引用追溯都会推高成本;第二,文章里的效果数据来自单一文档与场景,未必能直接外推到客服、法务或制造业知识库;第三,RAG并不能天然解决“知识过时”和“答案责任”问题,引用做得再好,也不等于业务部门就会完全信任。
对普通人的影响
对企业 IT:采购大模型不再是重点,先把文档治理、权限、引用链路做好,ROI才可能成立。
对个人职场:会写提示词的重要性在下降,能把公司资料整理成可检索资产的人,价值在上升。
对消费市场:未来我们见到的“AI客服”“AI助手”好不好用,差别可能不在模型名字,而在背后知识库是不是干净、完整、可追溯。