几万个 PDF 散在内网,想让 AI 准确回答“我们公司报销标准是什么”——本周掘金的《企业知识库问答 Agent 实战》告诉我们:真正吃时间的不是大模型,而是文档解析、向量化(把文字转成 AI 能“理解”的数字)、检索优化这些脏活。

这是什么

文章场景是某公司内网有几万份 PDF(制度、流程、项目文档),员工想用 AI 问答。技术方案是当下主流的 RAG(先让 AI 从文档库搜出相关段落,再基于这些段落回答,避免凭空编造)。

真正值得拆解的是它的“防幻觉三件套”:RAG 检索提供事实基础;“忠实度自检”——用 AI 检查 AI,每句断言都得在原文找到依据;“反思重答”——AI 觉得答案不确定就重查一次;查不到就明确说“未查到”,不硬编。外加 MCP(让 AI 接入企业内系统的协议标准)打通 OA、HR——AI 不只告诉你“制度是什么”,还能告诉你“怎么发起报销”。

行业怎么看

支持方认为这是企业 AI 落地的范本:过去两年大家都在卷大模型参数、跑 benchmark(跑分测试),但真正决定能不能用、敢不敢用的是文档处理质量、检索准确率、答案可追溯这些脏活。文章的“元数据三件套”(source 出处、dept 部门、type 类型)让检索能精准到部门,是工程上很少被讲透的细节。

但反对意见尖锐。一位企业 IT 负责人在评论区直言:落地要先解决三个真问题——扫描件 OCR(把图片里的文字识别出来)在表格、印章场景准确率往往不如宣传,源头数据就脏;文档每周都在更新,索引重建的成本谁出;最关键——“未查到”四个字中国职场员工不接受,他们要的是确定答案,不管对错。

另有声音提醒:MCP 现在还在协议层竞争,Anthropic 一家推得动不代表行业标准,押注过早有锁死风险。

对普通人的影响

对企业 IT:未来一两年内,AI 项目评估标准会从“能不能用大模型”转向“文档管道能不能跑通”。IT 部门要补的是数据治理能力,不是只懂云和服务器。

对个人职场:白领花在“找制度、查流程”的时间,未来可能被 AI 大幅压缩。但反过来——如果你的工作只是“知道某条规定然后告诉别人”,被替代的速度会比想象中快。

对消费市场:短期看不到直接影响。但企业内 AI 问答稳定后,下一波溢出到 To C 的,会是“AI 客服真能解决你的问题”——而不是现在这种答非所问的脚本机器人。