本周一篇 Java 技术教程给出一个我们认为所有 AI 项目负责人应该记住的数字:0.78——一个判断 AI 是否'答得上来'的相似度阈值。当用户提问与知识库最相近条目的匹配度低于这个数,系统就该拒答、转人工,而不是硬编答案。这是检索增强生成(RAG)系统最基础、也最容易被忽略的设计。

这是什么

嵌入向量(Embedding)把句子转成一串数字,语义相近的句子在数字空间里方向也相近。两个向量方向有多一致,用余弦相似度(Cosine Similarity)衡量,越接近 1 越像,接近 0 就是不相关。

顺着作者的代码看:用 Java 17 调 OpenAI 的 Embeddings 接口,搭了一个三条 FAQ 的小检索器:用户问'买错商品怎么换',系统把问句转成向量,与知识库里的问题向量比相似度,挑出最像的候选;如果最高分低于阈值,提示转人工。

它把 RAG 拆成'找证据'和'写答案'两段,并强调'找证据'本身就有价值,不依赖最新模型。

行业怎么看

作者抛出一个反主流观点:最近大模型更新频繁,很多人以为'换新模型就能解决幻觉'(AI 一本正经地胡说)。作者说'检索门槛不应随生成模型名称变化而消失'——无论 GPT-3 还是 GPT-5,都要认真设计'答不上来怎么办'这道防线。

但反对意见要冷静听:阈值 0.78 只是教学起点,不是适用于所有语言和业务的标准。阈值高了会拒掉本该答对的,低了又回到胡说八道;这背后是召回率(少漏报)与精确率(少误报)的权衡,需要反复调试,不是装上就好。

另一个被忽视的风险是工程成本:演示里每次查询都重算 FAQ 向量,实际生产必须提前算好存起来,只对新查询调接口——否则 API 成本和延迟会爆炸。

对普通人的影响

对企业 IT:上线 AI 客服或知识库前,先回答'什么情况下系统应拒绝回答',比争论用哪家最新模型 ROI 高。

对个人职场:用 AI 工具别被它的'自信语气'骗了,背后有没有靠谱的检索底座、会不会胡说,才是判断值不值得用的关键。

对消费市场:评价一个 AI 客服,别只看'它能不能回答',更要看'它会不会承认不知道'——后者才是成熟产品的标志。