我们注意到一个工程事实:10 亿条 768 维向量用 HNSW 需要 335 GB 内存,改用微软的 DiskANN 可以压到 32~64 GB,但召回率会从 99% 掉到 93~97%。这组数字背后,是 2026 年企业 AI 项目最常踩的坑——向量库(把文档变成数学向量存储和检索的数据库,可理解为 AI 的内存条)与图 RAG 选型没做对。

这是什么

RAG(Retrieval-Augmented Generation,检索增强生成)是企业 AI 查内部文档的标准做法。工程上的核心矛盾是:维度高(768~4096)、库大(10^6~10^10)、又要毫秒级返回。当前工业界的真实格局: - HNSW(分层图索引):Milvus、Qdrant、Weaviate 的默认选项,小数据量首选; - DiskANN / SPANN:微软方案,把图搬到 SSD,专攻十亿以上规模; - SCaNN:Google 内部方案,Pareto 最前沿但部署生态弱; - GraphRAG:2024—2026 年最热方向,在向量检索之上叠一层知识图谱,让 AI 理解实体关系而非只匹配相似句子。

行业怎么看

主流声音把 GraphRAG 当作下一代企业 AI 的标配:Milvus 2.4+、Weaviate、Pinecone 已陆续集成图能力,知识图谱被视为突破"AI 答不对上下文"的关键。 但反方意见也值得听。一位资深架构师在 Hacker News 讨论里直言:"GraphRAG 距离生产稳定还差 18—24 个月,维护图谱的人力成本是向量库的 3 倍。"另有 FAANG 工程师提醒,"90% 的企业连基础 RAG 召回率都没跑稳,GraphRAG 是给那 10% 准备的奢侈品。"

对普通人的影响

对企业 IT:未来 12 个月采购向量库时,请直接向供应商问三件事——峰值并发、内存与磁盘配比、是否原生支持图增强;这三个答案决定 AI 客服能不能撑住业务量。 对个人职场:会用 AI 查文档的人和不会用的人,效率差距会进一步拉大;理解"检索"比背诵"提示词"更关键。 对消费市场:你用的 AI 助手回答准确率会肉眼可见提高,尤其在医疗、法律、教育等需要溯源和上下文理解的场景。