企业 AI 总记不住病根不在大模型 — 2026 年向量库与图 RAG 选型
我们注意到一个工程事实:10 亿条 768 维向量用 HNSW 需要 335 GB 内存,改用微软的 DiskANN 可以压到 32~64 GB,但召回率会从 99% 掉到 93~97%。这组数字背后,是 2026 年企业 AI 项目最常踩的坑——向量库(把文档变成数学向量存储和检索的数据库,可理解为 AI 的内存条)与图 RAG 选型没做对。
相关推荐
同分类:ai_tools
NVIDIANemotron
大模型号称能跑 16GB 显卡?一个人挖出'假压缩',现成工具都用不了
NVIDIA Nemotron 一直宣传能在 16GB 显卡上跑,本地 AI 圈等了几个月没人做到。一个开发者深扒 443 个文件,发现不是模型不行,是压缩工具的 bug。他做了补丁,代价是 LM Studio 这些现成客户端都用不了。
8月30日·www.reddit.com
RAG企业知识库
企业 AI 知识库频繁答非所问 — 问题多出在检索链路而非大模型
AI 让模型先检索企业文档再回答(RAG),已成为企业知识库标配。但上线后频繁答非所问,问题往往不在模型本身,而在检索链路。调试工具的出现,标志 RAG 从 demo 走向需要运维的基础设施。
8月30日·juejin.cn
todotgecanonical-basis
五亿参数里藏着 11 个核心模式 — GitHub 项目把 AI 黑盒撬开了一道缝
一个 GitHub 项目用数学方法把大模型无损'翻个面',意外发现:5 亿参数模型的有效秩可能只有 11 — 真正在干活的独立模式没那么多。这给 AI 可解释性研究打开了一道门。
8月30日·github.com
Infinite SlopAI直播
一个人撑起 24 小时 AI 直播 — 这个开源项目让你也试试
Pieter Levels 做了个叫 Infinite Slop 的 AI 自动直播开源项目,不用露脸、不用说话、内容自动生成。非码农也能上手,复刻成本约 1-2 个周末加几十块 API 费。
8月29日·levels.io
QwenApple Silicon
Qwen 3.8 实测:深度思考模式多烧 5.5 倍 token,本地部署账该重算
一位 Reddit 用户在 MacBook Pro M5 Max 上跑了 Qwen3.8-27B:开启「深度思考」模式后,token 消耗是普通模式的 5.5 倍、推理耗时 6 倍;关闭后质量又掉到其他 MoE 模型之后。开源模型「会思考」与「想得起」之间的成本裂缝正在浮出水面。
8月29日·www.reddit.com
Sesame AIChatGPT
语音 AI 想跑在本地?12GB 显卡暂时还差口气
本周 Reddit 的 LocalLLaMA 社区有热帖追问:有没有能在 12-24GB 消费级显卡上跑的语音对话模型,能对标 Sesame 或 ChatGPT 的体验。答案是——目前还没有真正能打的本地方案。云端语音 AI 的体验优势,正在成为本地化部署的下一道关卡。
8月29日·www.reddit.com