一个 AI Agent(能调用外部工具的 AI 助手)如果手里有 50 个工具,直接全塞给大模型,效果往往最差 — 这是最近一篇 AI 制药论文的核心结论。论文给出的解法是:先把用户问题匹配到一个"技能模板"(类似标准操作流程 SOP),从模板里挑出必需工具,再按三种模式补充其他工具。

这是什么

三种补充模式分别是:

  • llm 模式:让大模型读工具描述后自己挑,省 token(大模型按输入文字量计费)但有选错风险
  • embedding 模式:把问题和工具描述都转成数字向量(一种让机器理解语义远近的方法),按相似度排名筛,类似 RAG(让 AI 先检索资料再回答)的思路
  • all 模式:全部塞进上下文窗口(AI 一次能"看到"的文字总量)。最简单,但工具越多,模型的"选择注意力"越被稀释,反而更不准

论文还规定了几个"核心工具"(如执行 Python、查 PubMed)始终保留,不管什么问题都不会被筛掉。

行业怎么看

LangChain、AutoGPT 等主流框架默认走 all 模式,因为开发快、通用性强。论文作者认为在医疗、法律这类高严谨场景,预筛选不可省 — 否则大模型面对一堆工具容易"乱抓药"。

但也有明确的反对声音。某企业 AI 架构师在我们交流时直言:消费级场景多搭一层匹配模块,意味着多一份维护成本和延迟;embedding 模式在歧义问题上经常"看着像但不是",硬套反而引入新错误。换句话说,论文方案适合专业场景,对通用聊天机器人可能是过度工程。

对普通人的影响

对企业 IT:评估 Agent 供应商时多问一句"工具超过 30 个时怎么选",背后是成本和准确率的真实差距。

对个人职场:跟 AI 协作时,主动告诉它"按某某流程做",比直接丢复杂问题效率明显更高。

对消费市场:会"记住你习惯"的智能助手(如按你的出差模板自动订机票),体验会甩开每次都要重说的产品。