一篇被工程社区反复引用的综述把这事讲清楚了:能跑真实任务的 AI Agent 至少有六个组件在协同 —— 大脑(LLM,负责推理)、调度器(规划,把大目标拆成小步骤)、记忆(短期/工作/长期三层)、工具(API、数据库、代码)、行动(真正改变环境)、心跳(执行循环,把上面五步串起来)。少一个,就只是「更聪明的聊天机器人」,干不了真活。

我们关心这件事,是因为 2025 年企业 IT 预算里开始大规模出现「Agent 项目」这一栏,但很多采购方至今以为自己在买一个更强的模型 —— 实际上他们应该买的是一套系统。

这是什么

Agent 这个词在 2025 年被严重滥用。学术综述对它的定义正在收敛:感知输入 → LLM 推理 → 规划拆解 → 调取记忆 → 调用工具 → 执行动作 → 回到循环。Anthropic 在自家工程指南里特别提醒:别把架构搞复杂,生产环境里 ReAct(边想边做)和 Reflection(错了就反思)这两种基础模式撑起了大多数场景。

更值得关注的是记忆层。短期记忆是当前对话的上下文,工作记忆是任务进行到哪一步,长期记忆存在向量库(一种让机器按语义查找的数据库)或传统数据库里 —— 它记住的是「用户上次说不要转机」这种偏好。没有这一层,Agent 就是金鱼,转头就忘。

行业怎么看

主流声音认为这套六件套框架已是行业共识,多家大厂和学术综述在 2025 年基本对齐。LangChain 把「先规划再执行」作为复杂任务的标配,Reflexion 框架在 HumanEval 代码基准上跑出 91% 准确率,超过 GPT-4 的 80%。

但反对意见也很明确。Anthropic 直接说「别过度设计」:很多号称 Agent 的产品其实只用得到其中两三个组件,堆砌规划层反而浪费 token、拖慢响应。一线工程师也提醒,综述里 91% 的 benchmark 漂亮,但真实业务中规划与执行脱节、工具调不通才是常态,benchmark 不等于交付能力。还有研究者质疑,把 Agent 拟人化成「大脑—手脚」虽然好懂,却容易让管理者误以为它能独立决策,实际上它依然高度依赖人在环路中的监督。

对普通人的影响

对企业 IT:下次供应商来推销「AI Agent」时,别问「接的是哪个大模型」,要问「记忆怎么存、工具链有哪些、循环怎么处理异常」 —— 这才是真正的系统成本。

对个人职场:接下来一年最值钱的技能不是「会用 AI 聊天」,而是「能让 AI 调得动你公司的内部工具和数据」 —— 这就是 Agent 中的工具和记忆层。

对消费市场:普通用户短期内能用上的「真 Agent」还很少,目前主流助手仍是单轮对话为主;真正的 Agent 产品会先在企业服务里冒出来,再下沉到消费端。