这是什么

OpenAI 这周公开了一组反直觉的数据:GPT-5.6 的 ultra 模式默认开 4 个 Agent(能独立完成子任务的 AI 模块)并行跑同一任务,结果分数更高、耗时更短、成本反而更低——这意味着 AI 行业的胜负手,正从「模型本身」转向「系统编排」。NVIDIA 的 AVO 也用多智能体架构在抽象推理测试 ARC-AGI-3 拿下满分。

多智能体针对的是单 Agent 的结构性短板:单个大模型在长任务里把规划、执行、自查全塞进同一块上下文(模型一次能「看到」的文本容量),上下文越长,越容易在第六步忘掉第一步定的约束——本质是水管粗细的问题。4 个 Agent 并行,是把这根水管拆成四根。

工程上拼图有三块:任务拆解(编排者把难题分给规划者、执行者、批评者、验证者),通信隔离(Agent 之间用共享黑板或点对点消息传信息,核心是互不污染),结果汇总(用自一致性投票、Best-of-N 等策略合成最终答案)。

行业怎么看

支持方认为这是必然方向。OpenAI、NVIDIA、Anthropic 三个月内密集发布多智能体框架,说明「单模型越大越强」的路径正在让位于「系统编排」的工程红利。

但质疑同样明确。MIT 一项研究显示,多 Agent 系统在复杂任务上的失败率反而高于单 Agent,通信开销和协调错误会指数级放大。也有从业者指出,「更便宜」的结论建立在特定基准上,换成真实业务数据——比如合同审查——子任务边界没那么清晰,成本优势可能瞬间消失。

另一个被低估的风险是责任归属:4 个 Agent 共同产出的报告出错,谁背锅?目前没有技术解。

对普通人的影响

对企业 IT:采购清单要变。多智能体部署需要编排框架、通信监控、容错设计等新能力,预算应从「模型」挪到「系统」。

对个人职场:AI 工具正从「一个对话框」变成「一个团队协作」。未来一两年,「把一件事讲明白」会比「问得巧」更值钱。

对消费市场:普通用户短期还摸不到 4 Agent 模式。它仍是按次计费的隐藏开关,等 API 价格再降两轮,才可能下放到个人订阅。