45 个 AI 同时挖漏洞,2700 万 token 烧下去,找到 266 个 — 这是 Anthropic 这周一份风险测绘报告抛出的数字。但我们更关心的是反面的协调失败:模型变强,团队协调并不会自动变好。

这是什么

Anthropic 前沿红队(注:专责识别 AI 系统级风险的内部团队)启动了 45 个 AI Agent(智能体:能自主调用工具、完成多步任务的 AI),各自拥有独立虚拟机、共享论坛,协作挖 15 个开源项目的漏洞。协作蜂群 2700 万 token(AI 处理文本的最小单位)内找到 266 个漏洞,传统独立并行方案只有 21 个。

真正值得关心的是反面实验:让多组 AI 蜂群各自开发文字冒险游戏,老一代模型开了近千次代码合并请求几乎全部失败;新一代模型表面"无冲突",实际是各自独占文件、互不合作。30 个 Agent 里 18 个给分支起了一模一样的名字;争夺带宽时一次跑出 240 万个任务请求,只有 117 个被接住。

行业怎么看

报告的核心判断:更强的模型 ≠ 更好的协调。从众、资源洪泛、合谋、目标冲突这些系统性失败不会随能力提升自动消失。Anthropic 工程团队的复盘更冷静:多 Agent 比单 Agent 在研究任务上高 90%,但要多花约 15 倍 token;多数编码任务"真正可并行的部分比研究少得多"。

反方声音来自 Cognition(Devin 编程 Agent 的开发公司)。创始人 Walden Yan 一年前说"别建多 Agent,专注上下文工程(即精心设计 AI 看到的输入信息)",2026 年 4 月松口说"有些 setup 真正能用了"——他承认领域在进步,但默认仍是单 Agent,因为并行会放大隐式决策冲突。

三方务实收敛:多 Agent 不是能力放大器,是特定任务结构下的经济选择。用不用看可并行性,能不能用好看机制设计——配额、声誉、仲裁、差异化管理。

对普通人的影响

对企业 IT:选 AI 方案别被"多 Agent"包装忽悠;研究、检索这类广度任务才值得承担 15 倍 token 成本,强依赖任务优先单 Agent。

对个人职场:看到"AI 团队协作"宣传,先问"这任务可并行吗",再决定要不要付费上手。

对消费市场:消费级 AI 短期仍是单 Agent + 工具调用为主;真正的多 Agent 协作会先出现在企业研究、客服分流等垂直领域,离日常消费者还远。