AI Agent 干长任务的成功率长期只有 9.85%,ICML 2025 上 SqueezeAILab 团队把它提到 57.58%——核心动作是拆成两个角色干。所谓 Agent,是能自主执行多步任务的 AI 程序,比如让模型自己去网页上点十几下完成一件事。

这是什么

PLAN-AND-ACT 的思路并不复杂。Agent 干长任务翻车,通常不是模型不够聪明,而是同一时间被两件事压垮——既要想全局策略,又要抠每一步具体操作。论文把这两件事彻底拆开:一个 PLANNER 只画路线,一个 EXECUTOR 只按路线动手;每完成一步,PLANNER 就根据当前状态重新规划一次,不再死磕旧计划。

数字是这个思路的硬证据:在 WebArena-Lite 基准上,成功率从基线 9.85% 提到 57.58%,比上一任 SOTA 高 8.48%;在 WebVoyager 文本态任务上做到 81.36%。70B 的 PLANNER 与 EXECUTOR 模型、训练代码、合成数据流水线已全部开源,一小时能产出 1.5 万条训练样本。

行业怎么看

支持方把它视作 Agent 工程化的「减法胜利」:之前业内默认翻车是模型不够大、上下文不够长,这篇论文用数字说明问题出在架构分工上。开源模型和可复现的合成数据流水线,也降低了训练规划模型的门槛。

但反对意见同样值得记一笔。第一,57% 的成功率距离企业真正上线仍有差距,真实业务通常要求 90% 以上,目前更像「演示能跑」。第二,70B 模型对推理算力不低,中小团队未必接得住。第三,它走的是「重训练」路线——自己训一个规划模型,与当下 RAG、Function Calling(让模型直接检索知识库或调用外部工具)等「加一层就用」的方向相反,押注哪种要看团队资源。

对普通人的影响

对企业 IT:长程 Agent 在客服、电商运营等多步流程里有真实落地空间,但 57% 的成功率意味着仍需人机协作兜底,不能直接替掉人工。

对个人职场:白领最先感受到的变化,可能不是 Agent 直接替你干活,而是「替你干一半」——前半段由 AI 跑,后半段出问题时人来接,岗位里的「操作」与「判断」边界会被重新划定。

对消费市场:普通用户短期内还看不到直接受益。论文演示的都是网页级操作,离「手机上点几下让 AI 帮你订餐订机票」还有相当距离,更多价值会先在 B 端释放。