MIT EECS 副教授 Phillip Isola 这周发表了一篇短文,标题就叫「Robot-Use Agents」。他抛出一个观点:Agent(智能体,指能自主执行多步任务的 AI 程序)真正的终局,不是会聊天,而是会「用电脑」——像人一样点击、滚动、输入,操作任何软件界面。我们注意到,这个说法虽然激进,但正在被一线大厂用真金白银的产品验证。

这是什么

Isola 是生成式模型领域的知名学者。「Robot-Use Agents」概念简单说就是:把电脑本身当作机器人,让 AI 像人类员工一样操作图形界面完成任务。这与 Anthropic 去年发布的 Computer Use 功能、OpenAI 今年推出的 Operator 是同一思路。区别在于:Isola 作为学术研究者,把它定位为终局形态;而产品方目前只是作为补充能力,态度明显更克制。

行业怎么看

支持者认为这是 Agent 落地的务实路径——比起为每个 SaaS 软件定制 API,让 AI 直接操作界面更通用、更快覆盖长尾应用。但反对意见同样清晰:界面操作成功率仍偏低,公开 benchmark 多在 50% 以下徘徊;安全风险大,AI 一次误点击可能在真实系统里造成真实损失。Anthropic 自己就把 Computer Use 列为「高风险能力」并设多重护栏。值得指出的是,学术界的乐观叙事和产品界的谨慎工程化之间,存在明显温差。

对普通人的影响

对 IT 部门:未来 12-18 个月可能需要重新评估 RPA(机器人流程自动化)路线——通用 Agent 比专用 RPA 更灵活,但权限边界和审计要求会更复杂。

对个人职场:白领日常的重复性办公操作(填表、报销、跨系统复制粘贴)是被替代的高危区;同时,「会用 AI 操作电脑」本身会变成新的技能差距。

对消费市场:现阶段消费级 Agent 产品(Operator、Manus 等)更多是技术演示,离真正替代助理还远,普通用户不必急着付费订阅。