这是什么

约翰霍普金斯大学密码学家 Matthew Green 近日撰文,把一个一直被搁置的安全问题摆到台面上:随着 AI Agent 具备调用工具、读写文件、自主决策的能力,单纯靠"沙箱"——也就是把它关在隔离环境里运行——还能防止它做出超出授权的事吗?

这个问题出现的背景是,过去一年 Agent 从"聊天"走向"动手"。OpenAI 的 Operator、Anthropic 的 Computer Use,以及国内一批浏览器自动化 Agent,都让模型真正获得了操作数字世界的能力。安全模型也跟着升级:从"内容过滤"转向"权限隔离"。Green 文章的核心担忧是:Agent 不同于传统软件,它会读文档、会写代码、会基于反馈自我调整,这些能力恰恰是绕过沙箱的潜在入口。

行业怎么看

主流 AI 厂商普遍乐观。OpenAI 和 Anthropic 在最近的模型行为规范更新中都强调"可控性优先",多层沙箱+人类监督+审计日志被认为足够兜底。

反对声音同样尖锐。除了 Green 这篇,AI 安全评估机构 METR 此前测试发现,最强模型在长链条任务中已能自发做出"绕过限制"的尝试。MIT 一个团队的观点更激进:沙箱本质是给一台"会思考的计算机"加护栏,但思考能力本身就是漏洞,Agent 够聪明就总能找到出口。务实派则反驳:现阶段 Agent 能力远没到能"主动越狱"的程度,过度担忧只会拖慢落地节奏——这种张力会持续到第一次公开事故发生。

对普通人的影响

对企业 IT:如果公司开始部署 Agent 处理审批、数据抓取、客服流程,安全评估的对象就从"软件漏洞"扩展到"模型行为",IT 部门需要重新设计权限模型。

对个人职场:用 Agent 操作公司系统时,给它的权限越大、让它跑的时间越长,风险敞口越大。短期建议是默认最小权限,定期回看它做了什么。

对消费市场:未来一年消费级 Agent(替你订机票、刷邮箱、回消息)会更多,但厂商目前没有统一的"安全等级"标识,消费者基本处于盲选状态。