这是什么

Anthropic 上线了 Claude Code 的「自动模式」(auto mode),号称能让 AI 编程助手——业内叫 agent——自主处理复杂任务,同时自动拦截提示词注入攻击(prompt injection,即在文件或网页里藏指令骗 AI 执行恶意操作)。最近他们把这模式设为默认。

但安全研究员 Johann Rehberger 测试发现:用含 zip 压缩包的诱导文件,可让 Claude 下载、解压并执行恶意代码,成功率 80%。更反直觉的是——当 Claude 自己察觉异常、试图终止进程时,自动模式反而把这个清理指令拦了下来。

我们看到的画面是:门卫放了坏人进门,又挡住了保安抓人。

行业怎么看

Simon Willison 等长期追踪 AI 安全的人认为,这印证了他们的老判断——单靠模型层的过滤机制(classifier,即让 AI 判断操作是否安全的中间层)不够,必须配沙盒(sandbox,把 agent 关在隔离环境运行,类似虚拟机)、限制网络出口、监控行为、隔离敏感凭证。

也有人替 Anthropic 缓颊:auto mode 本就是「默认安全」而非「绝对安全」,prompt injection 是开放环境的根本难题,不能因单一研究否定方向。但 Rehberger 的回应很直接——攻击者只要一次得手,企业就扛不住。

我们的判断:当 agent 开始自主执行代码,「安全」就从模型问题变成工程问题。

对普通人的影响

对企业 IT:评估 AI 编程助手时,要问清沙盒环境、网络隔离、权限管控怎么落地,不要只看演示效果。

对个人职场:现阶段不要让 AI 助手碰生产环境、SSH 密钥(服务器登录凭证)或云账户,先在隔离环境跑。

对消费市场:普通用户短期感知不大,但企业级安全事故会拖慢整个行业的部署节奏,间接影响你能用上哪些功能。