Anthropic 这周做了一个反直觉的决定:8 月 14 日起,Claude Code 付费版新会话默认开启「自动模式」,也就是让 AI 自己决定要不要执行高风险操作——删文件、跑命令、读邮件——不再每次弹窗问人。支撑这个决定的,是一组对比数据:在 1,053 名付费用户的测试里,面对同样的危险操作,只有 13.6% 的人类会点拒绝,而自动模式拦下了 89%。换句话说,在这家公司眼里,AI 在「该拒绝时拒绝」这件事上,比人可靠 6 倍。

这是什么

Claude Code 是 Anthropic 出的编程助手(帮开发者写代码、跑命令的 AI 工具)。它原本每做一个敏感动作都要弹出确认框让用户点头,这叫「人工审批」。「自动模式」就是把这个审批权交给 AI 自己,它会判断这条命令危不危险,再决定是否执行。这次升级把它变成付费用户的默认设置,意味着 Anthropic 认为风险已经被压到足够低。

他们还请了第三方机构 Trajectory Labs 做了另一项测试:在 72 种「提示词注入」(Prompt Injection,简单说就是有人把恶意指令藏在网页、文件里,诱导 AI 做错事)攻击场景下,Claude 最新三个模型自动模式零失手

行业怎么看

支持方认为这个判断站得住。资深博主 Simon Willison 引用 Anthropic 内部说法——「公司里几乎每个人都用自动模式」——并指出「确认疲劳」(Confirmation Fatigue)是真的:让人每几步点一次「确定」,最终结果就是麻木地全点通过,反而更危险。Anthropic 的 89% vs 13.6% 数据,本质上是在说「让人类当最后防线」是个糟糕设计。

但反对意见也很明确。Willison 自己就泼冷水:11% 的漏网率不是小数字,放到企业环境里就是真实的删库、泄密事故。更关键的是,他点名了一个没被解决的威胁:提示词注入。一个恶意的第三方代码包、一封含陷阱的邮件,就可能让 AI 执行攻击者的指令。Anthropic 这次公布的测试场景是 72 种「间接提示词注入」,但 Willison 提到一种更现实、目前没被覆盖的攻击:通过第三方依赖包植入恶意指令——这种攻击在 npm、PyPI(两个主流的开源代码仓库)上屡见不鲜,Anthropic 的「零失手」未必包含这类。

另一位长期追踪 Agent(能自主执行多步任务的 AI 助手)安全的研究者公开预测:2026 年会出现一起「编程 Agent 安全灾难」。他希望 Anthropic 的数据是真的,但希望看到独立验证,而不是只听厂商自己说。

对普通人的影响

对企业 IT:如果你们公司正在评估要不要给开发团队配 AI 编程工具,Anthropic 的逻辑是「默认安全开关交给 AI 比交给人更稳」——这意味着 IT 部门的管控思路要从「限制 AI 能做什么」转向「审计 AI 自动做了什么」。日志和回溯会比审批更重要。

对个人职场:非开发者短期内感知不大。但「自动模式」代表的方向是——AI 工具厂商越来越倾向于让 AI 自主决策,而不是频繁打断用户。如果你常用 AI 助理做涉及账号、文件、资金的自动化操作,记住:工具商说「安全」,不代表「免责」。

对消费市场:这是 Anthropic 把「AI 自己管 AI」从实验推向默认的一次押注。如果后续没有重大事故,其他厂商(OpenAI、Google、字节、阿里)大概率会跟进——届时「自动模式」会成为行业标配,用户的预期也会从「AI 要问我」变成「AI 应该自己判断」。这是一个回不去的拐点。