这是什么

2024 到 2026 三年,中国《人工智能安全治理框架》连发三版,监管对象清单直接换了主角:1.0 盯着模型、数据、系统和输出,3.0 已经写成「模型、Agent、工具、记忆、运行时」。这意味着治理重心从「回答得对不对」转向「执行得越不越权」。

3.0 把智能体安全拆成四类独立风险:身份权限滥用、推理规划偏离、调用执行越界、记忆存储污染。它们有一个共同点——多数风险不在输入端,你在前置过滤上加多少层都拦不住。Agent 错误地调用一次工具,可能就是一次数据外泄、一次越权审批,甚至一次不可逆的业务事故。

框架还引入一个新概念:AI 认知供应链——训练语料、知识库、网页、搜索结果、工具返回数据、长期记忆,任何一环被污染,风险会沿着检索、推理、执行整条链路传下去。GEO 投毒(通过批量发布倾向性内容污染 AI 联网检索结果)也因此被正式写入监管文件。

行业怎么看

支持方认为,三连更的方向和 OWASP、国际 Agent 安全社区的分类高度一致,监管从「内容审查」走向「运行时护栏」,是对 Agent 落地现实的技术回应。Fail Closed 原则(系统异常时默认拒绝执行,而非放行)的提出,被工程团队视为安全默认值从「宽容」翻到「保守」的关键转向。

反对意见同样存在。不少安全从业者担心,框架对「高风险动作」的界定仍偏宽泛——删除、转账、改权限落到中小企业时,缺乏细粒度判定标准,最终可能只在大企业建立完整流程,中小企业的 AI 部署继续裸奔。另一些技术团队则指出,单纯多挂一个审核模型远远不够:检测模型会误报漏报,权限边界和紧急制动必须由系统而非模型来执行,模型只适合判断语义,系统才负责制动。

对普通人的影响

对企业 IT:Agent 接入企业邮箱、知识库、API 之前,必须先回答「它能调用什么、能不能把权限转交下一个 Agent、做错谁回滚」三个问题,审批流设计要从「人审内容」升级到「人审动作」。

对个人职场:用 AI Agent 处理邮件、整理资料、跑流程时,要开始留心「它用我的身份做了什么」,未来工作审计日志可能比聊天记录更先被翻出来。

对消费市场:AI 客服、AI 助手一旦大规模接入银行、政务、医疗这些高权限场景,监管会强制要求二次确认、断路器和默认拒绝机制。普通用户会越来越多地遇到「AI 帮你操作前先弹窗确认」的体验。