AI Agent 越权执行恶意指令这事,行业里喊了两年没解;OpenAPPA 这周开源了一种新解法 — 把1970年代军方处理机密的隔离逻辑(就是 Bell-LaPadula 那套多级安全模型),直接搬进 LLM 智能体架构。我们认为这是个聪明的方向,但「已解决」在安全领域从来都是危险用词。

这是什么

archestra-ai 发布的 OpenAPPA,核心思路是把1970年代军方的「分级隔离」逻辑套到 AI Agent 上。通俗讲:给 Agent 划权限等级,不同来源的数据只能在对应权限范围里活动,跨级就被拦截。它针对的是提示词注入(prompt injection) — Agent 读到带恶意指令的数据后被带偏,执行了不该执行的操作,比如泄露文件、调错接口、把钱转走。Fireship 把这期视频标题写成「50年前的军方秘密」,噱头足,但底层概念确实是 MLS(Multi-Level Security)。

行业怎么看

支持方认为路子对。Agent 安全的本质是「数据可信度边界」问题,MLS 本来就是为这类问题设计的,移植过来逻辑自洽。archestra-ai 选择直接开源、不先做商业产品,显然是在抢 Agent 安全标准的话语权,而不是赚快钱。

但质疑声也很响。Fireship 标题里用 claims(声称)而不是 proves(证明),是有分寸的编辑判断。第一,1970年代的 MLS 是为人与人协作设计,LLM 的输入是自然语言,边界远比文件模糊,机械照搬分级防不住语义层面的攻击。第二,Agent 安全的瓶颈往往在工具调用链、第三方插件、MCP 这些工程层细节,光靠架构层框架未必够。第三,「50年前的秘密解决新问题」这种叙事本身就带营销味,真正落地还要看社区实际攻防测试。

对普通人的影响

对企业 IT:如果公司正在或计划部署能调邮件、文档、CRM 的 AI Agent,这类开源框架值得列入参考清单,但它不能替代现有的权限审计和数据分级制度。

对个人职场:用 Copilot、Cursor 这类 Agent 工具时,知道「提示词注入」是真实风险就够了 — 别把高权限账号随便授权给 Agent,工作文档里夹带的「恶意指令」不是科幻故事。

对消费市场:2025 年各家都在推个人 Agent,选产品时可以多看一眼「权限隔离」这块有没有真东西,而不是只比谁更能跑流程、更能聊天。