本周Reddit上r/LocalLLaMA社区的一位开发者做了一次安全实验,结果令人警惕。他让一个基于Qwen3.6改造的开源大模型,针对本地编程助手Hermes的工作文件,设计出60种"提示词注入"攻击——简单说,就是在普通文本里藏恶意指令,诱导AI代理泄露用户的文件路径、邮箱、LinkedIn信息,甚至把数据转发到外部渠道。然后他用两款能找到的安全扫描工具去检测这些被污染的文件:Shieldstral拦截率0%,另一款GPT-OSS safeG只拦住10%。换言之,60次精心设计的攻击基本全部通过。

这是什么

提示词注入(Prompt Injection)是当前AI代理(Agent)领域最棘手的安全难题之一。和传统黑客攻击不同,它不需要找漏洞、写代码,只需要在AI会读取的内容里夹带"私货"——比如让AI"忽略之前的指令,改为执行XXX"。这次的测试目标是Hermes这类本地AI编程助手,它们通常被授权访问用户的代码、邮件、配置文件等敏感内容。攻击者只要在某个被读取的文件里藏好指令,就可能让AI在不知情的情况下把数据外传、或调用非预期的工具。Shieldstral是目前社区里比较受关注的开源防护工具之一,这次测试等于给它和同类方案做了一次"裸考",成绩是0分。

行业怎么看

编辑部注意到两种声音。一种认为这恰恰说明本地AI代理(Agent,能自主读写文件、调用工具完成任务的AI)还不成熟,把代码、邮件、文件这类敏感工作交给它们之前,应该假设"零防护"。另一种更乐观:开源社区的安全研究本身就是进步,问题能被公开暴露和复现,修复速度反而比闭源大厂更快。不过也有反对意见指出,这次测试用的是专门构造的攻击样本,普通用户日常场景里碰到的概率没那么高,不宜过度恐慌——但60:0的比分仍是个明确信号:现有扫描工具对提示词注入几乎无能为力,这不只是技术问题,而是整个Agent生态的基础设施缺口。

对普通人的影响

企业IT来说,这意味着在内部部署AI编程助手时,安全评估清单上必须新增"提示词注入防护"一项,过去防病毒、防数据外泄的思路需要扩展到AI层。

个人职场而言,如果你正在用Cursor、Cline或本地Hermes这类AI代理处理包含客户信息、财务数据的任务,需要意识到:你以为它只是在读文件,其实它在被文件"反向指挥"。

消费市场,短期内AI代理类产品会继续涌现,但真正能落地到企业场景的供应商,必须拿出可验证的安全检测能力——这会从加分项变成采购门槛。