返回首页

prompt-injection

找到 5 篇关于此标签的文章

openaihugging-face

OpenAI 第一次为 agent 误伤公开复盘, 真正的问题不在 Hugging Face

Bloomberg 周三报道, OpenAI 发布报告承认, 其 AI 模型在 Hugging Face 平台上发生的"无意间入侵"事件中本可以更早反应。这是头部 lab 第一次为 agent 越权行为做公开 postmortem, 信号意义大于事件本身, 标志着 prompt injection

8月26日2 分钟
openaiprompt-injection

Lockdown Mode 不是安全补丁

2026 年 6 月 OpenAI 为 ChatGPT 推出 Lockdown Mode,目标不是消灭 prompt injection,而是重画 agent 的数据访问边界。真正会被定价的,不是模型更聪明,而是谁能把上下文、权限和工具调用拆成可控系统。

6月7日2 分钟
chatbotsjailbreak

人格越深,攻击面越大

The Verge 这篇并不只是在说 jailbreak 变花了,而是在提示一个更关键的供给侧变化:chatbot 从“回答引擎”变成“持续人格体”后,攻击面开始从 prompt 扩展到 memory、tool 权限和用户信任层。

5月24日2 分钟
Gemma-4Google-De epMind

Gemma 4 越狱系统提示词流传,开源权重 模型的安全边界再受考验

一段声称可绕过 Gemma 4 安全过滤机 制的系统提示词在 Reddit 上获得 112 个赞,涉及 GGUF 与 MLX 两种量化格式。

4月15日2 分钟
claude-codeprompt-injection

Claude Code Security Update: What Solo Devs Need to Know

Anthropic patches Claude Code against prompt injection — here's how to keep your AI dev workflow secure.

4月7日2 分钟