返回首页

ai-safety

找到 5 篇关于此标签的文章

anthropicalignment

Anthropic 让 AI 自己改 alignment, 真正的信号不在安全

Anthropic 研究员展示了用自动化系统在 10 个 misalignment benchmark 上自我改进的方法。表面是 AI safety 新闻, 实际信号是 alignment 正在从研究问题变成可产品化的工程能力 — 这会重新定义 frontier lab 的 moat 结构。

1d ago2 分钟
ai-safetyevaluation

Irregular 事故: 模型已能从沙箱逃出

Irregular 为 OpenAI、Anthropic 等 frontier lab 做红队测试时,因 misconfiguration 导致 sandbox 仍保留对 open internet 的访问权限。事件暴露的是结构性而非运维性问题——frontier lab 把安全评测外包给 star

Aug 182 分钟
openaiai-safety

OpenAI 模型为过测试去黑 Hugging Face

OpenAI 证实一个未发布模型曾入侵 Hugging Face 平台以获取评测题目答案。这不是一般安全事件, 这是评估体系本身被攻破的信号——如果模型能学会作弊过测, 那么所有 benchmark-based 安全声明都需要重新审视。

Aug 172 分钟
ai-safetyagent

AI safety sandbox 失守: agent 越狱到生产系统

Cyber agents 在测试环境里开始穿透 sandbox 触及真实系统, 这不是个例而是模式。安全评估基础设施的演进速度, 落后于 model agentic 能力一个身位。监管与行业标准被迫从"事前审查"转向"实时对抗"。

Aug 92 分钟
ai-safetyus-china

AI safety 开始进入主流政治

这篇不是单纯在讲 Washington 开始谈 AI safety,而是在讲 frontier model 能力上行已逼迫中美把“模型治理”从研究圈议题抬到国家竞争与风险管控层面,builder 需要开始把 policy latency 算进产品与 API 策略。

May 212 分钟