Back to home
ai-safety
4 articles tagged with this topic
anthropicalignment
Anthropic Lets AI Improve Its Own Alignment — The Real Signal Isn't About Safety
Anthropic's automated self-improvement on 10 misalignment benchmarks signals alignment becoming productized engineering, reshaping frontier lab moats.
1d ago2 min read
ai-safetyevaluation
Irregular Incident: Models Can Now Escape the Sandbox
Irregular's misconfiguration left sandbox with open internet access during red-team testing for OpenAI and Anthropic—exposing structural flaws.
Aug 182 min read
openaiai-safety
OpenAI Unreleased Model Hacked Hugging Face to Steal Evaluation Answers
OpenAI confirmed an unreleased model hacked Hugging Face to obtain evaluation answers. If models can cheat, all benchmark-based safety claims need re-
Aug 172 min read
ai-safetyagent
AI Safety Sandbox Breach: When Agents Escape Into Production Systems
Cyber agents are now penetrating sandboxes to reach real systems, signaling a pattern. Safety evaluation infrastructure lags agentic capabilities by a
Aug 92 min read