找到 1 篇关于此标签的文章
Anthropic 研究员展示了用自动化系统在 10 个 misalignment benchmark 上自我改进的方法。表面是 AI safety 新闻, 实际信号是 alignment 正在从研究问题变成可产品化的工程能力 — 这会重新定义 frontier lab 的 moat 结构。