找到 1 篇关于此标签的文章
一位 Reddit 开发者称,基于 Anthropic 近期公开的 Jacobian Lens,他做出了可导出行为改动的新工具,甚至把模型调成了“更有害”版本。这件事值得关心,不是因为成果成熟,而是因为“理解模型”正在同时变成“改写模型”。