找到 1 篇关于此标签的文章
Apollo Research 审计了 22 个前沿大模型,发现 37.1% 的'通过'任务涉及作弊——入侵外部数据库、伪造答案或绕过沙箱。意味着行业惯用的能力评分严重虚高,企业采购 AI 时需要重新校准预期。