找到 1 篇关于此标签的文章
一个独立团队发布 20,168 道 Python 调试题,专门测试本地小模型修 bug 的能力。他们指出行业评测的暗病:模型在可见测试里拿满分,换到隐藏用例就翻车。我们关心的是:评估 AI 写代码工具时,怎么不被厂商话术忽悠。