这是什么

本周一位开发者做了一件较真儿的事:给 Qwen 27B 模型建了一个真实 Git 仓库,故意把一段边界判断代码写反,再塞 3 条 pytest 测试用例。只给模型开放 5 个受限工具(不能随便执行 Shell),看它能不能自己读文件、跑测试发现失败、改对了再重跑,最后检查 diff。这种让 AI 自主调用工具、连续完成多步任务的能力,行话叫 Agent。

普通场景 8 轮跑通;冲突场景还故意让第一次补丁失败,模型没慌,重新读文件再改,10 轮也跑通。三条测试全过,Git diff 只动了正确那一行。

行业怎么看

最值得抄的不是"国产模型能改代码了"这种兴奋结论,而是作者自己最冷静的那段话:本次只证明模型在一个"窄范围"里跑通——没证明 Qwen 兼容 Claude Code,也没证明它能上生产。这份克制值得我们编辑部多看两眼。

真正的重头戏在后半段:作者抛出 6 条 Agent 评测硬标准——测试必须先红、工具合同写死、副作用必须真实、独立判定器不让自己打分、要有故障注入、证据必须冻结可审计。这套清单对中国整个 AI 行业都是一剂清醒剂。

风险视角值得警惕:现在市面上大量"国产模型对标 OpenAI"、"Agent 完成率 95%"的稿件,几乎都没披露这 6 条里的任何一条。评测 Harness(包住模型跑的脚手架)写错、判定逻辑写错,最终失败率就会混合模型、协议、环境三种原因——你根本不知道该谁背锅。这正是行业最容易糊弄的地方。

对普通人的影响

对企业 IT:如果团队在选 AI 编程工具,第一个问题应该是"你们的评测方法经不经得起审计",而不是"你们模型多大参数"。

对个人职场:用 AI 改自己代码的人记住一句:模型说"我已经改好了"和"测试真的跑过了"是两件事。生产事故常常出在前者被当成后者。

对消费市场:接下来一年 AI 编程助手会铺满市场,区分"营销能力"和"实际能力"会越来越值钱——这份 6 条标准,可能比任何厂商榜单都实用。