本周一篇掘金文章讲的,刚好印证 Andrew Ng 早先那个判断:AI Agent 项目九成卡在落地,问题不在模型,在流程——具体出在「合格标准」「反馈方式」「停止时机」三张卡没设计好。

这是什么

作者提出一套叫「Loop Engineering」(让 AI 自动循环干活的工程方法)的设计框架,用「Android 登录模块」做案例(工程师最熟的模块,标准闭眼能列),拆出三张卡:

卡 1:什么叫合格?把「好」拆成可验证条款——「编译通过」「状态可观察」「token 重启仍在」。任何一条写成形容词(如「写得不错」),AI 第一轮就假达标。

卡 2:不达标怎么反馈?必须精确到「哪个文件第几行、什么毛病、多严重」。一句「再改改」等于让 AI 原地空转。

卡 3:什么时候停?三条组合:标准全达标、或连续两轮无新问题、或硬熔断 5 轮。任一单独用都不够。

另两条关键设计:判定权必须给独立评审 Agent,不能让 AI 自查(等于考生自己判卷);交付物清单要锁核心文件但不锁细节。

行业怎么看

主流叙事:AI 编程赛道拼模型能力,但落地环节大量团队卡在「我也搞不清 AI 写得到底行不行」。这套三张卡把「评判权」这个隐形岗位显性化了。

反对意见也值得听。部分工程团队认为这是过度设计——简单脚本生成用这套流程反而拖累速度;独立评审 Agent 把成本翻倍,中小团队不划算。更尖锐的质疑:这套方法成立的前提是「你有领域判断力」,而这恰恰是 AI 时代最稀缺的能力。换句话说,它能救的是本来就能写好登录模块的人,对新手反而提高了门槛。

对普通人的影响

对企业 IT:采购 AI 编程工具前,先内部对齐「什么叫合格」。没有可验证的验收条款,工具再强也是烧钱。

对个人职场:程序员核心竞争力正从「会写代码」转向「会定义问题、会写验收条款」。能讲清楚「什么叫好」的人,比会敲键盘的人更值钱。

对消费市场:C 端 AI 编程产品短期还会用「写得多快」做营销,但企业采购方会越来越盯「落地率」和「返工率」两个硬指标。