这是什么
Harness 在 AI Agent(自主调用工具的 AI 程序)语境里,指框架的工程结构:下一步做什么、记忆怎么存、出错了怎么办。三道选择是:
单一主循环——放弃'先规划再执行'的多层嵌套,改用一个循环让模型每步决定下一步。代价是无法强制规划优先,好处是状态只有一份、好调试。
不可变状态——每次变化生成新对象、原对象不动。出 bug 可从任意时间点'回放',不用重跑全流程,是商业级 Agent 硬需求。
完成门反馈——'门卫'先判 PASS/UNVERIFIED/FAIL,FAIL 时把'哪里没达标'告诉模型接着做。潜台词:把'判断做完没'从模型手里拿回代码——模型未必擅长这件事。
行业怎么看
工程圈多数认同这套做法:好调试、好回放、能拦住'模型假报完成'。但有四个被忽略的风险。
单一循环放弃规划优先控制权,对多文件重构等复杂任务效率可能更低,每步都要问一次模型。不可变状态每步创建新对象,内存开销不容忽视。完成门依赖'明确合格标准',对写小说、做设计等创造性任务不适用,硬套会死循环。此外,MyCodeAgent 是开源项目解剖,并非 LangChain、AutoGen 等主流商业框架的标准做法,存在'幸存者偏差'。
对普通人的影响
对企业的 IT 采购:再听供应商说'我们接了 GPT/Claude 最新模型'别急着买单。该问的是完成判定怎么做、出错怎么恢复、状态能否回放——这才是商业可靠性的关键。
对个人职场:未来半年到一年,'既懂模型又懂 Agent 工程'的工程师会比纯模型方向的更稀缺。不用写代码的业务人可用现成 Agent 产品,但要心里有数它何时会'自作主张收工'。
对消费市场:你买的 AI 助手常'做一半说做完',别急着骂 AI,多半是工程问题。今年会有一批产品在这点上迭代,谁先把'完成判定'做扎实,谁先吃到口碑红利。