OpenAI 在今年 2 月提出的「Harness 工程」概念,最近被一线工程师重新捡起来:一个 AI Agent 在真实业务里跑起来,90% 的时间其实花在「让模型稳定输出」上 — 这比让模型更聪明难得多。
这是什么
Harness 直译是「马具」,缰绳、马鞍、护具都是。借到 AI 里,意思是:模型是马,Harness 是套在外面的那一整套约束装置。
OpenAI 提出的核心公式是:Agent = 模型 + Harness。模型负责聪明,Harness 负责稳。怎么让模型不跑偏、怎么管理上下文、怎么调度任务、怎么兜底失败、怎么控制成本 — 这些「模型之外的确定层」,就是 Harness 工程的全部内容。
原文里有这样一个例子:一家公司网关日志每天 T 级别(数万亿字节),直接喂给大模型显然不现实。他们的做法是先在数仓里做分层 — 把原始日志(ods 层)降到聚合指标层(dws 层),只剩几百兆,再交给模型做高价值推理。数据分层 + 模型调用这一整套配合,就是 Harness。
行业怎么看
一种声音认为,Harness 工程是 AI Agent 落地的胜负手。Andrew Ng(吴恩达)最近反复提到一个数字:90% 的 Agent 项目卡在部署环节,问题不在模型不够强,而是周边工程没跟上。Harness 概念相当于把这个被忽视的环节正式命名。
但我们也注意到反对意见。一位资深工程师提醒:Harness 不是越多越好。社区里有人反馈,装了上万个 skill(技能插件,即给模型配的工具箱)的 Agent,效果反而变差 — 工具一多,模型注意力分散。另外一种意见是:预算充足、直接用最强模型时,Harness 反而可能「压低上限」。所以 Harness 不是万能药,更像「在可靠性和天花板之间做取舍」的工程纪律。
模型能力迭代很快,Harness 却至今没有标准模板。不同企业的实践路径完全不同,这才是真正的难点。
对普通人的影响
对企业 IT:评估 AI 项目时,别只问「用的什么模型」,还要问「Harness 怎么做」 — 上下文管理、失败兜底、成本控制这三个问题的答案,往往比模型版本更重要。
对个人职场:「会写提示词」只是入门级技能。未来更稀缺的是懂 Agent 周边工程的人 — 能设计约束边界、拆解复杂任务、做过稳定性优化的人才,比纯 prompt engineer 更值钱。
对消费市场:短期影响有限。但中长期,企业级 AI 服务的稳定性差异会越来越影响买单意愿。能稳定跑一年的 Agent,比 demo 惊艳但三个月就崩的产品,更有商业价值。