编译器几毫秒就能判定一段代码对错,工程师 review 最快也要几分钟 — 是一百万倍差距。我们关心的是,这个差距恰好解释了为什么 AI Agent(能自主执行任务的 AI)在编程领域已经能写能改,在医疗、法律、企业管理却迟迟跑不通。
这是什么
原作者提出两个原因。
一是知识能否被「压缩」。编程里 x + 1 永远是 x + 1,没有上下文依赖。但医学里的「疑似」「不排除」、法律里的「合理注意义务」、管理里的「合适时机」,模糊本身就是知识最精确的形态 — 强行压缩成确定性规则,丢失的是信息本身。
二是有没有快速、客观的「裁判」。编程有编译器、有单元测试,几毫秒就能跑一次「尝试→反馈→调整」的强化学习(让 AI 通过试错自我改进的训练方法)循环。其他领域呢?医生开药要等几周临床结果,律师写合同要等纠纷发生,管理者决策要等半年看业绩。反馈链路一断,Agent 只能停留在「模仿人类输出」,跨不过「从错误中学习」那道门。
GitHub 之所以特殊,是因为 commit、PR review、单元测试天然构成了完整的因果链 — 10 万 star 的项目模型自动判断更靠谱。这种结构在病历、判决书、ERP 里压根不存在。
行业怎么看
这并非行业共识。乐观派认为:Claude 的 Computer Use、OpenAI 的 Operator 正在把「工具调用」标准化,Cursor 估值冲到 100 亿美元本身就是市场对 Agent 垂直爆发的赌注。
但质疑同样尖锐。原作者判断:复制编程路径需要「领域级 GitHub」,医疗、法律、企业管理短期内建不起来,未来 5 年 Agent 真正落地的还是「有编译器当裁判」的领域。
更冷静的反对:原作者低估了人类反馈路径。Anthropic、OpenAI 用 RLHF(基于人类反馈的强化学习)训练对齐,问题在于成本 — 一位高级医生半小时判断一个处方对错,按市场价几百块。要训练出可用的垂直 Agent,反馈数据量是天文数字。
对普通人的影响
对企业管理 / IT:评估 AI 项目时先问 — 这个场景有没有「几毫秒级客观反馈机制」?有,可试;没有,大概率 demo 漂亮但留不下来。
对个人职场:与其追「全能 Agent」,不如看本职工作的「可验证环节」在哪 — 代码、报表核对、合同条款匹配 AI 能立刻提效,需权衡模糊因素的判断 AI 短期帮不上。
对消费市场:医疗、法律、教育类「AI Agent 产品」短期内大概率仍是营销包装,付费前多问一句「判断错了谁承担后果」,比看 demo 更能识别泡沫。