开发者社区这周流传一组数据:DeepSWE 软件工程评测上,$0.61 单任务成本的轻量模型拿下最高分,Claude Opus、GPT-5 这些贵几倍的模型反而打不过它。我们注意到的不是模型能力的胜负,而是 AI 行业的下一个信号——「贵的想方案,便宜的搬砖」这种分工正在固化。

这是什么

事情源头是 OpenAI 的代码编辑器 Codex 用户社区。开发者们摸索出一套工作流:让贵的推理模型留在主线程负责规划、决策,把便宜的轻量模型配置成"子 Agent"(可以理解为 AI 帮你派出去干活的小弟)去执行具体的代码扫描、文件检查、测试这些重复劳动。

分工的逻辑不复杂。贵的模型确实强,但 OpenAI 自己也承认一个现象:对话越长,模型越容易"上下文腐烂"(Context Rot),开始忘记之前的约定、重复犯错、出现幻觉。解法是把执行类的脏活隔离到独立线程,让主线程保持清醒。

行业怎么看

支持的声音很响。DeepSWE 榜单上 $0.61 单任务成本打最高分这件事,说明大量执行类任务上,便宜模型已经够用。开发者社区疯传一个测算:用 ChatGPT Plus 套餐跑这套方案,能跑出 Pro 套餐 20 倍的效果。

但反对意见也值得听。一种质疑是:把任务拆给子 Agent 后,主 Agent 的协调成本会上升。如果拆得不好,主 Agent 反而要花更多 token 去理解子 Agent 的输出,整体成本不一定省。另一种风险更根本——AI 编程工具每三个月换一轮"最优方案",今天精心调的子 Agent 配置,下个版本可能就是历史包袱。

对普通人的影响

对企业的 IT:预算模型可能要改。过去买 AI 工具是"一个模型包打天下",未来是"贵的管思考、便宜的管执行",算账逻辑会越来越像雇人。

对个人职场:哪怕你不是程序员,"贵的想、便宜的干"的分工思路会渗透进日常 AI 工具。你可能要开始习惯"指挥一个 AI 团队"而不是"问一个 AI"。

对消费市场:ChatGPT 这种消费级 AI 产品,很可能也会分化出"思考版"和"干活版"两个 SKU(最小销售单元),按场景分别计费。