跑了 30 轮任务,AI 编程助手就翻车 — 这暴露的真正问题不是模型不够强,而是工程债没人还。一名中国开发者刚把这种"猝不及防"的死法做成了开源方案。

这是什么

具体场景:长任务跑到第 30 轮,某个工具返回大段结果,下一轮请求被 API(模型调用接口)拒绝 — 报错"对话超长"。他的判断是:这种崩溃必须由 Agent(能自主完成多步任务的 AI)自己救活,不能抛给用户。

做法是修一条"紧急逃生通道":识别 → 瘦身 → 重发。有两点细节值得记:DeepSeek、OpenAI 等四家厂商对同一问题有四种不同报错措辞,识别口径不统一会浪费重试额度并触发错误降级(出错时降低输出质量),他把识别逻辑收敛到一处;紧急压缩设两道保险 — 60 秒冷却窗口加单会话 5 次上限,只保留系统提示、一条边界占位和最近 5 条对话,其余从磁盘快照找回。

行业怎么看

看好的一方:我们注意到,头部团队正把长任务(多轮 Agent)视为 AI 编程助手的真正战场。模型层已被开源卷到同质化(各家模型效果趋同),护城河在工程细节 — 谁能稳定跑完 100 轮不崩,谁就赢。

但必须说风险:这套方案本质是"在沙地上盖楼"。错误识别靠关键词匹配、对话快照靠文件系统、压缩时机靠启发式规则(凭经验拍脑袋定的规则),任一环节出错都会让 Agent 产生幻觉(看似合理但不符合事实的输出)或丢失关键上下文。更深的问题是:这些补丁分散在每个动手的开发者手里,没有人在做平台级抽象。基础模型每三个月一换,补丁随时可能失效 — 这不是技术问题,是生态问题。

对普通人的影响

对企业 IT:评估 AI 编程助手时,稳定性比"能不能写代码"更重要 — 一份能跑完的活比一份写一半崩掉的活值钱。

对个人职场:开发者做 AI 相关工作,"工程债"是新机会 — 模型层人人能调,错误处理、上下文管理这些脏活反而稀缺。

对消费市场:现阶段别指望 AI 助手稳定完成长任务(订机票、写报告、跑流程),它们擅长短指令;遇到复杂任务会突然"失忆"。