Anthropic 较新的 Opus 4.8 和 Sonnet 5,竟比同家族旧模型更容易把工具调用参数写错;我们的判断是,AI 正从“比谁更聪明”进入“比谁更能接进真实流程”的阶段。
这是什么
开发者 Armin Ronacher 在调试 Pi 时发现,新版 Claude 模型调用编辑工具时,会在 edits[] 这样的参数数组里凭空添加不符合规范的字段,结果工具直接报错。问题不在生成内容本身,而在工具调用(模型按既定格式向外部软件发指令)这一步失真。
这件事的关键,不是“模型偶尔出错”,而是“更先进的模型在某些工具上反而更差”。一个可能解释是,模型被专门训练去适配自家环境里的工具,离开原生工作台,到第三方系统就容易跑偏。
行业怎么看
这对 Agent(能连续调用工具完成任务的 AI 助手)和企业软件是个提醒:模型能力不再等于可用性。OpenAI 的 Codex 偏向 apply_patch,Claude Code 偏向 search-and-replace;不同厂商正在把模型和自家工具链一起训练,表面上更顺手,实际也可能加重生态绑定。
反对意见也成立:这未必说明模型退步,可能只是第三方工具定义得不够贴近主流训练方式,或者校验机制太硬。但风险在于,一旦每家模型都“最懂自己那套工具”,跨平台兼容成本就会快速上升,开发者可能不得不为同一功能维护多套接口。
对普通人的影响
对企业 IT:选大模型不该只看评测分数,还要看它和现有系统、流程软件能不能稳定对接。后续集成和维护,可能比模型授权费更贵。
对个人职场:会用提示词不再够,懂一点流程设计和工具编排的人,会更容易把 AI 真正接进工作,而不是停留在聊天窗口。
对消费市场:看起来更聪明的 AI 产品,实际体验可能更不稳定。未来用户买的不是“最强模型”,而是“最少出错的整套服务”。