95% 的单步正确率,连续做 50 步时整体成功率还不到 8%,这说明大模型眼下的关键矛盾已不是会不会答,而是能不能把长任务稳定做完。我们注意到,Anthropic 给 Claude Fable 5 最先摆出的卖点,不再是 Benchmark(基准测试),而是 Agents(智能体,能自主拆解并推进任务)、Coding 和 Enterprise workflows(企业级工作流)。这不是包装变化,而是路线变化。

这是什么

Anthropic 在押注下一代大模型的形态:从“聊天工具”变成“可被委托的工作系统”。它希望用户不再一步步提问,而是交代目标后,让模型自己规划、执行、检查并交付。按文中数据,同样写一篇文章,普通对话的中位交互是 13 轮;到了 Claude Code,超过一半任务只需 1 次人类指令,后续主要由模型推进。

行业怎么看

我们的判断是,大模型没有到头,但通用聊天能力的边际增量正在让位给任务执行能力。Anthropic、OpenAI、微软都在往企业流程里走,说明真正的竞争已从“谁更会说”转向“谁更能接活”。但反对意见也成立:长链路任务的误差会累积,接入企业工具后还会放大权限、审计和责任归属风险;如果最后仍需大量人工复核,商业价值就会被打折。

对普通人的影响

对企业 IT:重点会从采购模型,转向改造流程、权限和验收机制,谁能把 AI 接进真实业务,谁才更容易见到回报。

对个人职场:很多知识工作会从“自己做”变成“先委托再复核”,会提需求、会检查结果,重要性会上升。

对消费市场:普通用户未必立刻感到模型“突然更聪明”,但会逐步接受 AI 帮自己完成一整段任务,而不只是陪聊和问答。