这是什么

9 月 28 日 Anthropic 发布 Claude Sonnet 5.5,速度涨 30%、价格不变——但换模型最大的坑,从来不是接不通,而是悄悄变差。官方 Terminal-Bench 4.0 跑分 70.6%,那是通用能力考场;你的客服、代码审查、文档抽取才是真实业务考场。模型 ID 改为 claude-sonnet-5-5,原来控制思考模式的开关换成 between_tools 设置。

行业怎么看

乐观派认为:价格不变、速度更快,多数任务 token(模型处理文字的计量单位)消耗减少,单次成本可降 30%。这是一次性价比升级。

反对意见更值得听。三类"静默回归"最危险:

  • 结构合法、含义变了。比如"需人工复核"的判定被悄悄放松,JSON(一种结构化数据格式)校验不会报错。
  • 平均更快,尾部更慢。工具链任务多两次重试,P95(95% 请求的最慢响应时间)会比均值先暴露问题。
  • 安全回退可能改写高风险任务的行为。官方说 5.5 的高风险网络安全请求可回退到上一代。

实操建议是先做"离线迁移门禁":挑 30 个真实业务样本,新旧模型同时跑,对比成功率、延迟、token 用量,三项都过线才上 1% 灰度(先把 1% 流量切到新模型观察)。

对普通人的影响

  • 对企业 IT:换模型应像一次正式上线,先离线比对、再小流量灰度、最后按门禁扩容,不能只看每百万 token 的单价。
  • 对个人职场:用 AI 写代码、改文档的体感会快一点,但"新版一定更聪明"是错觉;同一问题新旧版本答案可能不一样,关键决策还是要复核。
  • 对消费市场:基于 Claude 的客服、内容审核、内容生成服务,短期内可能更顺滑,但也可能更粗心,遇到明显降级值得反馈。