这是什么

一篇题为《Zig Creator Calls Spade a Spade, Anthropic Blows Smoke》的评论文章,点名批评 Anthropic 的叙事方式,判断很直接:AI 公司在代码能力上的部分宣传,和真实开发体验之间有落差。这里的关键,不是谁在网上吵赢了,而是开发者社区开始更公开地追问“到底能不能稳定交付”。

如果说过去一年市场更看重模型演示效果,现在讨论重点已经转向工程可信度:报错怎么处理、长任务会不会跑偏、改老系统会不会越改越乱。这是 AI 编程工具从“看起来很强”走向“能不能进公司流程”的分水岭。

行业怎么看

我们注意到,这类批评代表了一种更成熟的行业心态:模型能力当然在进步,但厂商如果把少数高光案例讲成普遍能力,反噬会越来越快。尤其在编程场景,用户不是看 demo,而是看上线后的返工率、维护成本和责任边界。

反过来看,也有反对意见:开发者社区往往更苛刻,容易把“还不完美”直接等同于“没有价值”。这并不完全公平。很多 AI 编程产品对样板代码、测试补全、文档整理已经有明显帮助。真正的风险不在于工具没用,而在于企业按营销口径采购,最后用工程团队兜底。

对普通人的影响

对企业 IT:采购标准会更务实,单看模型榜单不够,是否能接入现有代码库、权限系统和审计流程,会比“会不会写一段漂亮代码”更重要。

对个人职场:会用 AI 写几段代码不再是稀缺项,能把 AI 产出校验、改对、接进真实业务,才更像稳定能力。

对消费市场:面向大众的“人人都能做软件”叙事会继续,但用户会更快分辨哪些是玩具、哪些能长期用,口碑会比新功能发布更值钱。