Anthropic 这周放出一篇研究:Claude 在一个与黎曼 zeta 函数(一个和素数分布有关的数学函数)相关的难题上,反复尝试 650 次后,终于打破了人类保持的纪录。几乎同一时间,Scientific American 发了一篇标题叫《不,AI 并没有解决数学中最棘手的问题》。我们看完两边材料后认为:这件事真正值得关心的,不是 AI 有多强,而是它"死磕"这件事的方式。

这是什么

黎曼 zeta 函数的零点分布是数学中悬了近 160 年的核心问题。Anthropic 的研究并不是让 Claude 直接证明黎曼猜想——这是公认极难的开放问题——而是让它在一个相关、可验证的子任务上和人类数学家对擂。Claude 的方法不优雅:模型自己尝试、自己看错、自己改、再来一轮。650 次里大部分都是错的,最后一次才跑出超过人类的结果。

这种"反复试错、自我修正"的路径,正是过去一年大模型公司押注的方向:不是一次答对,而是能持续迭代。

行业怎么看

Anthropic 把这当作推理能力的展示窗口,强调"AI 在数学这类硬科学上能自我纠错"。社区反应两极。

反对意见很具体。Scientific American 的反驳指出:这个子任务的难度被人为降低了,Claude 的"突破"在设定上就接近过拟合(记住套路而非真学到数学);同时,把"超过人类现有纪录"等同于"AI 比数学家强"是偷换概念。研究人员真正在意的是能否迁移到未知问题,论文里没回答。

我们更倾向后者:单点纪录不等于能力跃迁,但 Anthropic 愿意把 650 次失败过程公开,本身比结果更值得看。

对普通人的影响

对企业 IT:如果"AI 自我迭代"被验证,工程上意味着可以减少人工调优次数,但短期内算力成本会涨。

对个人职场:这种"AI 做大量试错、人类做判断"的协作模式,最先会出现在代码和数据分析岗位。

对消费市场:用户不会直接感知,但下一波 AI 助手的卖点可能会从"更聪明"转向"更耐挫"。