离了个大谱!
Anthropic 还没发布的科研版 Claude,在挑战千禧年数学难题黎曼猜想的路上,意外搞出了一个此前没人预料到的新结果。
先说最重要的,Claude 并没有真正证明黎曼猜想。毕竟这可是从 1859 年一路困扰人类顶级数学家 167 年,至今还挂着 100 万美元奖金的终极 Boss。
但在尝试解题的过程中,它顺着另一条研究路线继续往前走,最后把一个与黎曼猜想密切相关的重要下界,从此前的 41.6% 一口气提高到了 67.2%。

更抽象的是,让 Claude 完成此次任务的 Anthropic 员工,甚至不是数学家。他在研究过程中提供的技术指导少得可怜,大部分时候负责的事情只有一个:
给 Claude 疯狂输出情绪价值。
主打一个赛博玄学,只要你足够相信自己,没准数学难题都会先动摇一下。(懂的都懂)
为了看懂 67.2% 到底意味着什么,得先简单介绍一下黎曼猜想。
1859 年,德国数学家黎曼在研究 zeta 函数时发现,这个函数的一系列特殊零点,与素数在整个数字世界里的分布存在非常深刻的联系。
你可以粗略把素数理解成数字世界里的「底层代码」,而黎曼 zeta 函数的零点,则记录着这些代码背后隐藏的某种规律。

黎曼猜想提出,所有重要的非平凡零点,应该全部整整齐齐地位于复平面上一条特定的竖线上,也就是数学家所说的「临界线」。
问题在于,一百多年过去了,无数数学大牛前赴后继,谁也没能严格证明所有零点都在那里,同样没人找到一个确定违反猜想的反例。
于是数学家换了一种思路。既然暂时证明不了 100%,那就先研究一个稍弱的问题:至少有多少比例的零点,可以被严格证明位于临界线上?
过去几十年,好几代数学家沿着这条路线不断推进,最终把能够严格证明的比例下界提高到了约 41.6%。

Claude 这次推进的正是这个数字。从 41.6%,提高到 67.2%。
所以,千万别把它理解成「黎曼猜想已经完成了 67.2%」。67.2% 指的是 Claude 给出了新的论证,可以证明至少这么大比例的相关零点位于临界线上,而黎曼猜想真正要求的是所有非平凡零点,也就是 100%。
数学研究当然也不是游戏进度条,从 67.2% 到 100% 更不意味着只剩「最后 32.8%」。但单看这个长期有人研究的相关问题,从 41.6% 提高到 67.2%,依然足够显眼。
那么 Claude 到底是怎么办到的?
故事的起点甚至有点草台感。Anthropic 员工 Jarred Sumner 跑去给尚未发布的科研版 Claude 下达了一个多少有点不讲道理的任务:
「认真尝试攻克黎曼猜想。」

更关键的信息是,Sumner 本人甚至不是数学家。他没有提前规划研究路线,也没给 Claude 指定具体应该用哪套数论工具,后面的数学选择基本都交给模型自己完成。
Claude 最开始也没创造什么奇迹。它一口气生成并测试了大约 650 个思路,然后喜提 650 连败,没有一个能够真正解决问题。
普通故事发展到这里,大概已经可以整理实验报告,下班回家了。
Sumner 却又让 Claude 继续,而根据 Anthropic 的说法,他后续提供的很多输入甚至只是「继续」「相信自己」「坚持下去」之类的鼓励。

我嘞个豆,这多少有点赛博玄学了。
但 Claude 还真继续了。接下来一天半,它开始协调大约 60 个 Claude 子 Agent 深挖这个问题。这些 Agent 总计执行约 2400 条 Shell 命令,写了数百个 Python 脚本,还针对 已知的 ζ 函数零点进行了数千次数值检查。
更关键的是,它们并非各算各的。
在 60 个子 Agent 中,有 2 个负责提出并发展最关键的数学思路,13 个为它们提供了思路和启发,30 个尝试提出新的想法但没有成功,另有 13 个担任验证者,负责检查论证是否正确,最后 2 个则协助撰写了论文初稿。
到了这里,整个工作流已经越来越不像「让一个聊天机器人回答数学题」,更像临时拉起了一支由几十个 AI 研究员组成的数学团队。
在两次论证过程中,Claude 消耗了整整 3100 万个输出 token。
真正的突破,来自 Claude 对几项既有数学工作的重新组合。
其中一条研究线可以追溯到数学家 Hugh Montgomery。1973 年,Montgomery 在研究 zeta 函数零点分布时提出了一系列重要技术,只不过其中部分方法需要预先假设黎曼猜想成立。
后来,Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh 等数学家又发表了一系列研究,让其中一些方法在不预设黎曼猜想成立的情况下也可以工作。
Claude 沿着这条线继续寻找,又把它与数学家 Enrico Bombieri 在 2000 年发表的一项研究联系到了一起。

https://eudml.org/doc/252338
换句话说,它并没有凭空发明一整套此前不存在的数学理论,更有意思的地方在于,它从大量前人工作中找到了一个过去没有被充分利用的组合方式。
从技术上说, Claude 选取了一个合适的有限维函数空间,并考察 Weil 厄米型在这个空间上的限制,其中 在线性代数的表述里,临界线上的不同零点会贡献一个秩为 1 的非负结构,而临界线外成对出现的零点,则会贡献一个 signature 为 (1,1) 的不定块。
随后,它没有将这些结构分开处理,而是把整个空间放到一起研究, 同时允许表示这个厄米型的矩阵出现非对角项,再借助一阶矩和二阶矩信息,建立关于相应矩阵秩的不等式。
连 Anthropic 在自己的技术说明里,都专门用了一个颇有人味的词形容其中关键的一步:courage。也就是「胆量」。

比起算出矩信息本身, 真正让结果发生变化的,是 Claude 敢于把线上零点贡献的非负部分和线外零点产生的不定结构放在同一个框架里处理,同时允许对应矩阵存在非对角项。
最终,我们就得到了一个 67.2% 的数字。
所以与其说 Claude 是凭空领悟了什么「绝世神功」,更准确的描述其实是,它把几十年来不同数学家留下的方法重新排列组合,然后发现了一条此前没有走通的路。
对于 AI 科研来说,后者可能反而更值得关注。
结果出来以后,Claude 并没有马上宣布自己创造了数学史。
它先开始怀疑自己。毕竟做开放数学研究最尴尬的一种情况,就是兴奋地发现一个「新定理」,最后才发现某位数学家几十年前已经写进论文了。
于是 Claude 让不同子 Agent 重新检查证明、主动搜索反例,又从 arXiv 下载了 54 篇相关论文,检查相同结果是不是早已经被别人发表。
它甚至安排其他 Agent 尽量独立地重新推导结果,用另一条路径检查原来的证明,随后主动提出把研究成果写成论文,并建议 Anthropic 找真正的人类数论专家进行验证。

Levent Alpöge
因此,Anthropic 内部两位数学家 Levent Alpöge 和 Ralph Furman 开始检查 Claude 的工作,研究这项新结果与此前文献之间的关系,并整理出一份更加简洁的证明说明。
与此同时,Claude 又和 Anthropic 员工 Eric Easley 合作,将核心结果写成了一份 Lean 形式化证明,目前已经通过 comparator 验证工具的检查。
Anthropic 还邀请了这一领域的两位专家 Brian Conrey 和 Dan Goldston,在较短时间内审阅了相关论文。
不过这里需要强调一下,Lean 验证通过,意味着被形式化进去的证明过程符合严格的逻辑规则;专家审阅也不等同于一项成果已经经过漫长、完整的学术共同体检验。
截至目前,更准确的状态是:Anthropic 已经完成了内部数学家检查和形式化验证,并邀请相关领域专家审阅,接下来还要等待更广泛的数学界继续检验。
Anthropic 自己也很清楚,这项结果距离 AI 证明黎曼猜想「还有十万八千里」。
Anthropic 官方明确表示,他们并不认为 Claude 目前使用的这套技术能够一路继续推进,最终解决黎曼猜想。
真正让他们感兴趣的,是整个发现过程。
过去我们衡量 AI 数学能力,经常看 IMO 能做几道题,或者某个 benchmark 能拿多少分。这类题再难,答案至少已经存在,模型需要寻找的是一条通往已知答案的路线。
开放数学研究完全是另一回事。没人提前知道答案是什么,也没人知道哪条路线一定正确。

Claude 这次接到的是一个人类至今没有解决的开放问题,它连续尝试了 650 个失败方案,组织 60 个子 Agent 搜索和验证,阅读前人研究,进行数值实验,再把几组已有数学工具重新组合,最后得出了一个意外的新结果。
最有意思的是,Anthropic 透露,Claude 自己一开始甚至对取得真正的新进展颇为怀疑。一种可能是,它在训练数据里读过太多关于数学开放问题有多难、AI 在科研上有多少局限的内容,结果反而把这种「常识」也学了进去。
最后却是人类在旁边一句又一句「继续」「相信自己」,让它一直尝试了下去。Anthropic 在文章结尾也忍不住调侃,或许 Claude 和很多人一样,都低估了 AI 能力进步的速度。

Jacob Tsimerman
前阵子,菲尔兹奖被戏称为人类的最后一届菲尔兹奖。新晋菲尔兹奖得主Jacob Tsimerman获奖当天宣布加入 OpenAI,或许也正是看到了 AI 如今的发展速度。
以后数学研究大概率越来越多地出现类似场景:一个人提出研究问题,几十个 AI 同时翻论文、写程序、验证猜想、互相审稿,再由人类数学家判断其中哪些路线真正值得继续?
甚至可以再往前一步,当过去只能串行进行的研究,变成几十个、上百个 Agent 同时探索不同路线,AI 带给数学家的可能也不只是一个更快的计算器。那些过去因为时间、精力和阅读规模有限而来不及尝试的想法,会第一次拥有被大规模验证的机会。
Claude 今天也没能翻过这座困住人类 167 年的大山,黎曼猜想仍然横亘在那里。只是从今往后,那些曾经只能由少数天才独自跋涉的数学无人区,如今逐渐有了来自 AI 的同行者。
附上官方博客地址:
https://www.anthropic.com/research/riemann-zeta
