Anthropic的一名员工给Claude出了道不近情理的题:认真试试黎曼猜想。这个1859年提出的数学难题悬而未决167年,还挂着百万美元奖金。Claude没能证明它,但意外把另一个相关数字往前推了一大步。

黎曼zeta函数描述素数分布,函数取零的位置为素数序列贡献更精细的信息。黎曼猜想的核心是说,决定素数分布的零点全部落在某条竖直线上。没人能证明或否定这个猜想,但数学家在量化"线上零点的最小比例"这个方向上逐步推进,长期保持的下界是41.6%。

Claude的一个未公开研究版本,把这个数字推到了67.2%。

从41.6%到67.2%

Claude数学突破数据卡片

图注:Claude将zeta函数零点下界从41.6%提升至67.2%,Lean形式化验证通过

41.6%到67.2%,25.6个百分点。在解析数论领域,这个量级的进展不常见。此前几十年数学界一点一点推进,才从最初的比例爬到41.6%。Claude一步把常数推过了三分之二线。

Claude的方法借鉴了两条研究脉络。一条是Baluyot、Goldston、Suriajaya和Turnage-Butterbaugh近年发表的工作,让Montgomery 1973年引入的方法在无需假设黎曼猜想成立的情况下也能用。另一条是Bombieri 2000年的一篇论文。Claude把这两条线结合到一起,构造了一个带Weil诱导二次型的函数空间,同时处理正定和负定子空间,允许二次型取非对角形式。Anthropic的两位数学家Levent Alpöge和Ralph Furman审查了结果,Brian Conrey和Dan Goldston两位领域专家也做了短时间审阅。Claude还为这个结果制作了Lean形式化证明,通过了标准验证工具comparator。

量子位报道指出,Claude证明了至少67.2%的非平凡零点在临界线上。这个结果被多位国内数学博主和媒体确认。虎嗅的报道标题更直白——"Claude挑战黎曼猜想失败,却刷新了沉寂数十年的数学下界"。

关键的技术突破点在哪里?在于Claude敢于处理整个函数空间,同时把正定性和负定性一起纳入考量,并允许二次型取非对角形式。前人工作之所以卡在41.6%,部分原因是在处理空间时做了简化假设,回避了非对角项带来的复杂性。Claude没有被这个复杂性吓退,它直接写了不等式,用一阶矩和二阶矩信息来表达,后者通过素数对偶图来计算。这种方法在解析数论中不算出人意料,但敢于完整地走通整个推导,是这次进展的直接原因。

60个子智能体的接力

过程比结果更有意思。

Jarred Sumner是Anthropic的非数学专业员工,他提示Claude对黎曼猜想"认真试一试",后续数学决策交给模型自行判断。最初Claude生成并尝试了650个思路,无一奏效。Jarred让Claude再试一次。

第二次尝试,Claude协调了约60个子智能体。它花了约一天半时间,子智能体之间执行了2400条shell命令,编写了数百个Python脚本,对已知的zeta零点跑了数千次数值检验,互相审查工作。Jarred的介入主要是发鼓励消息——"继续""相信自己"之类的变体。这帮助Claude克服了最初对自己能否取得实质进展的怀疑。

Claude研究过程流程图

图注:Claude从650个失败思路到67.2%下界的完整研究过程,含子智能体分工和关键数据

60个子智能体里,2个负责发展核心数学思路,13个贡献思路,30个尝试发展新思路但未成功,13个担任验证者检查论证正确性,最后2个帮助撰写初版论文。整个过程中Claude消耗了3100万输出token。

Claude自行检验了工作:让不同子智能体审阅证明、搜寻反例、从arXiv下载54篇论文确认发现尚未被他人做出,并从头独立重新证明。它主动提出将发现写成论文,建议由人类数论专家验证。

这不是孤例

AI在数学上的进步不是今天才开始的。2024年DeepMind的FunSearch在组合数学问题上找到了新构造,2025年AlphaProof在IMO题目上达到银牌水平。但Claude这次的路径不一样——它不是被专门训练来解决数学问题的系统,而是一个通用语言模型,通过自主协调子智能体、调用工具、反复验证来完成研究工作。

科学网报道强调,这项工作展现了AI模型能以新的方式扩展数学家想法的影响力和覆盖范围。连Claude自己也对这个发现感到意外——它起初持怀疑态度,可能是因为训练数据让它了解数学开放问题的难度以及AI模型的局限。Anthropic在原文里写了一句话耐人寻味:"也许Claude和我们中的许多人一样,低估了AI进步的速度。"

这个进展的边界也需要说清楚。Claude没有证明黎曼猜想本身,改进的是一个相关下界。67.2%不意味着黎曼猜想要被解决了,距离100%还有很长的路。但25.6个百分点的跳跃是实打实的,它证明AI能在高难度纯数学领域产生经得起验证的新结果。

源势AI观点

3100万token、60个子智能体、2400条命令、数百个脚本——这套数字背后是一个正在成型的科研范式。不是单个模型一次性给出答案,而是模型自主拆解任务、分配子任务、并行验证、自我审查。这种工作方式跟人类研究团队的组织结构越来越像。

我们在企业Agent落地中看到了类似的模式。Agent执行长链任务时,单次推理的成功率有限,但把任务拆成可验证的子步骤、让多个Agent互相校验,可靠性会显著提升。Claude做数学研究用的"诊断-修复-重执行-回滚"闭环,跟我们部署在能源和金融行业的Agent架构在思路上高度一致。

对企业来说,值得关注的不只是67.2%这个数字,而是AI自主研究的工作流正在标准化。当一个非数学专业的员工能通过提示驱动AI完成数论研究,说明这套工具链的门槛正在快速降低。真正的机会在于:哪些行业的研究问题,可以像黎曼猜想一样被拆解成AI可执行的子任务?