据量子位报道,人工智能公司Anthropic于9月5日宣布,其AI模型Claude已完成费马大定理首个端到端、可由计算机完整检查的形式化证明。该项目由清华大学姚班校友、哥伦比亚大学助理教授Tianyi Peng主导,耗时11天,生成约1300万行Lean代码,规模超过Lean核心数学库Mathlib的5倍。
费马大定理是指对于任意整数n>2,不存在正整数a、b、c满足aⁿ+bⁿ=cⁿ。这一命题由英国数学家Andrew Wiles在1994年最终证明,但将其转化为计算机可验证的形式化证明,数学界此前预计需要多年工程。2024年,帝国理工学院Kevin Buzzard等人启动了使用Lean实现该形式化的多年社区项目,项目第一阶段技术蓝图就有86页。Claude在11天内完成了这一工作。需要指出的是,Claude并未提出新的费马大定理证明,而是将人类数学家能读懂的Wiles证明翻译成一行行可由Lean检查的形式化代码。
这一形式化证明包含超过3万个中间定理,最终证明使用了其中约29500个,代码总量超过Mathlib自身规模的5倍。Anthropic表示,完整证明只依赖Lean的三个标准公理,并通过比较程序确认,Claude最终证明的定理陈述与Mathlib中的费马大定理完全一致。也就是说,审查证明有效性的裁判是Lean,而非模型自身声称。
在工程实现上,Claude以多智能体协作方式并行推进。项目早期,多个智能体无法有效协作,这些失败尝试留下的代码仅占成品非模板代码的约7%。转折点出现在团队引入“Prove2Me”平台后。该平台由Tianyi Peng及其哥伦比亚大学合作者搭建,将整个证明拆成由定理节点构成的有向无环图,帮助各智能体判断进度、拆分任务并复用已有结果。最终,Anthropic采用Prove2Me加基于Claude Code的multi-agent harness完成项目,整个项目消耗约60亿个输出token,内部使用的通用研究模型能力大致相当于Claude Fable 5.1。人类在这一过程中提供的数学指导非常有限,Tianyi Peng仅给出少量高层提示,大量定义、中间证明和任务拆分由Claude自行完成。
负责审阅结果的Kevin Buzzard评价称,这是一次“非凡的自动形式化成果”。由于费马大定理形式化此前被视为一项多年工程,而Claude以11天完成,这一成果意味着依赖人工、推进缓慢的数学文献形式化工作,可能第一次具备了大规模提速的条件。