AI界的数学里程碑:Claude 仅用 11 天拿下费马大定理端到端形式化证明
Anthropic 于近日宣布,旗下 AI 模型在基本自主运行11天后,成功完成了对费马大定理(FLT)的首个端到端、经过计算机检查的 Lean 形式化证明。这项工作并非由 AI 重新发现该定理的数学证明,而是将已有数学证明转换为 Lean 证明助手能够逐步验证的形式。Lean 是一种用于编写和验证形式化数学证明的证明助手,能够通过计算机检查证明中的逻辑步骤。 在这一过程中,Claude 生成了约
Article
Anthropic 于近日宣布,旗下 AI 模型在基本自主运行11天后,成功完成了对费马大定理(FLT)的首个端到端、经过计算机检查的 Lean 形式化证明。这项工作并非由 AI 重新发现该定理的数学证明,而是将已有数学证明转换为 Lean 证明助手能够逐步验证的形式。Lean 是一种用于编写和验证形式化数学证明的证明助手,能够通过计算机检查证明中的逻辑步骤。
在这一过程中,Claude 生成了约1300万行 Lean 代码,并证明了约3.03万个定理,其中约2.95万个中间定理最终被纳入费马大定理的完整证明。整个证明由 Lean 完成检查,仅使用了 Lean 的3条标准公理。这项工作的目标是将英国数学家安德鲁 · 怀尔斯于1995年完成的费马大定理证明进行形式化。费马大定理指出,当整数指数 $n$ 大于2时,不存在满足 $a^n + b^n = c^n$ 的正整数 $a$、$b$、$c$。怀尔斯的原始证明长达129页,其正确性在发表前经历了数月人工核查。
数学形式化的难点在于,人类数学证明通常会省略大量被认为显而易见的推导步骤,而 Lean 需要明确验证每一个逻辑环节。此外,数学家长期以来会引用大量尚未被形式化的既有数学成果,因此将完整证明转换为计算机可验证形式通常需要投入大量时间。Anthropic 此前曾预计费马大定理的形式化工作可能需要数年时间。
此次项目由 Anthropic 研究人员 Tianyi Peng 发起。Claude 并非由单个智能体完成全部工作,而是通过多智能体协作完成概念定义、中间定理证明以及更复杂命题的推导。项目使用了由 Peng 及其哥伦比亚大学合作者开发的 Prove2Me 平台,用有向无环图记录待证明的定理及其依赖关系,并支持多个 Claude 智能体并行工作。最终证明遵循了 Darmon、Diamond 和 Taylor 对怀尔斯证明的简化版本。人类研究人员提供的数学输入主要是少量高层次指令,例如确定某些数学对象或定理的优先级,具体证明过程则主要由 Claude 完成。
整个项目消耗了约60亿个输出 Token,使用的是一个与 Claude Fable5.1大致相当的通用内部研究模型。最终生成的证明规模超过 Mathlib 这一主要数学证明库的5倍。Anthropic 特别强调,此次成果的重点并不是 AI 独立提出了新的费马大定理证明,该定理早在1995年已由怀尔斯证明,此次工作的创新之处在于利用 AI 大规模自动完成证明形式化,并由 Lean 对最终结果进行计算机验证。
Anthropic 认为,如果类似的自动形式化技术能够扩展到更多现代数学成果,就有望降低数学研究中验证新证明的人工成本。随着 AI 生成数学成果的数量增加,为面向人类阅读的数学证明同时提供形式化版本,未来可能成为常见做法。此次项目的完整 Lean 证明已经公开在GitHub上。同时,数学家 Kevin Buzzard 对该证明进行了审阅,并认为这项自动形式化成果显示,AI辅助形式化大型数学成果已经取得重要进展。
Source: a public AI news aggregator. Copyright belongs to the original authors and outlets; this site only indexes and summarises. Contact us for removal.