2026 年 9 月 4 日,Anthropic 研究页面出现了一个指向 formalizing-fermats-last-theorem 的 URL 路径。该页面当前公开的正文只有一段公司定位介绍:Anthropic 是一家致力于构建可靠、可解释、可操控 AI 系统的 AI 安全与研究公司。没有模型描述,没有证明框架,没有实验数据,也没有发布状态说明。
因此,围绕这条消息的第一个严谨判断是:"AI 攻克费马大定理"这个说法目前没有任何官方资料支持。URL 路径中的 formalizing 一词暗示,这个研究方向更可能是把费马大定理的证明转化为机器可验证的形式,而不是简单让模型用自然语言"解出"答案。但"暗示"本身属于推断,不是事实。页面没有说明使用了哪个证明助手、哪个模型、是完整证明还是部分定理,甚至没有说明这项工作属于自动发现证明路径,还是把已有证明做形式化翻译。以上信息全部缺失。
先把概念层面的背景讲清楚。在现代数学与计算机科学的交叉语境中,"形式化一个定理"与日常理解的"AI 做数学题"有本质区别。形式化通常意味着将数学陈述编码到某类类型论或逻辑系统之中,用交互式证明助手逐步构造证明项,并由内核程序逐一检查推理步骤。Lean、Coq、Isabelle 是这类工作中常见的工具,数学社区也长期存在把大规模数学结论纳入机器可验证体系的尝试。这类工作的目标不是生成"看起来合理的推导",而是让每个逻辑步骤都处在可机械检查的规则之下。也正因如此,评估一项号称"形式化费马大定理"的工作时,需要区分两种能力:模型是否有能力提出关键引理或构建证明路径,与证明是否真正完成了机器可验证的闭环。后者工程价值更高,难度也显著更大。
一个值得分析的工程问题是:为什么做 AI 安全的公司会关注这种任务。此处只能提出推测判断:Anthropic 官方强调可解释与可控,而长链条数学推理恰好具备清晰的成功判据——命题是否通过内核验证,很难被模糊的对话能力掩盖。如果模型能在高度结构化的证明环境中有效搜索中间步骤,这种能力对人机协作推理、算法验证甚至协议分析等安全相关场景可能有迁移价值。但官方资料中完全没有将这项工作与任何安全场景挂钩。以上推理只能作为观察视角,不能作为 Anthropic 的既定技术路线引用。
从工程落地的角度看,这里真正值得关注的是验证基础设施层面的问题。将晦涩数学结论翻译成机器可检查语言时,主要成本往往不是推理本身,而是消解定义歧义、补全隐式前提、建立可复用的形式化数学库。即便模型能在自然语言层面形成正确推导,要让证明进入验证环境,仍然需要把数学对象对接进具体库结构、处理作用域与重写规则、管理证明状态。若 Anthropic 这项研究真实存在并公开,验证社区真正期待的应当是基础设施层面的推进,而不是被叙事简化的"AI 战胜某个大定理"。
对开发团队而言,一个可行的做法是建立验证清单,等待官方正式技术说明后再做判断。清单可以包括:模型或系统是否开源;使用哪个形式化库;证明脚本是否可复现;是否在前人基础上真正覆盖了此前未形式化的结论;是否发布中间检查日志或失败案例。这些信息决定了这项研究能否被社区吸收,也决定了它到底是模型能力的证明,还是一次性的系统演示。
最后,应当明确当前资料无法回答的问题,并对此保持诚实。费马大定理的人类证明篇幅极长,依赖现代数学中多个深层领域的结论。任何声称端到端形式化该定理的工作,其定义依赖如何组织、中间结论如何验证、大型证明库如何复用,都会是后续审查的重点。而目前,甚至连这项工作锁定的范围是完整定理还是某一核心子命题都无法判断。可以确认的是页面存在与时间戳;可以谨慎分析的是研究方向含义;不能确认的是成果形态、技术路线与性能水平。真正的下一步并非对结论提前下注,而是等待论文或公开仓库提供足够信息后,再做工程评估。