11天、1300万行:Claude完成费马大定理首个计算机可验证证明,但自主二字值得细究

发布时间:2026/9/8 3:12:38

11天、1300万行:Claude完成费马大定理首个计算机可验证证明,但自主二字值得细究
2026年9月4日Anthropic发布公告其内部研究模型在11天内写出费马大定理Fermat’s Last Theorem简称FLT的完整Lean形式化证明1300万行代码、30300个中间定理29500个进入最终证明、约60亿输出token。这是史上第一个经计算机完整核验的费马大定理证明。Anthropic官方博客称之为“有史以来最大规模的Lean证明文件”体积超过数学证明库Mathlib的五倍。在正式拆解这件事之前有必要先厘清一个常被混淆的概念这里发生的不是“AI发现了新数学”而是“AI将一个已有的人类证明转换成了机器可以一步一步核验的形式语言”。1995年英国数学家Andrew Wiles用129页的论文证明了费马大定理那是真正意义上破解350年悬案的数学发现。Claude做的是 形式化formalization ——把Wiles证明中涉及的代数数论、算术几何、伽罗瓦表示论等复杂推理链翻译成Lean证明助手可以自动检验正确性的代码。用一个粗略的类比这不是写一部新小说而是把一部已存在的小说逐字翻译成另一种语言并确保每个句子的逻辑在新语言中依然成立。技术机制不是一个Agent跑了11天Anthropic使用的平台是Prove2Me——一个开源的协作形式化平台其核心是用有向无环图DAG追踪定理之间的依赖关系。这种结构允许数十个Claude Agent并行工作一个子证明需要A定理和B定理就可以分配给不同Agent同步推进互不阻塞。Anthropic披露本次任务调用了“数十个”Claude Agent并发协作累计消耗约60亿个输出token。所谓“11天”指的是挂钟时间wall-clock time而非单一Agent顺序工作11天。这个区别意味着两件事一是任务的难度通过并行化被大幅摊薄二是整个系统的协调能力任务分解、依赖管理、子证明拼接是这次成功的核心变量而不仅仅是单次推理的质量。执行任务的模型被Anthropic描述为“大致相当于Fable 5.1”的内部研究版本具体参数规模未对外披露。人类研究员Tianyi Peng哥伦比亚大学在整个过程中提供了极少量的高层次指导例如一句“Jacobian as a scheme sounds high priority”其余部分由系统自主决策。Kevin Buzzard的双重身份帝国理工学院数学家Kevin Buzzard的反应值得重点关注因为他不只是一个旁观的评论者。2024年正是Buzzard发起了数学社区的集体形式化项目试图用人力逐步完成FLT的Lean化工作——这被认为可能需要数年时间。Buzzard看过Anthropic提交的证明后公开表示“这一非凡的自动形式化成就证明了费马大定理除数学公理外无需任何假设。其中涉及代数、调和分析、几何和数论的自动形式化AI自动形式化产物已经足够健壮可以作为后续工作的基础这个证明是多层次的。” 但他也间接承认了另一面Anthropic的GitHub仓库中有106个上游文件来自Buzzard自己领导的帝国理工FLT项目和Mathlib。也就是说Claude并非从零开始而是站在了数学社区多年积累的肩膀上再用AI的方式把剩余的缺口填满。“自主”的边界在哪里Anthropic公告中的“largely autonomously”大体自主地是整篇报道中最需要仔细读的四个字。据SiliconAngle等媒体报道Claude的第一次形式化尝试是失败的——成功需要加入Prove2Me这一第三方工具才得以实现。这说明所谓“自主”是在特定工具链和已有数学资产的框架内的自主而非白板起步的自主。这并不削弱成就本身的价值但它提醒我们当AI在一个“有据可查的人类知识体系”内执行长程任务时其可靠性表现与在开放域探索时大相径庭。29500个中间定理的正确组装依赖的是Lean语言本身的形式验证机制——每一步推理都由Lean内核实时检验错误无法传播。这是一个“有护栏的马拉松”而不是无边界的自由驰骋。AI数学竞赛的当前版图把这件事放在2026年AI数学领域的更大图景中才能看清其位置。今年早些时候OpenAI内部模型Astra公布了一批数学成果包括解决了困扰学界80年的Erdős单位距离问题Anthropic此前也披露另一个未发布模型在黎曼猜想上取得进展将已核验零点比例从41.6%进一步推进。这三个方向——Erdős组合问题、黎曼猜想、FLT形式化——分属“发现新数学”“推进已知边界”“验证已有数学”三种不同任务类型技术难度和意义完全不同。FLT形式化属于第三类最接近工程验证最远离数学创造但也最直接体现AI在长程、高精度、可验证任务上的执行能力。目前数学社区的一个关键问题是29500个中间定理中有多少会被Mathlib收录成为可供未来研究复用的模块如果大部分只是这次任务的一次性产物那AI的产出物与人类数学积累之间的对接管道仍然缺失。真正的里程碑是什么这件事的深层意义不在于AI“证明”了费马大定理那是Wiles在1995年做到的而在于它展示了一类新的AI能力组合在29500步相互依赖的逻辑推导中通过多Agent并行调度、DAG依赖追踪、Lean内核实时验证三者配合将长程任务的累积错误率控制在零。这种能力边界值得关注也值得警惕。形式化任务有一个人类自然语言任务不具备的关键属性每一步都有机器可判断的对错。这既是它成功的基础也是它的局限——现实世界中大多数任务没有Lean内核这样随时帮你兜底的验证机制。当同样的多Agent架构被用于没有实时验证层的任务时29500步无差错的表现能否复现目前没有公开数据回答。Anthropic本次的开放姿态值得肯定证明代码以Apache 2.0协议在GitHub公开Lean内核和nanoda独立内核均已验证通过第三方可以自行检验。这是一种少见的“说到做到”——不只是发布新闻稿而是把原始产物摆出来让任何人核查。学术界的真正检验将在接下来数月内随着数学家们深入审读这1300万行代码而逐步完成。在那之前“AI已经越过了形式化数学的里程碑门槛”是有据可依的判断而“AI自主完成了人类数学最伟大证明之一”则是一句需要加注脚才能成立的说法。本文首发于赢政天下 (https://www.winzheng.com/article/claude-fermat-last-theorem-lean-formalization-11-days)获取更多深度技术内容与资源欢迎访问官网。

相关新闻

离线部署Docker私有仓库:从registry.tar.gz到完整镜像分发服务

离线部署Docker私有仓库:从registry.tar.gz到完整镜像分发服务

2026/9/8 3:12:38

简介:面向无法连接外网环境的Docker离线部署场景,这份Registry私有仓库镜像包能解决内网环境下镜像拉取与仓库搭建难题,适合企业运维人员与Docker初学者使用。压缩包共18个文件,约25.15MB,核心结构包含7个json元数据、…

STM32H750串口IDLE+DMA不定长接收方案与常见坑

STM32H750串口IDLE+DMA不定长接收方案与常见坑

2026/9/8 3:02:38

简介:STM32H750高性能MCU开发资料,聚焦IDLE串口空闲中断、DMA传输UART接收数据,以及STM32CubeMX生成MDK5工程的全流程,适合中高级嵌入式开发者解决高速串口通信中的实时接收与低CPU占用问题。压缩包共1204个文件,主体为…

Python实战指南:环境搭建、并发与数据分析

Python实战指南:环境搭建、并发与数据分析

2026/9/8 3:02:38

记得刚开始写 Python 的时候,总觉得语法都看懂了,但真到动手写点东西,又不知道从哪儿下手。环境装好了又出问题,库装不上,代码跑起来报错,网上搜一圈答案却越看越乱。后来踩的坑多了才慢慢意识到&#xff0…

MFC CSV读写完整方案:解析、转义、编码与性能优化实战

MFC CSV读写完整方案:解析、转义、编码与性能优化实战

2026/9/8 4:12:41

简介:这是一份供MFC开发者参考的CSV文件读写实例工程,围绕 CStdioFile 文本操作展开,解决表格数据导入导出中的打开、字段解析、写入与异常处理问题。压缩包共21个文件,以7个.h头文件和5个.cpp源文件为主体,另含工程配…

开源视频理解模型本地部署实操指南:从环境配置到接口调用与排错

开源视频理解模型本地部署实操指南:从环境配置到接口调用与排错

2026/9/8 4:12:41

开源视频理解模型本地部署实操:从环境配置到接口调用、性能观察与排错指南这次我们看一个视频理解方向的开源项目。它的价值点不在于概念有多复杂,而在于能不能在普通显卡上跑起来、能不能接入自己的业务流程、能不能稳定处理批量视频。关于视频理解类模…

QEMU CPU建模实践:为ARM64自定义CPU模型并验证内核启动

QEMU CPU建模实践:为ARM64自定义CPU模型并验证内核启动

2026/9/8 4:12:41

你是不是也遇到过这种局面:一块新CPU的硬件开发板还没到手,软件团队已经拿着数据手册催着要开发环境;或者手里有一颗自研IP,想提前把内核、BSP、RTOS的适配问题消灭掉,而不是等板卡回来后临时抓瞎。我在这类项目里折腾…

Android开源加固替代方案:R8混淆+资源混淆+DEX加壳+签名校验实操指南

Android开源加固替代方案:R8混淆+资源混淆+DEX加壳+签名校验实操指南

2026/9/8 4:12:41

做Android开发的人,几乎都会在某一个版本迭代后突然意识到一个问题——自己辛辛苦苦写出来的APK,被人用jadx一拉,源码跟裸奔一样躺在那里。这还不算,很多人还遇到过更恶心的事:App被拿去二次打包,塞进广告S…

Agent Harness:上下文压缩与动态记忆实现长任务稳定运行

Agent Harness:上下文压缩与动态记忆实现长任务稳定运行

2026/9/8 4:12:41

这次我们来看一个 Agent 工程里经常被忽略、但恰恰决定系统能不能稳定运行的关键层:Harness。很多人把 Agent 开发的重点放在模型选型、提示词优化和工具调用上了,结果跑起来才发现,真正出问题的不是模型不够聪明,而是执行过程不受…

手把手搭建AI接听助手:语音识别+大模型意图识别技术实战

手把手搭建AI接听助手:语音识别+大模型意图识别技术实战

2026/9/8 4:02:40

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

中国人民大学杨琳团队《Nature Communications》 | 全球潮汐湿地土壤有机碳时空格局与环境驱动:一项2009-2020年的全球评估

中国人民大学杨琳团队《Nature Communications》 | 全球潮汐湿地土壤有机碳时空格局与环境驱动:一项2009-2020年的全球评估

2026/9/7 20:21:46

本文首发于“生态学者”!从“湿地面积”到“土壤碳密度”:为什么需要重新认识潮汐湿地蓝碳变化?潮汐湿地位于陆地与海洋的交汇地带,包括红树林、盐沼和潮滩,是全球重要的蓝碳生态系统。其土壤能够长期储存大量有机碳&a…

adb抓包

adb抓包

2026/9/7 3:44:24

前言 本文介绍如何通过 tcpdump 在 Android 手机上抓取网络数据包,并在电脑端使用 Wireshark 进行分析。适用于需要排查 App 网络请求、分析接口调用或调试网络问题的开发与测试场景。1. 手机要有 root 权限2. 下载 tcpdump3. adb push C:\Users\zhangkuixun\Downlo…

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战

2026/9/7 8:03:37

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战 在云原生基础设施中,容器镜像体积直接决定了服务的部署速度与弹性扩容敏捷度。对于传统的 Go / Java 微服务,镜像体积通常被严格控制在 50MB 到 200MB 以内,拉取镜像只…

芯片良率波动可视化:动画拆解工艺因果,重建客户信任

芯片良率波动可视化:动画拆解工艺因果,重建客户信任

2026/9/8 0:02:30

芯片这个行业有个不太被人摆到台面上、但几乎每天都在发生的场景:客户拿着一条良率曲线截图问你,这批货的良率怎么掉了三个点,是不是工艺出问题了,产生的不良会不会流到他们产线上去。你解释了半天,客户似懂非懂&#…

PyTorch DataLoader参数冲突:sampler与shuffle互斥的根源与正确写法

PyTorch DataLoader参数冲突:sampler与shuffle互斥的根源与正确写法

2026/9/8 0:02:30

ValueError: sampler option is mutually exclusive with shuffle,这个报错我在 PyTorch 的 DataLoader 上至少见过几十次了,而且很有意思的是,它经常不是新手专属——很多写了好几年模型的老手,在从单机改成自定义采样器&#xf…

中国车企再破谣言,GAC吉利零跑获欧盟安全五星

中国车企再破谣言,GAC吉利零跑获欧盟安全五星

2026/9/8 0:02:30

有人可能在网上开着皮卡拍视频,声称中国电动车不仅性能不如美国大排量车型,安全性也堪忧。然而事实恰恰相反,GAC、吉利和零跑最新推出的电动车型在极为严苛的欧盟新车安全评鉴(Euro NCAP)测试中全部斩获满分。就在特斯…

远程协作的工作台整理

远程协作的工作台整理

2026/9/7 3:38:07

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/8 3:19:39

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/8 4:00:23

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…