币海NEWS

首页  >  全球资讯 >  社会热点 >  人类死磕350年的费马大定理,AI只用11天彻底证明?

人类死磕350年的费马大定理,AI只用11天彻底证明?

股海柠檬精 来源: 2026-09-07 02:27
x    facebook    telegram    复制链接
重点摘要
AI狂写1300万行代码证明了。

人类死磕350年的费马大定理,AI只用11天彻底证明?

人类数学家死磕了三百五十多年才解开的终极难题,如果交给现在的AI去处理,你猜需要多久?仅仅11天。

硅谷顶级AI巨头Anthropic正式宣布,他们家的AI大模型Claude,完成了人类历史上首个端到端、能够由计算机完整检查的费马大定理形式化证明。

这背后主导整个大工程的是一位名叫Tianyi Peng的华人顶尖学者。他曾是清华姚班的本科生、MIT博士,现在是哥伦比亚大学的助理教授,同时也是Anthropic的研究员。

费马大定理不是早在1994年,就被英国数学家安德鲁·怀尔斯(Andrew Wiles)和理查德·泰勒(Richard Taylor)给证明出来了吗?Claude这次干的到底是个啥?

其实Claude这次并没有去发现一个新的证明方法,而是干了一件工程量非常恐怖、甚至可以说是碾压人类极限的工作——它把人类写出来的数学证明,彻底翻译成了计算机能一行一行去检查的逻辑代码。

打个极通俗的比方。这就好比,人类数学家写了一部极其烧脑的悬疑推理小说,里面有很多地方会写着显而易见,凶手就是他。人类同行看了点点头,说对,有道理。但是,如果你把这本小说交给一个叫Lean的超级铁面法官(也就是计算机证明系统),法官是不吃显而易见这一套的。它要求你必须拿出比头发丝还要细的绝对逻辑证据,一步一步推导,中间哪怕缺了一个标点符号的逻辑都不行。

把人类的语言翻译成这种非常严苛的Lean代码,工作量大得让人绝望。2024年,帝国理工学院的数学家Kevin Buzzard(凯文·巴扎德)还拉着一批人准备搞个几年的大工程,光是技术蓝图就写了86页。

结果Tianyi Peng带着Claude一出手,11天全搞定了。

这帮AI在11天里疯狂吐出了大约1300万行代码,生成了超过3万个中间定理。这个代码量,甚至是Lean核心数学库本身规模的整整5倍。

不过这短短的11天里,其实差一点就发生了尴尬的翻车事故。

Tianyi Peng原本只是想测试一下Claude的极限,他们拉起了一大批AI智能体(Agent)同时去干活,有的去补数学定义,有的去攻坚中间引理。结果发现,这就好比给一个大厨房塞进了一百个顶级厨师,但没有主厨指挥,人一多,活一多,这群AI居然乱套了,甚至出现了失忆和状态跟不上的情况。这些失败尝试留下的代码,最后只占了成品的7%。

怎么办?团队赶紧掏出了一个名叫Prove2Me的神器。这是Tianyi Peng和合作者专门搭建的协作系统。

你可以把它理解为,给这几十个AI强行装上了一套企业级项目管理软件。 它把整个庞大的数学证明,拆解成了一张清晰的任务图谱,告诉这群AI:哪一步做完了,下一步该谁上,互相怎么配合。

有了这套系统的指挥,消耗了整整60亿个输出Token之后,这群相当于Claude Fable 5.1智商的AI智能体,硬生生地把这座数学高山给夷平了。整个过程里,人类只是偶尔给点高层的提示,剩下的脏活累活全是AI自己干的。

难怪英国数学家Kevin Buzzard看到成果后,给出了一个极高的评价,称这是一次非凡的自动形式化成果。这意味着,过去那种极度依赖人工、慢得像蜗牛一样的数学推导工作,现在终于具备了大规模提速的条件。

当然了,看着死对头Anthropic在学术界疯狂秀肌肉,隔壁的OpenAI怎么可能坐得住?

OpenAI的CEO山姆·奥特曼(Sam Altman)反手就亮牌,最新一代的旗舰模型GPT-6 Astra,已经开始向Pro、Business和企业用户逐步开放了!而且GPT-6主打的,恰恰就是这种长链路的智能体任务、软件工程和科学工作。

可以说,从单纯的聊天助手,到如今能够拉起队伍花11天干完人类几年工程的超级数字员工,AI进化的速度已经远远超出了我们的想象。