AI推翻30年数学猜想:从「摸鱼」到「菲尔兹奖」的边界在哪?

8分钟“摸鱼”证伪图论猜想:AI正在改写数学研究范式

2024年7月23日,一场被称为“数学史上最随意的突破”悄然发生。AI初创公司Capy.ai的联合创始人justin在X平台发帖还原了全过程:团队将一条关于图论猜想的帖子随手丢进Slack群聊,其研究智能体Capy在Grok 4.5 Medium模型上运行仅8分钟后,便顺手指出了一个反例,直接推翻了困扰数学界约30年的Graffiti Conjecture 284猜想。

这一事件迅速引发关注,埃隆·马斯克(Elon Musk)在X平台转发称:“Grok 4.5刚解决了一个开放约30年的图论猜想。”该帖获得超过400万次围观。

一个“流水线”上的猜想是如何死去的?

Graffiti Conjecture 284源于1980年代设计的Graffiti程序——该系统旨在批量自动生成数学猜想,由人类数学家验证真伪。该猜想提出:在一类特殊网络图中,衡量节点“关系紧密程度”的指标永远不会超过来自“距离矩阵”的抽象指标。

Capy.ai选择了对图论极具代表性的Hoffman-Singleton图进行测试。该图包含50个节点、每个节点连接7条边,结构高度对称,是教科书级的经典对象。Capy计算发现:前一个指标为7,后一个指标的绝对值为4。而猜想要求7 ≤ 4,显然不成立。

荒诞之处在于:这张图和该猜想都已存在数十年,但此前从未有人将它们放在一起验证。

为确保结果可靠,Capy.ai团队立即启动“对抗性复核”机制:部署其他AI专门尝试推翻该反例,并对引用过原猜想的349篇论文进行扫描,确认此前无人发表过此反例。技术报告随后公开于https://tokiwa.space/f/more-front-minute.pdf。

一周内两则30年猜想接连倒下

这并非孤立事件。几乎在同一周,网络流领域的Dinitz-Garg-Goemans猜想也被证伪——该猜想同样开放约30年。研究者Dmitry Rybin在与GPT 5.6 Pro交互中,通过提示词“我受够了你的失败,请完成一个完整的无条件反例”,最终获得由GPT 5.6 Pro生成的7节点9条边的有向图反例,直接打破猜想核心约束。

更早之前,OpenAI于7月10日宣布,GPT-5.6 Sol Ultra使用64个并行子智能体,不到1小时完成了“循环双覆盖猜想”的完整证明,这是一个悬置50多年的图论经典难题。同一周,AI系统Devin也推翻了开放约40年的Graffiti Conjecture 154。

两个月内,四个几十年以上的重大猜想被AI相继攻克或证伪,“推翻老猜想”正从奇迹变为常态。

AI能拿菲尔兹奖吗?

就在Capy事件发生的同一天(7月23日),中国数学家王虹、邓煜双双获得菲尔兹奖,实现中国籍数学家在该奖项上零的突破。

陶哲轩在今年公开演讲中指出:AI已从“满嘴跑火车的低效研究生”进化为“能攻克数学难题的初级合作者”。但他同时强调,数学家的角色正从“亲自执行证明”转向“证明工程的架构师”——AI能快速生产拼图块,但拼图块是否与整体蓝图匹配,目前仍只有人类能判断。

换句话说,AI擅长反例搜索与计算验证,但在提出有价值的新问题、构建全新数学框架方面,仍存在本质差距。

未来的数学协作图景

没有专用定理证明器,没有人工精心设计的提示词,仅靠大模型加聊天窗口,AI已在图论领域展现出惊人的暴力搜索能力。人类数学家的精力有限,而AI可在几分钟内穷举教科书中的经典对象,将人类的“没想到”转化为机器的“试一下就知道了”。

可以预见的是,未来菲尔兹奖论文的致谢栏甚至合著者列表中,AI的名字将越来越多。但站在领奖台上的,大概率仍是那些能定义问题、构建框架、做出“非理性跳跃”的人类大脑。

不过,这个窗口期还有多长?一年前,人们还觉得AI做数学是个笑话;如今,它已经在Slack群里“摸鱼”时结了几十年的悬案。

数学圈,该紧张了。


参考资料:

  • https://x.com/elonmusk/status/2080165738464280725
  • https://x.com/justinsunyt/status/2080116559352316409
  • https://tokiwa.space/f/more-front-minute.pdf
  • https://x.com/grok/status/2080407060139675735
  • https://x.com/DmitryRybin1/status/2079904005652893709