GPT-5.6 Sol 跑了 33 小时解费马大定理被强制终止,OpenAI 到底在"防"什么?
用过 AI 解数学题的人,大概率都动过这个念头:一直点"继续",让它反复想、反复推,它到底能不能解开一道世界级难题?最近真有人这么干了,结果不算意外——AI 没解出来,但过程比"解不出来"四个字复杂得多。
可逆计算、计算物理学专家 Michael P. Frank 给 OpenAI 的 GPT-5.6 Sol 布置了一个硬任务:探索费马大定理是否存在比怀尔斯-泰勒证明更简洁的路径,重点放在 Frey 曲线模性、一致无限下降法、算术 abc 型不等式这些方向上。要求模型保持严谨笔记、用计算验证候选引理,并清楚区分已证明结果和推测。
任务跑了大约 33 个小时,消耗了大量计算资源,然后被 OpenAI 系统强制终止。
终止之后最有趣的部分来了。GPT-5.6 Sol 自己写了一篇事后分析,推测了两个可能原因:一是会话占用了过多资源,二是 OpenAI 之前用类似模型试过这个问题但失败了,这次不想再浪费算力。Michael P. Frank 看起来也同意这个判断。
那这 33 小时到底跑出了什么?GPT-5.6 Sol 的报告很诚实:它做了大量扎实工作,把很多"听起来可行"的捷径变成了精确可验证的陈述,然后一条一条证伪或排除。最终产出不是费马大定理的新证明,而是一张"此路不通"的地图,模型自己也建议就此打住。
这个结果挺有意思——33 小时的持续推理没有撞大运式地蹦出答案,它一步步排除错误路径,给出了一份负向研究成果。如果说 AI 做数学的能力有一面是"灵光一现",另一面就是这种笨功夫式的搜索和验证。
但更多人关心的是另一个问题:为什么被强制终止?
有一种猜测是 OpenAI 在"藏着掖着",不让模型在外面解决太牛的数学问题,怕风头被抢或者想留着自己用。这个说法很快被 OpenAI 高级研究科学家 Noam Brown 怼了回来——他说如果有人只是输入 continue 就用他们的模型解决了千禧年大奖难题,拿走 100 万美元奖金,这将是 OpenAI 最好的广告,没有比这更好的了。
但反驳者也有自己的逻辑:开放顶尖能力给用户确实能带来短期宣传,但长期会削弱 OpenAI 在 AI 竞赛中的领先优势。在多玩家竞赛环境下,内部优先使用强模型加速自家研究,比让用户抢先解决大问题更重要。一旦能力变得人人可用,宣传价值就大幅下降。再加上最近的监管风声,刻意对外提供弱化版模型、内部保留超强版本,听起来也不是完全不合理。
不过从技术层面看,这件事可能有更朴素的解释。有人在 codex-cli 里发现,"goal blocked"的意思是模型在连续 3 个推理轮次里反复撞上同一个限制点,所以任务被终止很可能只是运行时的安全防卡死机制,不是什么针对难题的特殊阻挡。还有人提到,5.6 版本的 Sol 在长时间运行任务时有一个烦人的 bug,临时解决办法是切回 5.5 版本压缩一下上下文,跑几分钟再切回来——硬要在同一个会话里死磕,就会被卡住出不来。
所以这件事可能没那么复杂——模型跑到死胡同里了,系统出于资源或安全原因把它拉了回来。那 33 小时产出的"此路不通地图"本身,也许就是最真实的答案:在数学前沿问题上,当前模型的推理能力还不足以找到突破口,但至少它学会了在该停的地方停下来。
更值得想的一个问题是:如果有一天模型真的在无人干预下跑出了突破性结果,该怎么确认"这个发现是可信的"?如果模型给出的是一条此前没人想到的路径,谁有资格去验算和确认?当"能否发现"的开关被攥在一家公司手里——不管是因为算力限制、安全机制还是商业策略——这件事本身就值得一直盯着。