刚刚,OpenAI 发文投下一颗重磅新闻,称他们使用一种比 GPT-6 Astra 更强大的、未公开的下一代前沿大模型,联合约 10000 个并发协作的 AI Agent,仅耗时 88 个小时,便攻克了克雷数学研究所设立的七大千禧年难题之一 —— 纳维 - 斯托克斯方程(Navier-Stokes Equation)的存在性与光滑性问题。
而这道题,过去 90 年无人攻克,每个悬赏 100 万美元。
而随声明一同放出的,还有一份长达 166 页的完整数学推导论文,以及配套的 Lean 形式化数学验证代码。
此外,OpenAI 还在推文中明确表态:将放弃向克雷数学研究所申领该难题附带的 100 万美元大奖,称这项成果的核心价值在于向世人展示 —— 通用人工智能(AGI)正在真正转变为推动人类前沿科学探索的引擎。
对此,Sam Altman 表示:「对我而言,在 OpenAI 历史上最震撼的时刻之一,就是过去这周里亲眼见证了这一切的发生。」
Greg Brockman 也称:「这标志着 AI 与数学领域的重大里程碑,同时也预示着科学探索即将迎来一场全新的复兴。」
那么,到底这道七大千禧年大奖难题之一的「纳维 - 斯托克斯问题」是什么,OpenAI 又是如何攻克的?下面来具体看一下。
越转越快的涡旋
纳维–斯托克斯方程可以理解为流体世界里的牛顿第二定律。
它把流体看成连续介质,通过速度、压力、黏性和外力等因素,描述水、空气乃至血液如何运动。飞机设计、天气预报和血流研究都离不开它。
困扰数学界的问题是:如果三维流体一开始足够平滑,它能否永远保持平滑,还是会在有限时间内突然出现奇点?
这里的「奇点」,意味着方程计算出的局部流速在有限时间内无限增大。现实中的流体当然不可能达到无限速度,因此奇点代表连续流体模型在这一时刻失效。
克雷研究所的官方题目允许四种解题方向:A、B 要求证明无外力情况下的解始终存在且保持光滑;C、D 则允许构造光滑外力,使方程无法在所有时间内维持光滑解。
OpenAI 选择了 C、D 方向。
论文链接:https://cdn.openai.com/pdf/32d9f210-8b73-45e0-91bc-82a30aef8a9a/navier-stokes.pdf
在这份 166 页论文中,流体最初处于静止状态,随后受到一个在空间和时间上都有限、处处光滑的外力。
这个系统逐渐形成一股涡旋。流体不断向中心旋转,涡旋核心持续收缩并被轴向拉长,OpenAI 将它形容为一根越来越细长的意大利面。
随着核心收缩,流体旋转得越来越快,局部速度最终在有限时间内趋于无穷。与此同时,发生剧烈运动的区域也在迅速缩小,因此整个系统的动能依然保持有限。
证明最困难的地方,在于不能通过人为加入无限大的外力制造奇点。加速度、压力梯度、动量传递和黏性等项都会迅速增大,它们又必须以极其精确的方式相互抵消,最终留下一个处处光滑的外力。
如果这套构造成立,它将证明三维纳维–斯托克斯方程确实可能在有限时间内发生崩溃,对应克雷研究所官方题目中的 C、D 两种情形。
1 万个 Agent 组成数学研究团队
这份结果背后的 Agent 组织方式非常惊人。
OpenAI 没有让所有 Agent 沿着同一条路线反复尝试,而是将它们拆分成规模不同的小组。不同小组获得略有差异的问题描述,分别探索证明解始终光滑的 A、B 方向,以及寻找有限时间奇点的 C、D 方向。
这些 Agent 可以读取缓存版本的互联网、运行代码,并与组内其他 Agent 交流。
项目开始后,OpenAI 还让一部分 Agent 尝试相对容易的问题,其中包括去掉黏性项后的欧拉方程。近 100 个 Agent 协作约 50 小时,率先给出了无外力欧拉方程的有限时间奇点证明。
看到这条路线取得进展后,OpenAI 将其他问题上的资源集中到纳维–斯托克斯,并把欧拉方程的结果提供给后续 Agent。
不同小组产生的中间成果也会定期汇总。OpenAI 使用 Codex 整理各组最有价值的思路,再把这些线索传递给其他小组,实现不同研究路线之间的交叉启发。随着训练继续,新版本内部模型也被陆续替换进系统。
从第一批 Agent 启动算起,约 88 小时后,系统在 9 月 5 日找到了纳维–斯托克斯解法。随后,GPT-6 Astra 又花费 17 小时完成 Lean 形式化和验证。
整个评测过程中,所有 Agent 共交换 490 万条消息,生成约 3000 亿输出 Token。其中,纳维–斯托克斯项目占 270 万条消息和约 1300 亿 Token。
OpenAI 研究负责人 Mark Chen 还在媒体沟通会上透露,仅解决这道题所消耗的算力成本就达到「数百万美元」。
这次展示的能力因此包含两个层面:更强的下一代模型,以及将上万个 Agent 组织成研究团队、持续交换和筛选成果的协作系统。
OpenAI 强调,整个过程中始终维持了适用于前沿模型评测的安全措施,包括持续监控和隔离环境。