OpenAI 宣称破解千禧年难题,数学家却说是「反例搜索」?

0 阅读15分钟

从可落地的方案、选型取舍与实施路径来写。这件事的起点很具体:2026年9月8日深夜,OpenAI 在 X 平台发布技术报告,宣称其下一代模型在 88 小时内「解决」了纳维-斯托克斯方程的存在性与平滑性难题——克雷数学研究所千禧年大奖难题之一。随后纽约大学学者 Thomas Wolf 公开质疑这更像大规模反例搜索而非完整证明。原研究者 Tristan Buckmaster 也指出 OpenAI 抢发了他的工作成果。一场关于 AI 能否真正「解决」数学问题的讨论,从技术细节蔓延到署名权与验证标准的边界。

1.1 千禧年难题是什么,为什么它这么难

纳维-斯托克斯方程描述流体运动,从飞机气动到海洋洋流都依赖它。工程师用数值模拟已经能给出足够精确的结果,但数学上还有一个根本问题悬而未决:如果初始流动是光滑的,方程的解是否永远保持光滑?或者说,是否存在某个初始条件,让解在有限时间内「爆破」——即某些物理量趋向无穷大?

这个问题被称为「存在性与平滑性」问题。克雷数学研究所给出的官方表述非常精确,但核心直觉不难理解:我们每天看到的湍流、漩涡,数学上还没有被严格证明可以从光滑初始状态演化而来。1934年让·勒雷证明了弱解的存在性,但平滑性至今未定。这解释了为什么它被列为千禧年难题——不是因为它不可计算,而是因为它缺少一个涵盖所有可能初始条件的严密论证。

程序员 reaction:该写代码了

数学家看了这个证明流程

1.2 OpenAI 的方法论:10000 个 agent 协同证明

OpenAI 公布的技术报告披露,这次证明并非单个模型的输出,而是由约 10000 个自主 agent 协同完成。流程分为两个阶段:第一阶段约 1000 个 agent 并行工作 50 小时,攻克简化版欧拉方程的正则性问题;第二阶段扩展至约 10000 个 agent,对完整受迫纳维-斯托克斯方程发起证明。

关键设计在于任务拆解策略。OpenAI 将问题分为四个变体版本:版本 A 和 B 导向证明方向,版本 C 和 D 导向反例方向。这种分叉搜索策略让不同 agent 组在不同假设下并行探索,最终产出了附带 Lean 形式化验证的候选证明文本。

OpenAI Agent 协同证明流程

OpenAI Agent 协同证明流程

1.3 代价与争议:数百万美元与署名权之争

OpenAI 研究负责人 Noam Brown 在公开场合承认,单次证明耗资数百万美元,但强调成本会快速下降。这笔投入换来的是什么,学界看法分歧严重。

Thomas Wolf 的观点代表了一类质疑声音:AI 没有灵光一闪,它只是花了 1000 万美元的算力,把人类早已铺好的数学蓝图 grinding 了一遍。他引用 Hugging Face 相关研究者的工作指出,OpenAI 的结果本质上是一组反例搜索,而非完整证明。工程师用有限时间模拟流动,数学家要回答所有条件下是否永远光滑,前者能用,后者才算解决。

另一层争议来自署名权。Tristan Buckmaster 指控 OpenAI 在其未完成工作被泄露后抢先发表,尽管 OpenAI 方面承认受到相关传闻启发。这场争论触及一个更根本的问题:当 AI 代理成为「证明者」,数学成果的所有权归于谁?是训练数据的贡献者、提示词的设计者、还是算力投入方?目前数学界没有现成规则可循。

程序员 reaction:柯南00070 出现了

真相锁定:是证明还是搜索?

Navier–Stokes 方程描述的是流体运动。工程师用它模拟飞机周围的气流、海里的洋流,几十年用得风生水起。但数学家问的是一个更根本的问题:如果初始流动足够平滑,方程的解是否会在有限时间内「炸掉」——也就是出现无穷大的速度或压力?这个问题悬而未决近百年,克雷数学研究所把它列为七个千禧年难题之一,悬赏100万美元。

问题难在哪里?工程师模拟只需要处理有限时间和有限分辨率的样本,数学证明却要回答所有合法初值下是否永远光滑。前者是求一个特例,后者是证全称命题。

程序员 reaction:喂喂真的假的啊

这差距可不小

OpenAI 的做法不是让一个模型单干,而是用了多阶段 agent 编排。第一阶段先用约1000个 agent 攻关简化版问题(欧拉方程受迫情形),用时约50小时;第二阶段扩展到约10000个 agent,全面进攻完整的受迫 Navier–Stokes 方程,最终产出候选证明文本和 Lean 形式化验证。

OpenAI agent 协同证明工作流

OpenAI agent 协同证明工作流

程序员 reaction:SalesforceCEosaysengineers

万级 agent 并发,算力烧得响

但 Thomas Wolf 在 LinkedIn 上明确表态:这更像是一次大规模反例搜索。他指出,OpenAI 的策略是把问题拆成 A/B/C/D 四个变体分别投放给不同 agent 组,其中 C 和 D 是证明猜想为假的版本——换句话说,他们在 brute-force 所有可能路径,而不是像传统数学证明那样构造性地推导出结论。

「AI 没有灵光一闪,它只是花了1000万美元的算力,把人类早已铺好的数学蓝图 grinding 了一遍。」Wolf 这句话刻薄但不完全没道理。

真正引发怒火的是署名权问题。纽约大学的数学家 Tristan Buckmaster 公开指控 OpenAI 抢先发表了他们团队未公开发表的研究成果。据 Quanta Magazine 报道,OpenAI 承认其工作受到了关于 Buckmaster 和 Alpöge 即将取得突破的传闻的启发——但他们强调并未直接阅读对方未发表的论文。

Buckmaster 此前的工作集中在简化版欧拉方程,他们确实用 LLM 辅助解析数学可能性。当 OpenAI 的结果涉及受迫 Navier–Stokes 时,时间线和方向的高度重合让 B 无法接受。

还没解释就先被安排转身背锅时的表情

这锅谁背?

Noam Brown 在公开场合承认,单次证明耗资数百万美元。从工程角度看,这是用算力换时间的极端案例:把需要人类数十年积累的数学直觉,压缩到88小时的高强度 agent 协作里。代价是昂贵的,争议是真实的,而数学界对「什么是证明」的定义,正在被这件事重新逼问。

OpenAI 公布的候选证明,本质上是回答 Navier-Stokes 方程「是否存在光滑解」这一命题的否命题:他们找到了一组初始条件,使得解在有限时间内爆破。按照克雷研究所的规则,选项 C/D(反例)确实构成该问题的一种有效解法。但这与人类数学家追求的完整证明之间,存在结构性差异。

程序员 reaction:jobifyourjobhasneverneeded

这差距可不小

完整证明需要回答:对所有合法初值,解是否永远保持光滑?反例搜索只回答:存在某些初值,解会爆破。前者是全称命题,后者是存在命题。工程师用有限时间模拟流动,数学家要回答所有条件下是否永远光滑。前者能用,后者才算解决。

Thomas Wolf 的核心论点是:这项工作的创意蓝图来自人类数学家的既有研究路径,尤其是 Diego Córdoba 和 Luis Martínez-Zoroa 的方法。AI 做的是把这套路径在高维搜索空间里穷举一遍。这确实需要算力,但不等于产生了新的数学洞察。

2.2 数学家视角:Buckmaster 团队的受迫 Euler 方程突破

要理解这场争议,需要把时间线还原。纽约大学的 Tristan Buckmaster 与 Igor Pipkin 合作的受迫 Euler 方程爆破结果,才是真正意义上的人类数学家突破。他们证明的是:在无粘流体(Euler 方程)的受迫版本下,存在光滑初值使得解在有限时间爆破。这本身就是一个重要的千禧年相关问题突破,且耗时远超 88 小时。

OpenAI 的 agent 集群是在这个成果的基础上,将方法扩展到含粘性的完整 Navier-Stokes 受迫方程。但扩展是否等同于证明完整命题,学界仍有分歧。问题在于:Euler 方程是 Navier-Stokes 方程在粘性系数趋近于零时的极限情形,两者之间的数学过渡并不简单。

2.3 形式化验证的意义与局限:Lean 能做什么、不能做什么

OpenAI 声称产出的证明经过 Lean 形式化验证,这在 AI 辅助数学史上是一个标志性事件。Lean 能够检查每一步推理是否符合逻辑公理系统,这是传统人工验证难以达到的一致性和彻底性。但它无法判断「证明是否完整」——如果前提假设本身有缺口,Lean 只能验证推导过程,无法补全前提。

形式化验证边界

形式化验证边界

从实践角度看,形式化验证的价值在于它能排除「看起来正确但实际有漏洞」的推理路径。但对于 AI 产出的证明,真正的风险不是推理错误,而是证明范围是否完整覆盖了问题定义中的所有情形。这一点目前仍缺乏外部学界的独立复核。

Navier–Stokes 方程描述的是流体运动。工程师用它模拟飞机周围的气流、海里的洋流,几十年用得风生水起。但数学家问的是一个更根本的问题:如果初始流动足够平滑,方程的解是否会在有限时间内「炸掉」——也就是出现无穷大的速度或压力?这个问题悬而未决近百年,克雷数学研究所把它列为七个千禧年难题之一,悬赏100万美元。

问题难在哪里?工程师模拟只需要处理有限时间和有限分辨率的样本,数学证明却要回答所有合法初值下是否永远光滑。前者是求一个特例,后者是证全称命题。

OpenAI 的做法不是让一个模型单干,而是用了多阶段 agent 编排。第一阶段先用约1000个 agent 攻关简化版问题(欧拉方程受迫情形),用时约50小时;第二阶段扩展到约10000个 agent,全面进攻完整的受迫 Navier–Stokes 方程,最终产出候选证明文本和 Lean 形式化验证。

OpenAI agent 协同证明工作流

OpenAI agent 协同证明工作流

Thomas Wolf 在 X 上的评价直指核心:AI 没有灵光一闪,它只是花了约1000万美元的算力,把人类早已铺好的数学蓝图 grinding 了一遍。他引用了 Diego Córdoba 和 Luis Martínez-Zoroa 此前的工作——这两个数学家早就设计了通过外力驱动导致解爆破的理论框架,Buckmaster 和 Alpöge 随后在此基础上完成了受迫 Euler 方程的严格推导。

也就是说,OpenAI 的 agent 系统不是在真空中发明新数学,而是在一个已被人类数学家部分打开的命题上,进行了规模化的推理搜索。

程序员 reaction:柯南00048 就这么定了

这差距可不小

这里出现了一个关键分歧:数学家真正关心的问题,和 OpenAI agent 实际解决的问题,并不完全相同。

Buckmaster 和 Alpöge 在 2025 年 8 月的成果是针对受迫 Euler 方程(无粘性版本)的爆破构造,他们使用了 Anthropic 的 LLM 辅助探索数学可能性,最终给出了一个严谨的存在性证明。这是一项被数学界严肃对待的工作,发表在同行评审期刊上。

而 OpenAI 的 agent 系统在 2026 年 9 月给出的成果,目标是完整的受迫 Navier–Stokes 方程。根据公司公开材料,agent 组被要求同时尝试选项 A/B(证明光滑性)和选项 C/D(构造反例爆破),最终找到了一个在特定外力驱动下爆破的构造。

问题来了:找到了一个爆破的特例,意味着证明了「光滑性猜想」不成立。这确实可以视为对千禧年难题的一种解决路径——但前提是,这个爆破构造覆盖的是正确版本的方程,并且证明链的每一个环节都经受了 Lean 的完整形式化校验。

Lean 在这里扮演的角色,是机械校验器:它可以检查每一步推导是否符合逻辑公理体系,但不决定「这个方向值不值得走」。数学直觉、问题重构、关键引理的选取——这些仍然来自人类。

程序员反应图:真正的程序员

这是搬砖,还是思考

Thomas Wolf 的另一条判断可以这样总结:工程师用有限时间模拟流动,数学家要回答所有条件下是否永远光滑。前者能用,后者才算解决。

四、这场争论的真正落点:AI 数学的边界在哪里

4.1 哪些数学问题适合 AI brute-force,哪些不行

OpenAI 这次做的工作,本质上是一个大规模搜索问题:给定一组候选定理方向(版本 A/B/C/D),让数千个 agent 并行尝试构造证明或反例。这种范式在哪些场景下有效?

答案取决于问题的结构。如果问题的解空间是离散的、有限的,或者存在可枚举的候选对象,AI brute-force 就有优势。例如数论中的某些猜想、图论中的有限情形分类,都适合这种策略。2023 年 Hales 团队用形式化方法验证了 Kepler 猜想的核心引理,就是一个成功的例子。

但 Navier-Stokes 的问题结构完全不同。它是一个关于所有合法初值的全称命题,解空间是无限维的连续统。你无法通过穷举来「验证」它。这正是 Thomas Wolf 所说的「反例搜索」与「完整证明」的本质区别。

程序员 reaction:OurSQL

这差距可不小

AI 数学辅助 vs 传统数学证明的路径差异

AI 数学辅助 vs 传统数学证明的路径差异

4.2 从 Navier-Stokes 看流体力学模拟与严格证明的距离

工程师用 Navier-Stokes 方程模拟飞机周围的气流、海里的洋流,几十年用得风生水起。但数学家问的是一个更根本的问题:如果初始流动足够平滑,方程的解是否会在有限时间内「炸掉」——也就是出现无穷大的速度或压力?

这个问题难在何处?工程师模拟只需要处理有限时间和有限分辨率的样本,数学证明却要回答所有合法初值下是否永远光滑。前者是求一个特例,后者是证全称命题。

OpenAI 的 10000 个 agent 在 88 小时内完成的工作,更像是在已知的数学蓝图上做系统化搜索。正如 Wolf 所说:「AI 没有灵光一闪,它只是花了 1000 万美元的算力,把人类早已铺好的数学蓝图 grinding 了一遍。」

这句话听起来刺耳,但准确区分了两个领域:

  • 计算流体力学(CFD):数值模拟,工程应用,误差可控
  • 解析存在性与正则性理论:严格证明,数学基础,全称命题

前者已经有成熟的工业软件(如 ANSYS、OpenFOAM),后者至今仍是克雷数学研究所悬赏百万美元的问题。

4.3 未来十年:AI 数学家会取代人类吗

回到最初的问题:AI 能取代数学家吗?

答案是否定的,但需要加一个限定:在可预见的未来,AI 不会取代数学家的核心工作——提出新问题、构建新框架、给出关键洞察。AI 能做的,是在人类已经划定的疆域内做系统化探索,把「可能性」变成「候选结论」,再由人类数学家判断其价值并完成严格证明。

Buckmaster 和 Alpöge 团队正是这样做的。他们先通过 AI 辅助发现了受迫 Euler 方程的 blowup 现象,然后用传统的数学技巧完成了严格证明。这个过程不是 AI 独立完成的,而是人机协作的产物。

[1] Thomas Wolf, LinkedIn post, Sep 2026, www.linkedin.com/posts/thom-… [2] OpenAI, "On the Navier–Stokes Millennium Prize Problem", Sep 2026, openai.com/index/navie… [3] Quanta Magazine, "AI Has Solved One of Math's $1 Million Millennium Prize Problems", Sep 2026, www.quantamagazine.org/ai-has-solv… [4] Tristan Buckmaster & Michal Bou-Rizk, preprint on forced Euler equation blowup, 2026 [5] Science News, "AI may have solved one of math's biggest puzzles, raising controversy", Sep 2026, www.sciencenews.org/article/ai-…