技术热点透视20260909:AI 解开了 90 年数学悬案,署名权却吵翻了
原创 · 约 32 分钟阅读 · 阅读 --

技术热点透视20260909:AI 解开了 90 年数学悬案,署名权却吵翻了

作者: Alex Xiang


古董级程序员,前百度/微博工程师。微信公众号「字与码」,聊 AI、编程与技术深度观察。本文同步发布于 zicode.com

01先说清楚:AI 到底证明了什么

9 月 8 日,OpenAI 宣布其内部 AI 系统给出了 Navier–Stokes(纳维–斯托克斯)方程的一个候选证明:在带有光滑外力场的条件下,三维流体可以在有限时间内形成奇点(blow-up)。同时附上了 Lean 形式化验证代码。

这听起来像是一个千禧年大奖难题被攻克的新闻——但需要立刻踩一脚刹车。

Navier–Stokes 存在与光滑性问题是克雷数学研究所列出的七大千禧年难题之一,悬而未决约 90 年。但千禧年难题要求的是无外力、不可压缩的三维流体是否全局保持光滑性。OpenAI 这次解决的是受迫版本(forced NS)——即允许一个光滑的外部力场作用于流体。这是一个真实且重要的数学结果,但它的范围比千禧年难题更窄。

几乎在同一时间(9 月 7 日),纽约大学的 Tristan Buckmaster 与 Anthropic 的 Levent Alpöge 也独立发表了受迫 NS 爆破结果,他们借助的是 Claude、Codex 和 GPT-5.6/Astra 等模型作为研究工具。菲尔兹奖得主陶哲轩(Terence Tao)在 Mastodon 上公开评价这项工作为「显著成就」(significant achievement)。

所以准确的说法是:两支团队几乎同时在受迫 Navier–Stokes 方程上取得了突破,OpenAI 的贡献在于用大规模 agent 集群产出了附带 Lean 形式化验证的完整候选证明。媒体标题里「90 年悬案告破」属于过度表述——但它确实标志着 AI 参与前沿数学研究的里程碑时刻。

02这不是聊天机器人,是一支「研究突击队」

agentic research pipeline

这次证明不是某个大模型在对话框里「灵光一闪」写出来的。据多方信源披露,OpenAI 使用了一款能力显著强于 GPT-6 Astra 的下一代模型,由一群 AI agent 协同编排完成:

  • 第一阶段:约 1000 个 AI agent 并行工作了约 50 小时,攻克了简化版问题;
  • 第二阶段:agent 规模扩展至约 10000 个,对完整的受迫 Navier–Stokes 方程发起总攻,最终产出候选证明文本和 Lean 形式化验证。

OpenAI 的 Noam Brown 在公开场合承认,单次证明耗资数百万美元,但他强调成本会快速下降。

如果你读过 9 月 7 日的《当 AI 开始造 AI:OpenAI 把内部账本亮了出来》,这个画面应该不陌生。那篇报道首次披露:截至 2026 年 8 月中,OpenAI 内部每 1 个人类研究日对应 3.1 个 AI Agent 工作日——半年前这个数字还不到 1。当时我们说「递归自我改进第一次跑在实验室里」。今天,这支「研究突击队」拿回了一个公开的战利品。

从「辅助人类写代码」到「自主组织万人集群攻坚纯数学」,agent 的角色已经从工具升级为科研执行单元。这不是聊天机器人的量变,是组织形态的质变。

03验证才是真本事:为什么 OpenAI 非得附上 Lean 证明

注意一个关键细节:OpenAI 在公布证明文本的同时,必须附上 Lean 形式化验证代码。

为什么?因为连 OpenAI 自己都不信任大模型输出的 prose 证明。在数学领域,「模型说它证明了」和「真的被证明了」之间隔着一条鸿沟,而 Lean 形式化验证是跨越这条鸿沟的唯一桥梁。

这与今天 GitHub 上 trending 的另一个项目形成了完美呼应。reverify(⭐1,036)是一个 MCP server + CLI 工具,专门用确定性验证工具去检验 AI 对代码或二进制文件的「宣称」。它在二进制逆向工程场景做了基准测试:71 个真实 Windows 系统文件,AI 教科书式回答的错误率高达 97%,reverify 全部拦下,且没有误放过任何一个错误宣称。

同一个逻辑链条贯穿了本周的所有重要事件:

  • 9/7 OpenAI 内部账本:验证回路是 agent 研究的基础设施
  • 今天 reververify:确定性工具拦截 97% 的 AI 错误宣称
  • 今天 OpenAI NS 证明:Lean 形式化验证把「候选」升级为「可检验」

我的判断:在前沿赛道上,决定胜负的已经不是谁的能力更强,而是谁的验证 harness 更厚。模型输出永远只是「声称」,只有经过确定性验证才能成为「事实」。对于正在构建 coding agent 的团队来说,这个教训同样适用——你需要的不是一个更会写的模型,而是一个能自动证明代码正确的验证层。

04真正的瓜:算力成了抢发权的杠杆

forced NS vs Millennium problem

如果故事到这里结束,那就是一篇标准的「AI 又突破了的」爽文。但真正让这件事值得深挖的,是随之爆发的署名权争议

根据多家媒体(包括腾讯新闻、QQ 新闻)的独立调查,时间线大致如下:

  1. 8 月下旬至 9 月初:NYU 的 Tristan Buckmaster 与 Anthropic 的 Levent Alpöge 合作,借助 Claude、Codex 和 Astra/GPT-5.6 等模型,在受迫 NS 爆破方向取得了实质性进展。部分推理过程通过付费订阅账户提交到了 OpenAI 的服务端。
  2. 9 月 3 日:OpenAI 内部察觉到了这一研究动向。
  3. 9 月 3–6 日:OpenAI 迅速调动超大规模算力集群,利用未公开的前沿模型跟进攻关,在数天内产出了一份长约 100 页的受迫 NS 证明草稿。
  4. 9 月 6 日:OpenAI 核心高管与 Buckmaster 进行紧急通话。据 Buckmaster 的公开声明,高管在通话中两次直接提出要求:必须在最终公开发布的研究成果中彻底拿掉来自 Anthropic 的研究员 Levent Alpöge 的共同作者署名。
  5. 9 月 7–8 日:Buckmaster 公开长文复盘经历;陶哲轩在 Mastodon 发声力挺数学家的成果;OpenAI 正式宣布内部 AI 系统的证明结果。

这件事的本质不是「谁先证明的」,而是当一家实验室拥有 10 万张 GPU 集群时,学术竞争的规则被重写了

数学家们把 AI 当作工具——他们提供直觉、方向判断和部分攻击策略,AI 帮忙展开计算和验证。OpenAI 则把数学家们的想法当作燃料——看到方向后,用算力优势在几天内碾压式地产出完整证明,然后反过来要求抹掉工具提供者的名字。

这不是「AI 民主化了数学」。这是算力不对称导致了信用不对称。「开放科学」的理想在 10 万张 GPU 面前显得苍白。当一方能在几天内从零追平另一方数月的积累,传统的学术优先权规则就开始失效。

05成本账:一次证明,几百万美元

回到 9 月 7 日那份内部账本的数据:OpenAI 中位数研究员每天消耗推理成本约 $600,P90 研究员超过 $7,000/天。那是「日常研究」的数字。

到了今天这种「万人 agent 集群攻坚千禧年难题级别」的任务,Noam Brown 亲口承认单次证明耗资数百万美元。这意味着:

  • Agentic 前沿研究目前是 rich-lab sport。只有拥有万卡集群的实验室玩得起。
  • OpenAI 的目标「2028 年实现完全自动化 AI 研究员」有了概念验证(PoC),但经济门槛决定了谁能参与这场游戏。
  • 成本会快速下降(Brown 的原话),但「快速下降」是从百万到十万还是到千元的区别——即使降到万元级,也仍然不是任何团队都能负担的日常开销。

对于关注 AI coding / AI agent 的从业者来说,这条成本曲线有一个直接的启示:当 agent 能力足够强时,限制你使用它的不再是模型单价,而是验证回路的成本和可靠性。花百万美元证明一个数学定理值得吗?对于 OpenAI 这种体量的公司来说,这笔钱买的是「我们在 AGI 路线上又前进了一步」的叙事权和人才吸引力。但对于普通团队,更应该关注的是:如何用可控的成本构建自己的验证 harness,让 agent 在你的领域里产出可信赖的结果。

06我的判断:该为「AI 做科研」鼓掌,但别把草稿当定论

综合以上全部信息,我的判断可以浓缩为四句话:

第一,里程碑是真实的。AI agent 从「辅助人类敲代码」进化到「自主组织万人集群攻坚纯数学并产出形式化可验证的证明」,这是 agent 能力的质变点。9 月 7 日的内部账本和今天的公开战利品,构成了完整的证据链。

第二,边界必须划清。OpenAI 解决的是受迫 NS(有外力场),不是千禧年大奖的无外力 NS。两者之间的差距不是「细节问题」,而是数学上完全不同的命题。媒体「90 年悬案告破」的标题吸引眼球但误导读者。作为技术从业者,我们有责任在转发时加上这句注脚。

第三,社会基础设施滞后于技术能力。署名权争议暴露了学术共同体还没有准备好应对「算力碾压式科研」的新现实。当 AI 实验室既是运动员又是裁判(它们拥有算力、模型、发布渠道),传统的同行评审和优先权规则需要更新。陶哲轩的公开表态——支持数学家、不站任何一家商业公司——是这种张力的缩影。

第四,对 builder 的启示:投资验证层,而不只是能力层。无论是 coding agent 证明代码正确、AI agent 证明数学定理,还是 security agent 发现零日漏洞(AISLE 同日宣布自主发现 Cursor/VS Code 零日),核心模式都是一样的:agent 产生候选 → 确定性工具验证 → 输出可信结果。谁能把这三步做成自动化流水线,谁就掌握了下一阶段的竞争力。

 信息来源

  • 赛迪网《9月9日AI全球眼》(2026-09-09)
  • QQ 新闻《OpenAI抢证明:200美元Codex成大厂抢跑草稿》(2026-09-09)
  • AGI HUNT · AI News Daily 2026-09-09
  • quidproquo · AI Agent Daily & GitHub Digest(2026-09-09)
  • OpenAI 官方公告(2026-09-08)
  • Buckmaster & Alpöge 论文预印本(2026-09-07)
  • Terence Tao Mastodon 声明(2026-09-08)

 其他动态

  • Cognition 完成 $2B Series E,估值冲到 $48B:Devin 母公司由 a16z/Accel/Founders Fund/General Catalyst 联合领投,年化营收 4 个月内从 $492M 逼近 $900M;租用英伟达服务器集群年花费数亿美元,现金消耗预计今年达 $8 亿。(TechCrunch / 腾讯新闻 2026-09-09)
  • 阿里 QoderWake 1.0 发布:一句话自然语言描述即可生成「数字员工」,覆盖前端/后端/产品/数据/设计/DevOps 等 10 种角色,内测 3 月已创建近 10 万个数字员工、执行约 200 万次任务,接入钉钉/飞书/企微。(Yangtzeer 2026-09-08)
  • Anthropic Claude Code v2.1.265:50 项 CLI 变更——持久工具结果 1GB 上限(超出截断标记)、—plugin-dir 插件热加载、subagent 缓存修复等;Chrome 工程老将 Addy Osmani 加入 Anthropic 做 Claude Code。(AGI HUNT 2026-09-09)
  • GitHub trending 主线「可信任」:reverify 用确定性工具拦截二进制逆向 97% 错误宣称(⭐1,036);bankmcp 把银行数据读取锁进 PSD2 只读边界(⭐151);headcount 把 172 个 Claude Code skill 按 16 个部门拆解为公司架构(⭐1,323)。(quidproquo 2026-09-09)
  • WhatsApp 将原生支持第三方 AI 智能体:用户可通过 API key 将第三方 Agent 接入聊天框,每账号最多连 5 个;Telegram 已先行一步拥抱该趋势。(IT之家 2026-09-08)
  • Cursor 推出 self-hosted machines:cloud agent 的工具执行完全留在企业自有网络内,支持动态池排程按需扩缩闲置 worker,回应企业安全诉求。(quidproquo 2026-09-09)
  • 2026 世界机器人大会(WRC)北京启幕:3000+ 展品、300+ 首发新品、40+ 具身厂商集中亮相;叙事从「翻跟头/跳舞」转向药房夜班/物流分拣/产线上料等「真干活」场景;星海图具身基础模型 G0.5 展示陌生物品泛化抓取。(网易/欧时大参 2026-09-09)
  • 外滩大会(9/9–12 上海):蚂蚁灵波通用大脑机器人进国大药房值夜班(80cm 通道自主取药);宇树上市后人形机器人展示家庭整理/商用实操;Robotaxi 首次线下公开亮相并可体验下单全闭环;千问 AI 眼镜语音查优惠券、理想汽车车载助手一键缴费/购票/加油。(新浪/新闻晨报 2026-09-09)
  • 工信部「十五五」规划将「智能体安全」列入关键技术攻关:涵盖深度合成鉴伪、算力设施防护、训练数据保护;目标 2030 年智能算力规模达 9800 EFLOPS。(经济日报 2026-09-09)
  • 最高法发布首部涉 AI 司法裁判规则:5 部分 24 条,聚焦 AI 换脸/幻觉侵权/自动驾驶责任等新型纠纷的判案标准。(赛迪网 2026-09-09)
打开原图 ↗