技术热点透视20260909:AI 解开了 90 年数学悬案,署名权却吵翻了
古董级程序员,前百度/微博工程师。微信公众号「字与码」,聊 AI、编程与技术深度观察。本文同步发布于 zicode.com。
01先说清楚:AI 到底证明了什么
9 月 8 日,OpenAI 宣布其内部 AI 系统给出了 Navier–Stokes(纳维–斯托克斯)方程的一个候选证明:在带有光滑外力场的条件下,三维流体可以在有限时间内形成奇点(blow-up)。同时附上了 Lean 形式化验证代码。
这听起来像是一个千禧年大奖难题被攻克的新闻——但需要立刻踩一脚刹车。
Navier–Stokes 存在与光滑性问题是克雷数学研究所列出的七大千禧年难题之一,悬而未决约 90 年。但千禧年难题要求的是无外力、不可压缩的三维流体是否全局保持光滑性。OpenAI 这次解决的是受迫版本(forced NS)——即允许一个光滑的外部力场作用于流体。这是一个真实且重要的数学结果,但它的范围比千禧年难题更窄。
几乎在同一时间(9 月 7 日),纽约大学的 Tristan Buckmaster 与 Anthropic 的 Levent Alpöge 也独立发表了受迫 NS 爆破结果,他们借助的是 Claude、Codex 和 GPT-5.6/Astra 等模型作为研究工具。菲尔兹奖得主陶哲轩(Terence Tao)在 Mastodon 上公开评价这项工作为「显著成就」(significant achievement)。
所以准确的说法是:两支团队几乎同时在受迫 Navier–Stokes 方程上取得了突破,OpenAI 的贡献在于用大规模 agent 集群产出了附带 Lean 形式化验证的完整候选证明。媒体标题里「90 年悬案告破」属于过度表述——但它确实标志着 AI 参与前沿数学研究的里程碑时刻。
02这不是聊天机器人,是一支「研究突击队」

这次证明不是某个大模型在对话框里「灵光一闪」写出来的。据多方信源披露,OpenAI 使用了一款能力显著强于 GPT-6 Astra 的下一代模型,由一群 AI agent 协同编排完成:
- 第一阶段:约 1000 个 AI agent 并行工作了约 50 小时,攻克了简化版问题;
- 第二阶段:agent 规模扩展至约 10000 个,对完整的受迫 Navier–Stokes 方程发起总攻,最终产出候选证明文本和 Lean 形式化验证。
OpenAI 的 Noam Brown 在公开场合承认,单次证明耗资数百万美元,但他强调成本会快速下降。
如果你读过 9 月 7 日的《当 AI 开始造 AI:OpenAI 把内部账本亮了出来》,这个画面应该不陌生。那篇报道首次披露:截至 2026 年 8 月中,OpenAI 内部每 1 个人类研究日对应 3.1 个 AI Agent 工作日——半年前这个数字还不到 1。当时我们说「递归自我改进第一次跑在实验室里」。今天,这支「研究突击队」拿回了一个公开的战利品。
从「辅助人类写代码」到「自主组织万人集群攻坚纯数学」,agent 的角色已经从工具升级为科研执行单元。这不是聊天机器人的量变,是组织形态的质变。
03验证才是真本事:为什么 OpenAI 非得附上 Lean 证明
注意一个关键细节:OpenAI 在公布证明文本的同时,必须附上 Lean 形式化验证代码。
为什么?因为连 OpenAI 自己都不信任大模型输出的 prose 证明。在数学领域,「模型说它证明了」和「真的被证明了」之间隔着一条鸿沟,而 Lean 形式化验证是跨越这条鸿沟的唯一桥梁。
这与今天 GitHub 上 trending 的另一个项目形成了完美呼应。reverify(⭐1,036)是一个 MCP server + CLI 工具,专门用确定性验证工具去检验 AI 对代码或二进制文件的「宣称」。它在二进制逆向工程场景做了基准测试:71 个真实 Windows 系统文件,AI 教科书式回答的错误率高达 97%,reverify 全部拦下,且没有误放过任何一个错误宣称。
同一个逻辑链条贯穿了本周的所有重要事件:
- 9/7 OpenAI 内部账本:验证回路是 agent 研究的基础设施
- 今天 reververify:确定性工具拦截 97% 的 AI 错误宣称
- 今天 OpenAI NS 证明:Lean 形式化验证把「候选」升级为「可检验」
我的判断:在前沿赛道上,决定胜负的已经不是谁的能力更强,而是谁的验证 harness 更厚。模型输出永远只是「声称」,只有经过确定性验证才能成为「事实」。对于正在构建 coding agent 的团队来说,这个教训同样适用——你需要的不是一个更会写的模型,而是一个能自动证明代码正确的验证层。
04真正的瓜:算力成了抢发权的杠杆

如果故事到这里结束,那就是一篇标准的「AI 又突破了的」爽文。但真正让这件事值得深挖的,是随之爆发的署名权争议。
根据多家媒体(包括腾讯新闻、QQ 新闻)的独立调查,时间线大致如下:
- 8 月下旬至 9 月初:NYU 的 Tristan Buckmaster 与 Anthropic 的 Levent Alpöge 合作,借助 Claude、Codex 和 Astra/GPT-5.6 等模型,在受迫 NS 爆破方向取得了实质性进展。部分推理过程通过付费订阅账户提交到了 OpenAI 的服务端。
- 9 月 3 日:OpenAI 内部察觉到了这一研究动向。
- 9 月 3–6 日:OpenAI 迅速调动超大规模算力集群,利用未公开的前沿模型跟进攻关,在数天内产出了一份长约 100 页的受迫 NS 证明草稿。
- 9 月 6 日:OpenAI 核心高管与 Buckmaster 进行紧急通话。据 Buckmaster 的公开声明,高管在通话中两次直接提出要求:必须在最终公开发布的研究成果中彻底拿掉来自 Anthropic 的研究员 Levent Alpöge 的共同作者署名。
- 9 月 7–8 日:Buckmaster 公开长文复盘经历;陶哲轩在 Mastodon 发声力挺数学家的成果;OpenAI 正式宣布内部 AI 系统的证明结果。
这件事的本质不是「谁先证明的」,而是当一家实验室拥有 10 万张 GPU 集群时,学术竞争的规则被重写了。
数学家们把 AI 当作工具——他们提供直觉、方向判断和部分攻击策略,AI 帮忙展开计算和验证。OpenAI 则把数学家们的想法当作燃料——看到方向后,用算力优势在几天内碾压式地产出完整证明,然后反过来要求抹掉工具提供者的名字。
这不是「AI 民主化了数学」。这是算力不对称导致了信用不对称。「开放科学」的理想在 10 万张 GPU 面前显得苍白。当一方能在几天内从零追平另一方数月的积累,传统的学术优先权规则就开始失效。
05成本账:一次证明,几百万美元
回到 9 月 7 日那份内部账本的数据:OpenAI 中位数研究员每天消耗推理成本约 $600,P90 研究员超过 $7,000/天。那是「日常研究」的数字。
到了今天这种「万人 agent 集群攻坚千禧年难题级别」的任务,Noam Brown 亲口承认单次证明耗资数百万美元。这意味着:
- Agentic 前沿研究目前是 rich-lab sport。只有拥有万卡集群的实验室玩得起。
- OpenAI 的目标「2028 年实现完全自动化 AI 研究员」有了概念验证(PoC),但经济门槛决定了谁能参与这场游戏。
- 成本会快速下降(Brown 的原话),但「快速下降」是从百万到十万还是到千元的区别——即使降到万元级,也仍然不是任何团队都能负担的日常开销。
对于关注 AI coding / AI agent 的从业者来说,这条成本曲线有一个直接的启示:当 agent 能力足够强时,限制你使用它的不再是模型单价,而是验证回路的成本和可靠性。花百万美元证明一个数学定理值得吗?对于 OpenAI 这种体量的公司来说,这笔钱买的是「我们在 AGI 路线上又前进了一步」的叙事权和人才吸引力。但对于普通团队,更应该关注的是:如何用可控的成本构建自己的验证 harness,让 agent 在你的领域里产出可信赖的结果。
06我的判断:该为「AI 做科研」鼓掌,但别把草稿当定论
综合以上全部信息,我的判断可以浓缩为四句话:
第一,里程碑是真实的。AI agent 从「辅助人类敲代码」进化到「自主组织万人集群攻坚纯数学并产出形式化可验证的证明」,这是 agent 能力的质变点。9 月 7 日的内部账本和今天的公开战利品,构成了完整的证据链。
第二,边界必须划清。OpenAI 解决的是受迫 NS(有外力场),不是千禧年大奖的无外力 NS。两者之间的差距不是「细节问题」,而是数学上完全不同的命题。媒体「90 年悬案告破」的标题吸引眼球但误导读者。作为技术从业者,我们有责任在转发时加上这句注脚。
第三,社会基础设施滞后于技术能力。署名权争议暴露了学术共同体还没有准备好应对「算力碾压式科研」的新现实。当 AI 实验室既是运动员又是裁判(它们拥有算力、模型、发布渠道),传统的同行评审和优先权规则需要更新。陶哲轩的公开表态——支持数学家、不站任何一家商业公司——是这种张力的缩影。
第四,对 builder 的启示:投资验证层,而不只是能力层。无论是 coding agent 证明代码正确、AI agent 证明数学定理,还是 security agent 发现零日漏洞(AISLE 同日宣布自主发现 Cursor/VS Code 零日),核心模式都是一样的:agent 产生候选 → 确定性工具验证 → 输出可信结果。谁能把这三步做成自动化流水线,谁就掌握了下一阶段的竞争力。
信息来源
- 赛迪网《9月9日AI全球眼》(2026-09-09)
- QQ 新闻《OpenAI抢证明:200美元Codex成大厂抢跑草稿》(2026-09-09)
- AGI HUNT · AI News Daily 2026-09-09
- quidproquo · AI Agent Daily & GitHub Digest(2026-09-09)
- OpenAI 官方公告(2026-09-08)
- Buckmaster & Alpöge 论文预印本(2026-09-07)
- Terence Tao Mastodon 声明(2026-09-08)
其他动态
- Cognition 完成 $2B Series E,估值冲到 $48B:Devin 母公司由 a16z/Accel/Founders Fund/General Catalyst 联合领投,年化营收 4 个月内从 $492M 逼近 $900M;租用英伟达服务器集群年花费数亿美元,现金消耗预计今年达 $8 亿。(TechCrunch / 腾讯新闻 2026-09-09)
- 阿里 QoderWake 1.0 发布:一句话自然语言描述即可生成「数字员工」,覆盖前端/后端/产品/数据/设计/DevOps 等 10 种角色,内测 3 月已创建近 10 万个数字员工、执行约 200 万次任务,接入钉钉/飞书/企微。(Yangtzeer 2026-09-08)
- Anthropic Claude Code v2.1.265:50 项 CLI 变更——持久工具结果 1GB 上限(超出截断标记)、—plugin-dir 插件热加载、subagent 缓存修复等;Chrome 工程老将 Addy Osmani 加入 Anthropic 做 Claude Code。(AGI HUNT 2026-09-09)
- GitHub trending 主线「可信任」:reverify 用确定性工具拦截二进制逆向 97% 错误宣称(⭐1,036);bankmcp 把银行数据读取锁进 PSD2 只读边界(⭐151);headcount 把 172 个 Claude Code skill 按 16 个部门拆解为公司架构(⭐1,323)。(quidproquo 2026-09-09)
- WhatsApp 将原生支持第三方 AI 智能体:用户可通过 API key 将第三方 Agent 接入聊天框,每账号最多连 5 个;Telegram 已先行一步拥抱该趋势。(IT之家 2026-09-08)
- Cursor 推出 self-hosted machines:cloud agent 的工具执行完全留在企业自有网络内,支持动态池排程按需扩缩闲置 worker,回应企业安全诉求。(quidproquo 2026-09-09)
- 2026 世界机器人大会(WRC)北京启幕:3000+ 展品、300+ 首发新品、40+ 具身厂商集中亮相;叙事从「翻跟头/跳舞」转向药房夜班/物流分拣/产线上料等「真干活」场景;星海图具身基础模型 G0.5 展示陌生物品泛化抓取。(网易/欧时大参 2026-09-09)
- 外滩大会(9/9–12 上海):蚂蚁灵波通用大脑机器人进国大药房值夜班(80cm 通道自主取药);宇树上市后人形机器人展示家庭整理/商用实操;Robotaxi 首次线下公开亮相并可体验下单全闭环;千问 AI 眼镜语音查优惠券、理想汽车车载助手一键缴费/购票/加油。(新浪/新闻晨报 2026-09-09)
- 工信部「十五五」规划将「智能体安全」列入关键技术攻关:涵盖深度合成鉴伪、算力设施防护、训练数据保护;目标 2030 年智能算力规模达 9800 EFLOPS。(经济日报 2026-09-09)
- 最高法发布首部涉 AI 司法裁判规则:5 部分 24 条,聚焦 AI 换脸/幻觉侵权/自动驾驶责任等新型纠纷的判案标准。(赛迪网 2026-09-09)
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。