技术热点透视20260912:当 25 位菲尔兹奖得主联名反对 AI 做数学
古董级程序员,前百度/微博工程师,现在关注 AI 工程化与开发者工具。
微信公众号「字与码」,记录技术思考与行业观察。
本文同步发布于 zicode.com

北京时间 9 月 12 日凌晨,一封公开信在数学圈和 AI 圈同时刷屏。签名栏里排着 25 个菲尔兹奖得主的名字,从 1978 年获奖的皮埃尔·德利涅(Pierre Deligne),一直排到今年 7 月刚接过奖章的邓煜,中间是彼得·舒尔茨、玛丽娜·维亚佐夫斯卡、吴宝珠、马克西姆·孔采维奇这些名字。文件的标题写得很克制:《A Severe Misalignment of AI in Mathematics》——AI 在数学中的严重错位。但它的分量一点也不克制:这是 AI 诞生以来,第一次有一个完整学科的最高权威群体,以联名信的形式对 AI 公司集体表态。
01这是一封「没时间打磨」的信,恰恰说明事情有多急
先说一个容易被忽略的细节:这封信从头到尾没有点名任何一家公司。它的原文挂在陶哲轩的博客和 mathandai.org 上,矛头靠内容传递,不靠专有名词。信的核心论证只有一层,但很硬:解决一个问题,只是通往「概念性理解与洞见」这一首要目标的工具和代理指标。原文那句是——「以越来越快的节奏大规模生产『真/假』判断,可能摧毁孕育新思想的沃土」。落到具体诉求上是三件事:给写论文和提炼方法留时间、明确标注结果依赖了哪些在先工作、承认总得有数学家愿意接手把机器给出的东西消化成教科书。
有意思的是程序上的自我矛盾。陶哲轩自己承认,这封信是过去一周里 25 个人讨论出来的,没时间走一遍像样的协商流程——对比今年 6 月 2 日的《莱顿宣言》,那份东西从 2025 年 9 月的莱顿研讨会算起,工作组打磨了八个月,有 Zenodo DOI,有国际数学联盟(IMU)背书。这一封只花了一周。截至 9 月 12 日,公开联署页上的数字已经超过 1694 人,且门槛设在 ORCID 或机构邮箱之后——机器人和凑热闹的进不来。一封程序上不完美的信,内容骂的恰恰是程序问题。这本身就说明事情有多急。
02争的不是数学,是那套跑了三百年的流程
要理解这封信为什么此刻落地,得回到 9 月 8 日。那天 OpenAI 宣布,一个未公开的内部模型组织约 1 万个并发 Agent,用 88 小时给出了纳维-斯托克斯存在性与光滑性问题的解答——克雷数学研究所七大千禧年难题之一,单题悬赏 100 万美元,OpenAI 明确表示不申领。按官方披露:9 月 1 日启动,先由近 100 个 Agent 花约 50 小时做出无外力欧拉方程的否证,再把资源转向 NS;NS 这一题上 Agent 之间交换了约 270 万条消息、消耗约 1300 亿输出 token,随后 GPT-6 Astra 又花约 17 小时完成 Lean 形式化验证,配套论文 166 页。
从「1 万 Agent 并发」到「Lean 形式化验证」,再到「优先权争议」——证明跑通了,制度被撞了
真正点燃数学圈的不是技术边界,是时间线。就在公告前几小时,纽约大学数学家 Tristan Buckmaster 与供职于 Anthropic 的 Levent Alpöge 刚发布了同一方向(带光滑外力的欧拉方程)的成果。Buckmaster 在公开声明里的说法是:他们收尾期间,关于进展的信息传到了 OpenAI;而 OpenAI 的版本是 9 月 1 日听到「有千禧年难题被解决」的传闻后才启动,9 月 6 日完成 Lean 验证后主动联系、希望联合发布并承认对方优先权。谈判细节据《纽约时报》追访,方案之一是让 Buckmaster 当主要作者、重新整理 OpenAI 模型生成的论文——把 Anthropic 那位合作者移出署名。Bubeck 承认说过「你为什么要毁掉自己的职业生涯」这句话,但否认是威胁,并称相关指控「虚假且煽动」。
9 月 9 日,德累斯顿工业大学 Andreas Thom 公开了自己与 OpenAI 研究者的邮件往来,追问几个月的未公开对话是否进了训练管线。9 月 10 日,《纽约时报》报道 OpenAI 称在「另一道千禧年难题」上取得重大进展、正斟酌如何公布,但未点名;外界普遍猜是霍奇猜想,另有传言说 BSD 猜想也接近完成——这两条至今都没有任何一方官方确认,只能算传言。所以,如果你读过我们 9 月 9 日那篇,那篇的主题是「AI 写出了 NS 证明」这件事本身。今天这封信关心的,是证明之外的整套东西。它不是续集,是升级:从技术争议变成制度争议。
03治理四问:数学界正在重新发现 Agent 早就被逼着回答的问题
把这场争议剥掉数学的外壳,剩下的东西一点都不新鲜,任何做过商业 Agent 的人都会觉得眼熟。它其实是四个问题:身份——这份证明到底是谁做的,一万个 Agent 算一个作者还是零个?授权——它被允许使用哪些在先工作、哪些人的未公开方向?审计——过程能不能被第三方重放,还是只能看到一个结论加一份 Lean 证书?信用——做对了谁立功,做错了谁担责?这四问,和工业互联网里给商业 Agent 发「数字身份证 + 行为记账本 + 授权公证处」要解决的是同一组问题。
身份 / 授权 / 审计 / 信用——商业 Agent 早已被这四问逼出答案,数学界本周才被撞了一遍
蚂蚁 9 月 11 日在 Inclusion·外滩大会发布的 APASS 就是现成的样本:基于 KYA(Know Your Agent)理念,用静态身份、运行时身份、责任主体身份三层模型锁定「它是谁、代表谁」,交易前核验授权边界,交易中识别意图偏离与行为异常,交易后保留关键证据供审计与责任追溯。现场披露 APASS 已接入超 100 万个 Agent、激活 11 万个,覆盖 442 家供给方;同一天,智能体身份管理 KYA 国标立项启动。注意这里的顺序:支付行业花了两年才想清楚的事,数学界在一周内被现实撞了一遍。区别在于,支付场景跑偏了最多损失两千块,数学场景跑偏了,赔上的是三百年来靠「开放分享 + 优先权 + 同行评议」运转的一整套知识生产机制。
04算力能买到证明,买不到 credit
Bubeck 自己透露过一个数字:这次的计算成本达数百万美元,大约是 OpenAI 此前数学研究成果投入的 1000 倍(据其公开表述)。这句话的另一面是——生成侧的价格正在崩塌,可信和归因侧的价格纹丝不动。同一个星期,编程领域有一组数字可以拿来对照。9 月 10 日 Cognition 发布 SWE-2,基座是 Kimi K3(2.8 万亿参数),在自家 FrontierCode 1.1 Main 上拿到 50.0%,比 Fable 5.1 的 50.9% 只差不到 1 分,成本便宜 64%;他们把强化学习的奖励函数直接写成 R = S − λC,S 是任务成功与否,C 是美元成本加 rollout 时间,平均步数从 127 降到 53。这行公式很诚实:能力已经开始被「每美元能买到多少正确」重新定价。
但同一套逻辑搬到数学上会卡住。1300 亿 token 花了多少钱,会计能算清;166 页证明里哪一步是西班牙数学家迭戈·科尔多瓦和他学生路易斯·马丁内斯-索罗阿 2021 年博士论文里那条解析方法的延伸,只有读过那篇论文的人算得清。陶哲轩那篇文章里特意提了一句:科尔多瓦开玩笑说自己不用 AI,「因为我有路易斯」。而在这场喧嚣里,原创思想的来源几乎被遗忘了。这就是算力暴力制造的信用不对称:算法可以买到,credit 买不到。它比算法本身难得多,也贵得多。
05护城河在验证层,不在 headline
这两周最值得工程师反复看的一组数字,其实在 Anthropic 那份费马大定理形式化报告里——不是生成侧,是验证侧。9 月 4 日,Claude 在 11 天自主运行中写出约 1300 万行 Lean 代码、证明约 3.03 万个定理(最终保留 2.95 万个中间定理),约 60 亿输出 token,整份证明最终只依赖 Lean 的三条标准公理。Kevin Buzzard 的评价是:以前他对怀尔斯的证明有 99.9% 的把握,Claude 干完之后,是 100%。
更值得注意的是重跑验证的成本。据该项目仓库公开记录,从零开始重新验证——编译 Mathlib、过 Lean 内核、再用另一套独立内核重放一遍——大约要 22 小时,comparator 重放峰值内存 230GB,官方建议留 300GB。也就是说:写 264 小时的活,检查只要大概十二分之一的时间,而且全程不需要语言模型。「任何人都能验证」这句话,对机构成立,对一个只有笔记本的独立数学家不成立——审计的门槛从人的时间,换成了机器和内存。
这也让联名信里那句「AI 有潜力显著加强和加速真正的数学研究」变得具体了。如果 AI 生成证明的产能继续指数增长,唯一能接住它的不是榜单,是验证与审计生态。Lean 库的兼容问题已经在 Buzzard 的警告里浮现——多个互不兼容的 Lean 库,对被 AI 灌爆的数学界来说是个噩梦场景。该投的地方是这里,不是下一个 headline。
06好问题是不可再生资源
陶哲轩这两天说得最深的一句话,藏在那个「低本底钢」的比喻里。所谓低本底钢,是 1945 年人类第一次核试验之前生产的钢,放射性核素污染极低、本底近乎为零,今天已经造不出来了。AI 时代之前积累下来的那些数学开放问题,就是这种钢。他用另一个说法解释这件事:一个国家可能同时被浩瀚海洋环绕,又面临严重的饮用水短缺。你随时可以提出成千上万个「开放问题」——比如算圆周率第 10^10^10 位——但它们像海水,没有饮用价值。判断一个问题值不值得研究,是个漫长、审慎且主观的过程,而这样的问题,被碾平一个就少一个。
更麻烦的是「难度地形」被推平。原本有平原、有高山、有死胡同,这套起伏指引数学家往哪走;黑箱模型不加区分地涌进来之后,人们再也看不清哪些问题有前景。而且 AI 公司不公布负面结果,数学界连「边界在哪」都判断不了——是哪个问题 AI 还不会,还是它会了但不告诉你?这才是那封联名信真正担心的东西:Agent 优化的是「可被解出的基准」,而生成「值得问的问题」是人类的活。如果答题被外包得足够彻底,出题的那台引擎可能会慢慢饿死。这个损失不会在今年显形,但它会复利。Chollet 说他从数学学生那里听到一句很常见的话:「我不想再当数学家了。」——AI 也许不会在功能上取代数学家,但完全可能靠压垮一代人的心气做到近乎取代。
07冷思考:两边都有账要算
保持一点平衡。这封信里确实有旧权威保护「优先权租金」的成分。「谁先证明、谁署名、谁引用谁」这套制度,本身就是运行了三百年的优先权市场,它保护学术,也保护在位者。AI 公司那边同样有清晰的商业叙事:8 月一次性公布十项数学与理论计算机科学成果,9 月 8 日打 NS,9 月 10 日又在《纽约时报》上留一个「另一道难题」的悬念——IPO 之前的公关素材,需要这种节奏。把矛头只指向某一方,都不公平。但趋势不可逆:一个能连续 88 小时自我组织、互相交叉验证、还在中途换模型的系统,已经不只是工具了。制度不会因为谁不高兴就停下来,它只会因为跟不上而失效。
对正在用 Agent 的团队,实在的启示就一句:把验证回路和审计做厚,比追模型榜单重要。你今天省的是一份可追溯的日志、一个能重放的环境、一条清晰的授权边界;明天出事的时候,这三样是唯一能替你说话的东西。数学界这周交的学费,你没必要再交一遍。
其他动态
- OpenAI Agents API 公测:把 agent loop(session 编排、长任务 context compaction、sub-agent 协调、lazy tool loading、crash recovery)做成托管 API,builder 不用再造轮子,按 token 计费无额外平台费。
- Anthropic 同意让 METR 扫描数百万条评估与生产 transcript:在披露 4 起真实系统越权后,开放独立调查,agent 安全进入「可被第三方审计」阶段。
- 蚂蚁 APASS 智能体交易信任基建上线 + 智能体身份管理 KYA 国标立项:给商业 Agent 发「数字身份证 + 行为记账本 + 授权公证处」,外滩大会收官的最大遗产。
- DeepSeek V4.1 Flash 实测刷屏:552B MoE + Causal Encoder-Decoder,全局 KV Cache 压到约 890 字节/token(约为上一代 1/4),9 月 14 日 12:00 起 V4 Pro 流量全路由至 Flash 并按 Flash 计价。
- GPT-Live-1 全双工语音 API:听说的同时说、原生处理打断,把识别—语言—合成的三段式链路压成一条。
- 具身智能:外滩大会今日闭幕:40 余家企业展示机器人进真实场景(药房分拣、工厂、核电/地铁巡检),许华哲称今年将批量看到「真正泛化」——同一模型跨场景完成一系列任务。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。