技术热点透视20260906:100 万行代码,AI 自己写完了
原创 · 约 16 分钟阅读 · 阅读 --

技术热点透视20260906:100 万行代码,AI 自己写完了

作者: Alex Xiang


古董级程序员,前百度/微博工程师,现在关注 AI 工程化与开发者工具。
微信公众号「字与码」,记录技术思考与行业观察。
本文同步发布于 zicode.com

Bun 1.4 把运行时底层从 Zig 重写成 Rust,一次改动就「+1,009,257 行 / −4,024 行」、6,778 次提交、约 11 天、烧掉约 16.5 万美元 token。但核心开发者 Jarred Sumner 没有亲手敲出这 100 万行——他先搭了一套 harness,把 agent 放进去并行重写,之后几个月让 agent 继续修 bug、跑测试、反复打磨,直到稳定发布。同一天,Claude 用几乎一样的思路,端到端形式化证明了费马大定理(约 1,300 万行 Lean、约 60 亿 token、约 11 天)。两件标杆性事件,同一个答案:软件生产的单位,正在从「人写的一行行代码」变成「人设计的 harness + 被调度去执行的 agent」。

一、Bun 1.4 到底发生了什么

9 月初 Bun 1.4 正式发布,最炸裂的不是性能数字,而是它的来历。GitHub 合并记录显示,核心改动是 把大量底层代码从 Zig 重写成 Rust:一次提交就达到「+1,009,257 行、−4,024 行」。整段工程累计 6,778 次提交,全程 token 烧掉约 16.5 万美元。

关键不在这些数字,而在谁写的。主导整个项目的 Jarred Sumner 后来复盘:这 100 万行不是几百个程序员一点点敲出来的。他先搭了一套 agent 工作框架,定义好「应该怎么迁移、什么结果算正确」,然后把多个 agent 并行放进去推进;第一版出来后没有结束,而是让 agent 继续跑、继续测、继续修,几个月后才跟着 Bun 1.4 正式发布、跑在数百万开发者的电脑上。

**这里最容易看走眼的是「这不就是把 Zig 翻译成 Rust 吗」。**翻译出 100 万行不稀奇,能把这 100 万行一路修到稳定发布才是关键。Sumner 干的活更像搭流水线:定目标、定正确标准、搭测试与验证回路,再把 agent 放进去循环。代码让机器自己产,人盯结果。

二、真正的功劳不在「生成」,在「harness + 验证循环」

InfluxDB 创始人 Paul Dix 看完后写了一篇《The end of programming》,他的判断比表面更锋利:真正让他震动的不是 100 万行代码,而是 这 100 万行已经多到人根本看不过来。他观察到 OpenAI 和 Anthropic 内部一些开发者,现在一周能交几十甚至上百个 PR——到了这个量,逐行看代码基本成了不可能完成的任务。他们的新工作方式是:写 prompt、搭 harness、做测试、设验证条件,然后把 agent 放进去循环,人只盯结果。

这恰恰点破了「AI 写代码」最被误读的地方:成本曲线上,「生成」已经很便宜,「让它稳定、正确、能发布」才是贵的地方。Bun 那 16.5 万美元里,真正的大头不是第一次吐出 100 万行,而是之后几个月 agent 反复跑测试、修 bug、对齐行为的循环。生成是一次性开支,验证是持续开支。

01-harness-shift 图 1 · 编程单位的迁移:传统模式里人亲手写、人逐行 Review,瓶颈是人的 throughput;harness 模式里人设计架构/测试/验证,agent 并行生成,瓶颈变成了「验证回路够不够硬」。

**所以「编程终结」的说法只对了一半。**消失的是「人逐行敲代码再逐行 Review」这种具体动作;上升的是另一层能力——设计 harness、定义什么是正确、把验证做成 gate。程序员没有消失,是往上挪了一层:从写实现,变成写「让 agent 正确实现」的系统。这层活儿更难,也更值钱。

三、同一天,Claude 把费马大定理也「写」完了

如果说 Bun 是工业界的证据,同一天流出的另一件事是学术界的镜像。Anthropic 公开:Claude 用约 11 天,写出了费马大定理(FLT)首个端到端 Lean 形式化证明,约 1,300 万行 Lean、消耗约 60 亿 output token

这件事的过程本身比结果更能说明问题。早期他们试过多 agent 并行,结果因为跟丢全局依赖而崩掉——每个 agent 只看到自己那块,定理之间的依赖链一断,整个证明就立不住。后来切换到 Prove2Me 开放协作平台加 Claude Code 式 harness:平台维护「定理 DAG」,陈述和证明分文件存放,用自然语言检索来复用已有结论。换句话说,又是 harness 救了场——不是模型突然变聪明,而是有人把「怎么协作、怎么不丢依赖、怎么复用」这套编排做对了。

02-two-landmarks 图 2 · 同一天两件标杆性事件:Bun 的 100 万行 Rust 与 Claude 的 1,300 万行 Lean,都不是人一行行敲出来的,是 harness 调度 agent 跑出来的。共同答案不是「更强的模型」,而是「更好的 harness」。

把这两件事放一起看会很有意思:一个在重写生产运行时,一个在证明数论圣杯,领域差了十万八千里,但踩中的坑和用的解法高度一致——单 agent 搞不定大规模长任务,必须靠 harness 把任务拆对、把状态管住、把验证闭环。上一期我们聊「模型厂把 Astra 直接装机进 coding agent 的 harness」,那还算是厂商营销话术;这一期,它变成了已经在数百万开发者机器上跑着的产品事实。

四、harness 成为新的编程单位

所谓 harness,落到工程上就是一整套让模型稳定产出代码的能力组合:上下文与记忆管理、工具调用的编排、模型路由、护栏与权限、可观测与评估。它和「模型智商」是两件事。当生成越来越便宜、越来越强,真正稀缺和难复制的,是这套把模型接成稳定工作流的外壳

这意味着几件正在发生的事:

  • 「会写 prompt」不够了,要「会写系统」。 有价值的人,从「能写出漂亮函数」变成「能设计出让 agent 持续产出正确代码的 harness + 测试 + 验证回路」。
  • Review 的含义变了。 你没法读 100 万行,只能验证 harness 产出的行为对不对。代码正确性越来越等于「测试/验证回路的正确性」——测试写得烂,等于把正确性交给了运气。
  • 成本从「人天」变成「token + 验证回路」。 Bun 那 16.5 万美元是新型 opex:agent 循环烧 token、测试基础设施是固定投入。它便宜到离谱(100 万行摊下来每行几分钱),但必须被当作一条要观测、要预算的生产线来管。

一个被低估的风险:当没人读代码,正确性就完全押在测试上。 过去人 Review 是一道兜底,现在这道兜底被撤掉了。如果验证回路本身有盲区,100 万行里藏的坑不会有人逐行发现,只会在某次边界输入时爆。harness 越强,测试工程越不能偷工——这恰恰是最需要人来把关的地方。

五、对开发者与团队:别再只比谁的模型强

把 Bun、费马大定理、上一期的 Astra harness 连起来看,对正在把 coding agent 塞进工作流的团队,有几条现在就能落地的判断:

  1. 把代码生成当「生产线」而非「代笔」来设计。 重点投入测试、CI、验证 gate 和回放,而不是纠结「让哪个模型写第一版」。第一版永远便宜,硬的是让它稳定。
  2. 把 harness 能力当核心资产积累。 多模型路由、私有化与数据边界、领域适配、评估与可观测,这些「看不见」的能力决定你每天能不能稳定交付,也决定你不被任何一家模型厂绑死。
  3. 把 token 与单任务成本做成可观测指标。 头部 10% 用户烧掉大部分 token 是真实存在的成本焦虑;不度量,就会被账单教育。Bun 的 16.5 万美元提醒我们:agent 循环的账单会远比「一次生成」贵。
  4. 升维你的招聘与培养标准。 面试少问「这题怎么写」,多问「这活怎么拆给 agent、怎么验证它对」;衡量工程师,从「产出了多少行」转向「搭出了多可靠的 harness、交付了多少正确结果」。

六、其他动态(9 月 5-6 日)

  • 模型Anthropic 发布 Fable 5.1 / Mythos 5.1,缓存读取价降 75% 至 $0.25 / 百万 token。 高 agent 任务成本再降约 45%,长上下文与持续对话场景直接受益。
  • 观点吴恩达发文:使用 coding agent 已成关键 AI 工程技能。 强调「Agent = LLM + Harness」,超长时域任务的实际价值被过度吹捧,规划/执行/部署监控三环节才是真功夫。
  • 世界模型李飞飞 World Labs 发布 Atlas 全模态世界模型。 单张静态图生成 1 分钟 1440p 高清动态视频,遵循光影与重力规律,面向影视/数字孪生/机器人仿真。
  • 具身广量 Phi-Bot X1 在蔚来焊装线 21.5 小时零故障。 用「物理原生」世界模型训练、部署即退出,把推理成本留在训练期而非产线,思路值得工业具身借鉴。
  • 具身星尘智能发布 SmoothRL。 让在线强化学习适配大模型异步、变长推理,专填机器人实时控制与模型推理延迟之间的鸿沟。
  • Agent谷歌云发布数据库运维智能体。 Onboarding Agent + Observability Agent 深度集成 Gemini Cloud Assist,可自然语言选型、几分钟内给根因分析与修复建议。
  • 工具Meta 发布 Muse Spark 1.3 / Muse Code 正式版。 长程 agentic 与 coding 任务工具调用 −20%、token −25%,多 agent 工作流 + 跨会话状态共享 + 开发者 SDK。
  • 降本Spotify Portal 把 Claude Code token 用量砍 90%。 来自一线大厂的上下文工程实践(裁剪重复上下文、缓存、离载大结果、减少工具轮次)。
  • 本地Perplexity 推 Portable Computer 本地 AI agent。 本地优先、需 24GB+ VRAM,复杂推理才请求云端并需用户授权,把隐私与成本留在自己机器上。
  • 视频xAI Grok Imagine Video 1.5 agent 上线。 由 Image 2.0 驱动,多镜头连贯性增强,文生视频 Arena 排第 5(1491 分)。

**一句话收束:**Bun 1.4 用约 16.5 万美元 token、约 11 天产出 100 万行稳定发布的 Rust,Claude 用同样思路约 11 天形式化证明了费马大定理——两件标杆事件指向同一个判断:软件生产的单位,正在从「人写的一行行代码」变成「人设计的 harness + 被调度去执行的 agent」。生成已经很便宜,贵的是验证回路;程序员没有消失,是往上挪了一层,去写「让 agent 正确实现」的系统。当没人逐行读代码,正确性就完全押在测试与验证上——这恰恰是最该由人把关的地方。

打开原图 ↗