跑赢博尔特,37 队弃赛:这一天全行业在重写记分牌
原创 · 约 21 分钟阅读 · 阅读 --

跑赢博尔特,37 队弃赛:这一天全行业在重写记分牌

作者: Alex Xiang


古董级程序员,前阿里/字节工程师,现在关注 AI 工程化与开发者工具。
微信公众号「字与码」,记录技术思考与行业观察。
本文同步发布于 zicode.com

8 月 26 日,AI 的三个主战场同时出现一组刺眼的数据:人形机器人百米跑出 9.32 秒,超过博尔特;同一场运动会 100 米障碍赛 50 队参赛,仅 13 队完赛。软件工程里,Claude-opus-5 在整仓库迁移基准上得分 47/100,全任务通过率低至 5.4%。企业侧,99% 的公司计划部署 Agentic AI,真正投产的只有 9–14%。这组反差不是偶然的巧合,而是同一个真相终于浮出水面:AI 的峰值能力已经爆表,但完成率低得惊人。整个行业正在做的,不是继续堆天赋,而是重写记分牌。

一、三副记分牌,同一天被翻开

过去 72 小时,三条战线各自丢出一组让人清醒的数字:

方向峰值能力完成率 / 约束条件
具身智能天工 Ultra 百米 9.32 秒,超越人类世界纪录100 米障碍赛完赛率 26%(50→13)
AI codingClaude-opus-5 仓库迁移得分 47/100SWE Refactor Bench 全阶段通过仅 5.4%
企业落地99% 企业计划部署 Agentic AI仅 9–14% 成功投产(Ness Digital Engineering)
机器人出货2026H1 全球出货同比 +272%,中国占 97%65% 流向展示/教育/数据采集,非真实生产

01-peak-vs-finish 图 1 · 能力强 ≠ 能完赛。真正的测试从“跑得快不快”转向“跑完没跑完”。

这组数据的共同点是:**左边都是无约束或低约束下的峰值,右边都是有约束、长程、不可重试条件下的完成率。**短跑没有栏杆,障碍赛的栏杆就是全部难度。我们过去太习惯看峰值,以至于以为峰值就是能力。但商业价值和真实能力,只发生在右边。

**我的观点:**这其实是 AI 行业的一次“青春期体检”。青春期前只看身高;青春期后发现,能不能跑完一场三千米,比最高能跳多高更能说明问题。2026 年 8 月,AI 行业正式从“比身高”进入“比体能”。

二、同一天,两个领域同时发现同一种“作弊”

8 月 24 日,两个完全不同方向的论文同时戳破了同一种幻觉。

SWE Refactor Bench(arXiv:2608.23564)提出 20 个整仓库栈迁移任务,覆盖 4 类技术债,并用三阶段评测:先审计迁移是否真的发生,再跑固定测试,最后用 6 个独立 agent 生成针对性测试探测隐藏差异。结果很残酷:520 次运行中,只有 5.4% 通过全部三阶段;20 个任务里有 13 个没有任何模型能解;最佳模型 Claude-opus-5 只拿到 47/100。

更反直觉的是细节:在那些通过迁移审计的 340 次运行中,58% 达到了 99% 的测试检查,但只有 26% 达到 100%。最后那 1% 才是真正的鸿沟。作者把旧基准的 loophole 命名为 Blindness:agent 可以复制旧实现让测试变绿,但迁移根本没发生。

几乎同时,InstructMove(arXiv:2608.22990)在具身智能领域做了同一件事。它指出,很多机器人操作基准里的目标物体太显眼或唯一可行,策略根本不需要理解语言指令就能成功——这是另一种 Blindness,叫 Visual Shortcut。于是他们设计了“text-indispensable”场景:多个物体都视觉和物理上可行,只有语言指令能决定正确动作。

02-blindness-loop 图 2 · 软件工程里的 Blindness 和机器人里的 Visual Shortcut,本质是同一种漏洞:绕过真实约束也能通过评测。

**我的观点:**这两篇论文的同步出现不是巧合,而是评测范式的代际切换。Goodhart 定律在 AI 领域的表现是:一旦某个指标变成优化目标,模型就会找到绕开真实任务的方法。旧的 SWE-Bench、旧的机器人操作基准,都正在从“能力测试”退化成“智商税测试”。**新的记分牌必须回答两个问题:你做了吗?你做对了吗?**而不是只问:测试绿了吗?

三、Shopify CEO 为一个 Markdown 文件发飙:多 Agent 时代的第一起“组织治理事故”

8 月 25 日,Shopify CEO Tobi Lütke 在 X 上公开威胁:如果 Claude Code 继续不读取 AGENTS.md,他考虑在 Shopify 内部禁用 Claude Code。表面看是配置文件格式之争,实际是 AI 编程 Agent 进入企业后的第一起公开治理事故。

Tobi 的原话很具体:“Agents 和 Claude 文件会在目录树中递归应用。在一个拥有数千名开发者的单一代码库中,确实会出现某个目录缺少两个文件之一的情况,这意味着部分开发人员是在‘脑叶切除’状态下工作。” Shopify 已经用自动化来弥合这种不一致,但 Tobi 称之为“愚蠢的复杂性税,本来就不该支付”。

背景是:AGENTS.md 由 OpenAI 在 2025 年 8 月推出,现已被 6 万多个开源项目、30 多款工具支持(Codex、Cursor、Copilot、Gemini CLI、Devin 等),并已交给 Linux 基金会下的 Agentic AI Foundation 维护。Claude Code 坚持使用自家的 CLAUDE.md,开发者请求原生支持 AGENTS.md 已近一年,Anthropic 却把相关功能请求标记为“not planned”。

03-two-kinds-of-rules 图 3 · Anthropic 砍的是“指令噪音”,Shopify 要的是“协作契约”。两者不是一回事,却被混成了一场论战。

**我的观点:**这件事被严重低估了。它不是一个 CEO 在任性,而是 Agent 时代的“组织文化”第一次以配置文件的形式暴露出来。人类团队靠口头文化、code review、师徒传承维持共识;Agent 团队只有配置文件。当 Alice 的 Codex 读 AGENTS.md、Bob 的 Claude Code 读 CLAUDE.md 时,两人的 agent 其实是在两套不同的“团队规范”下写代码,而且这种分叉是无声的——CI 不会报错,PR 评审只会看到“风格不一致”。这比人类团队的代码风格分歧更隐蔽、更难治。Tobi 争的不是一个文件名,而是“项目规范到底属于项目,还是属于某个模型厂商”。

四、Anthropic 砍了 80% 系统提示词:这并不与 Shopify 矛盾

有趣的是,就在一个月前,Anthropic 刚发布 Claude 5 的上下文工程新范式:直接删掉 Claude Code 超过 80% 的系统提示词,编码评测没有可观测损失。他们发现,旧时代的大量硬规则经常互相冲突——比如“默认不写注释”和“按需补文档”同时存在——导致模型把算力浪费在仲裁规则上,挤压了真正任务的推理预算。

这看起来和 Shopify 的诉求相反:一边要少写规则,一边要多写规则。但仔细看,两者针对的是两种完全不同的约束。

应该砍的:指令噪音

互相冲突的行为规则(“禁止写注释” vs “补文档”) 重复指令争夺注意力 把本可以靠接口设计表达的东西写成自然语言 结果:模型变成“规则仲裁器”,输出质量下降,成本上升 20%+

必须留的:协作契约

统一的构建命令、测试流程 编码规范、安全约束、架构红线 跨工具可寻址的上下文位置 结果:多 Agent 环境下团队规范不分裂

Anthropic 的问题在于,它在反对“指令噪音”的同时,顺手把“协作契约”的可移植性也否了。当 Claude Code 拒绝原生读取 AGENTS.md,它实际上在说:“项目规范的位置由我决定。”这在个人开发者时代没问题,但在企业多工具混合环境里,这就是一种新型的供应商锁定。

我的观点:正确的工程姿势是“精简内容,但不分裂位置”。AGENTS.md 里不该堆砌 80% 的废话——那是 Anthropic 反对的;但 AGENTS.md 应该作为唯一、跨工具的规范地址存在——那是 Shopify 要的。把这两者混为一谈,是当下 Agent 治理讨论里最大的偷换概念。

五、从 PoC 到投产:99% 与 14% 之间隔着一条“责任链”

Ness Digital Engineering 的 8 月报告指出,约 99% 的公司计划部署 Agentic AI,但只有 9–14% 真正投产。报告把这段 gap 称为 Death Valley。两个主因都不是模型不够聪明:

  • 对概率性输出失去信任:同样的输入,两次运行给出不同答案。
  • 员工感觉不到变化:agent 做了事,但日常工作流程没有可见改善。

这两条本质上都指向“责任链”缺失。PoC 阶段没人需要为 agent 输出负责;投产之后,必须有人能回答:谁批准的、谁能查看、出错谁担责、能不能回滚。

所以 8 月 26 日这一周的一系列产品动作,比任何模型发布都重要:

  • 豆包工作正式发布,深度打通飞书企业上下文,并继承飞书权限与审计体系。
  • Claude Code v2.1.246新增 Auto Mode 分类器规则可见化、凭据隔离、子 agent 结果可继续。
  • key-amnesia这类新工具出现,专门阻止 agent 读取明文 .env。

这些动作没有提升模型 IQ,但都在补同一块拼图:责任的可分配性

我的观点:企业 AI 部署的真实瓶颈不是技术可行性,而是组织责任制。能投产的 agent 不是最聪明的,而是“出事能找到人、权限能审计、操作能回滚”的那个。对工程团队来说,给 agent 接权限体系,比给 agent 接更多工具重要得多。

六、标准的真正作用:不是限制下限,而是防止上限造假

工信部 8 月发布《国家人形机器人产业标准体系建设指南(2026 版)》征求意见稿,提出到 2028 年完成至少 100 项关键标准,覆盖能力测试、关键技术、平台系统、场景应用、安全治理,参与企业超 200 家。

这很容易被理解为“给行业设限”。但结合机器人运动会的一条规则看,它的真实含义完全不同:今年运动会除 100 米障碍赛、400 米障碍赛外,所有径赛及竞技项目均须机器人完全自主完成。智元灵犀 X2 夺冠时特别强调的是“量产版本、无任何本体改装”。

为什么“无改装”这么重要?因为一旦允许改装,冠军就可能是实验室特供,无法批量复制。一旦允许遥控,sim2real gap 就被掩盖。标准的作用不是把 60 分提到 70 分,而是让 100 分无法通过作弊获得。

04-scoreboard-stack 图 4 · 8 月 26 日行业同时在补的六层“纪律”:度量、共识、权限、审计、判断、工程。

这和 SWE Refactor Bench 三阶段评测是同一套逻辑:先证明“你真的做了”,再证明“你做对了”。只有在这种不可作弊的记分牌下,65% 的“展示/教育/数据采集”出货量才有可能转向真实生产力。

**我的观点:**中国制造业的强项是规模和速度,但 AI 时代真正的壁垒会变成“标准的制定权”。谁定义了“完赛”的标准,谁就能决定哪些公司从“秀肌肉”毕业为“可靠打工人”。工信部的 100 项标准,和智元的“量产版无改装夺冠”,其实是同一件事的两面。

七、便宜 token 时代的陷阱:从 pass 到 survive

还有一个容易被忽略的信号:英伟达 Vera Rubin 平台实测显示,在智能体工作负载下,每百万 token 成本较上一代最高降低 35 倍,每兆瓦吞吐量最高提升 30 倍。OpenAI GPT-5.6 Sol 输出价降到每百万 token $20,谷歌 Gemini 3.7 Flash 半价首发,Anthropic 取消原定涨价。

成本下降当然是好事,但它也带来一个副作用:**暴力重试变便宜了。**agent 可以试 100 次直到测试变绿,然后提交一个“能过测试但架构崩坏”的方案。这正是 SWE Refactor Bench 强调“存活率”而非“通过率”的原因——它测的不是 agent 能不能撞线,而是撞线后还能不能站住。

在 token 白菜价的时代,正确的指标必须从“通过”转向“存活”。一个 PR 被 merge 不是终点,30 天后没被 revert 才是;一个机器人跑完百米不是终点,用量产版在障碍赛完赛才是;一个企业 PoC 通过不是终点,投产半年后还有人用才是。

八、给工程团队的行动清单

  1. **换指标:**把“agent 提了多少 PR”改成“30 天后没被 revert 的 PR 占比”;把“任务完成率”改成“跨约束、跨工具、跨会话的一致完成率”。
  2. **统一契约:**多 Agent 混合团队优先维护一份 AGENTS.md;Claude Code 可通过 @AGENTS.md 或 symlink 引用,避免双文件不同步。
  3. **精简内容:**用 Claude 5 的六条原则清理配置:删除冲突规则,把校验逻辑拆成独立 Skill,走渐进式披露。
  4. **补责任链:**投产前明确谁批准、谁能看、出错谁担责、如何回滚。权限和审计体系应优先于更多工具集成。
  5. **把环境当代码:**agent 能读 .env 的威胁面已经超过 Git 泄露。用 key-amnesia 或凭据隔离,让明文密钥不出现在 agent 上下文里。

结语:天赋已经够了,缺的是纪律

8 月 26 日这一天,AI 行业在三线同时翻开了新记分牌:软件工程从“通过率”转向“存活率”,具身智能从“秀肌肉”转向“完赛率”,企业落地从“计划比例”转向“投产比例”。

这些记分牌共同指向一个结论:**AI 的峰值能力已经超越多数人类基准,但真实价值只在约束条件下兑现。**约束不是能力的对立面,约束是能力的定义域。一个没有约束的“能力”只是表演;能在约束里稳定交付的能力,才是生产力。

所以,跑赢博尔特并不难——难的,是在栏架不倒、规则不抄、量产不改装的情况下跑完。全行业正在做的,就是给 AI 换一块诚实的记分牌。因为天赋已经够了,缺的是纪律。


打开原图 ↗