稀缺的不是智能,是诚实的反馈:环境侧脚手架、具身评测竞技场、80% 的上瘾率
原创 · 约 29 分钟阅读 · 阅读 --

稀缺的不是智能,是诚实的反馈:环境侧脚手架、具身评测竞技场、80% 的上瘾率

作者: Alex Xiang


古董级程序员,前阿里/字节工程师,现在关注 AI 工程化与开发者工具。
微信公众号「字与码」,记录技术思考与行业观察。
本文同步发布于 zicode.com

过去 72 小时,三件看似无关的事撞在了同一个原点上:Google Cloud 把「环境脚手架」做成了论文,具身智能圈同时在造一座可复位的「评测竞技场」,而 80% 的开发者发现 AI 编程让自己上瘾了。串起来看,今天竞争的稀缺资源不是更聪明的模型——**是能让模型老实变聪明的反馈环境。**

一、三条信号:同一周,三种「环境」被同时重做

这一周(8 月 20–24 日),AI coding、数字 Agent 与具身智能三条线,几乎同时把「环境」这个被长期忽略的对象搬到了聚光灯下。我们花了一年多时间给模型加 harness(Skills、Memory、Tools、MCP、AGENTS.md),但环境始终是死的——题库是死的,模拟器是死的,benchmark 是死的。

这个礼拜,三件事同时改变:

  1. **8/20,**华盛顿大学 × Google Cloud AI Research 公开论文 EnvHarness: Awakening Static Worlds for Agent Learning(arXiv:2608.19880),提出「环境脚手架」概念,论文登顶 Hugging Face 当周榜首。
  2. **8/22,**南方都市报等多家媒体集中报道具身智能仿真评测平台 RoboColiseum 上线,40+ 队伍内测,仿真-真机相关性达 89.5%。
  3. **8/23,**Coddy Tech 发布的 305 人开发者调研指出,80% 的开发者认为 AI 编程更像「依赖」而非「优势」,43% 在本应收工后仍继续使用。

乍看这是三件完全独立的事,但所有线索都指向同一个问题:当智能本身不再是稀缺品,环境——或者说诚实的反馈信号——才是。

*图 1 · Agent = Model + Harness 已经做完,现在做 Customized Env = Static Env + EnvHarness*

二、EnvHarness:把环境从「数据」重构成「系统」

先把这篇本周最值得读的论文拆透——不是因为它结果多漂亮,而是因为它做了一次迟到但必须做的认知切换。

过去一年多我们所有力气都花在了 agent 一侧:给模型配 Skills、配 Memory、配 Tools、配 subagent、配停止条件。模型本身冻在那儿不动,我们围着它一层一层加外挂。这套打法现在有个名字,叫 harness。等式是现成的:Agent = Model + Harness

但交互是有两侧的。模型那侧已经被我们包了一层又一层,另一侧——agent 干活的那个环境——一直是死的。不管坐在对面的是去年那个笨模型还是今年这个聪明模型,环境给出的任务、反馈、评分标准,一个字都不带变。

8 月 20 号,Google Cloud AI Research 和圣路易斯华盛顿大学挂出来的这篇论文,首页就一句话:

“Agents got a harness. Now the environment gets one.”

Agent 已经有了 harness,现在轮到环境了。

一句话的结论:环境构建从「从头撰写」变成「封装」

论文结论段最核心的一句话是:

“This reframes environment construction as a wrapping problem rather than an authoring one.”

这把环境构建从一个「从头撰写」问题,重新框定成了一个「封装」问题。对应的等式和 agent 侧完全对称:

Customized Env = Static Env + EnvHarness

环境冻结不动,在外面封一层可编程的 wrapper,只通过标准的 reset / step 接口改信息流,一个死的 benchmark 就能变成会针对特定 agent 弱点出题的活环境。

三个组件:Stage、Contract、Chain

EnvHarness 给出了三类组件,正好对应「改一个环境只有这三种改法」——改起点、改规则、改长度。抽象层次选得很准,做过题库难度调优或模拟环境的人,脑子里那些需求基本都能落进这三格。

组件改什么覆写哪个接口具体例子
Stage 开局初始状态reset()提前把杯子藏进抽屉 → agent 必须先学搜索
Contract 法则动作 / 转移 / 观测step() / obs()拿稳之前阻断「洗杯子」→ 逼 agent 先拿起东西
Chain 串联任务长度step()原任务之后接「加热土豆」→ 防 agent 提前停下

三个组件可以叠加,但不可交换:先套 Stage 再套 Contract,和反过来,得到的是两个不同的环境。工程上就是嵌套顺序决定了哪些约束在初始化时生效、哪些在交互中生效。

三、最反直觉的一组数字:静态环境沉淀出的经验是负资产

如果说 EnvHarness 的形式是优雅的,那它结论里最值得停下来重读的部分,是下面这张表。论文特意安排 EnvRigger 和被训练的 policy 用同一个模型 backbone——出题的和答题的一样聪明,堵死「靠蒸馏外部更强模型」这条路。

*图 2 · 红色数字标出的两组「负收益」,是全文最反直觉的部分*

先把表里的两组反直觉数字单独拎出来:

  • WebArena:不给 skill = 38.7,原始(静态)环境的 skill = 38.5,EnvHarness 的 skill = 41.6。辛苦沉淀出来的经验,比什么都不给还低 0.2 个点。SpreadsheetBench 同样跌到了无 skill 基线之下。
  • SWE-bench 平均步数:不给 skill = 53.6,原始环境 = 55.0(+1.4,更啰嗦了),EnvHarness = 49.6(少 9.8%)。静态环境不仅没让 agent 更聪明,还让它变得更墨迹

论文给的解释是:静态环境只允许 agent 练习它本来就会做的事,学到的净是冗余或者次优的经验。

这条我看得直点头。我们内部做经验沉淀的时候踩过一模一样的坑:让 agent 把成功案例存下来复用,结果存的全是它本来就做得好的那部分,真正卡住的地方一条都没沉淀下来,检索出来还占上下文。在自己已经会的事情上反复练习,产出的不是经验,是噪声。

反过来看 EnvHarness 的曲线:同样预算扩到 300 个环境时,静态环境的性能在 52.1 走平,生成环境在 50.4 更早走平,而 EnvHarness 从 47.7 一路爬到 54.8,没有停下来的迹象。论文的判断很硬:**瞄准学习者当前的能力边界,根本上比无条件的环境规模扩展更有效。**这件事在方法论上不新——课程学习讲了好多年。EnvHarness 的贡献是把它落在了工程上可复用的接口层:以前做课程学习,每个 benchmark 都要手写一套难度调节逻辑;现在一个 reset / step 接口通吃五个 benchmark。

四、EnvRigger:真正值钱的是那道闸门

组件本身和 policy 无关,但该给哪个 agent 套哪个组件,得看这个 agent 到底哪里不行。为此论文配了一个自动化循环,叫 EnvRigger:把 policy 当纯黑盒,只看执行轨迹。

四步:Observe(跑一批 rollout 收轨迹)→ Diagnose(找根因,顺便定方向)→ Write(合成候选组件)→ Validate(跑新 rollout 验:接受 / 拒绝 / 打回重写)。

Diagnose 这步有一个细节最值得抄:如果 policy 拿了满分,结论不是「很好」,而是这个环境太宽容了,定制方向随即反转——注入更难场景,把潜在缺陷逼出来。Validate 那步有三种判决:接受、拒绝(不可解的或根本没难度的)、打回修正(信号强度没标定好的)。

看到「LLM 诊断问题然后自动生成东西」这类流程,第一反应通常是怀疑——诊断得准吗?生成的东西靠谱吗?但这套设计真正的支点不在 Diagnose,在 Validate 那道闸门:不管诊断多离谱、组件写得多怪,只要新一轮 rollout 过不了「既培养了缺失能力、又仍然可解」这两条,它就进不来。诊断错了顶多浪费一轮迭代,脏东西进不了最终的环境池

这是很通用的一个模式——生成端可以不可靠,只要验证端可靠,整条链路就是收敛的。我们做 AI 提效工具的时候也是这个路子:让模型大胆生成,把关卡设在能自动跑的验证上。

*图 3 · 同一周里有两个反馈循环同时被刷新——一个给模型,一个给我们自己*

五、reset 是分水岭:论文的边界,正好是具身智能的战场

EnvHarness 局限那一节写得相当诚实——但其中一句比其他所有局限加起来都硬:

“The binding constraint is reset.” 真正的约束是 reset。

为什么是它?因为 Stage 要把环境放进某个选定的初始状态,Chain 要在两个子任务之间把环境送回一个已知状态——两者都预设了环境可以被恢复,而不是只能往前走。论文明确排除了两类场景:由实时服务支撑的环境(发出去的邮件、下过的订单撤不回来),以及物理机器人(周围环境不会在两个 episode 之间自己复位)

*图 4 · 89.5% 是相关性,10.5% 是 sim2real gap 的标价——也是 RoboColiseum 想压缩的*

想用这套思路,第一件事不是抄组件设计,是先问自己:我这个环境能不能 reset?这一条基本把大多数生产系统挡在门外。所以「稀缺的不是智能」这句话,到了物理世界这一侧,直接被翻译成**「稀缺的是复位能力」**。

具身智能圈的人显然也意识到了同一件事——本周最大的具身新闻不是某家又发了新机器人,而是多家平台在同时开工评测基建:

  • 8/22 RoboColiseum 上线,40+ 队伍内测,仿真-真机相关性 89.5%,差异控制在 10% 以内。
  • 6/1 工信部 YD/T 6770-2026 首份具身智能行业标准正式实施。
  • 8/12 香港大学 MMlab 推出 RoboDojo,20 所高校共建。
  • 同步 RoboFinals(100 项任务)、RoboChallenge(真机 4 万次)、伯克利+斯坦福+NVIDIA 联合的众包真机评估网络(600+ 次双盲)。
  • 8/22 同步 第二届世界人形机器人运动会多项赛事取消人工遥控,全程全自主运行。

89.5% 的另一面是 10.5%——这 10.5% 就是 sim2real gap 的标价。具身智能圈掏钱造「评测竞技场」,本质是在为不可复位的物理世界造一个可复位的影子世界。和 EnvHarness 的「封装环境」思路完全同构——两边都意识到:不能 reset,就没法迭代。

而运动会取消遥控这件事更狠。它把不可压缩的物理不确定性从 PPT 里搬到聚光灯下。中国软件评测中心副主任巩潇的判断很到位:「虽然自主决策仍然可能出现偏差,但这种面对真实物理世界时的不确定性,恰恰是技术最核心的攻关难点。」

六、80% 的上瘾:另一个反馈循环里,那一格是空的

看到这里我们其实已经在不经意间画出了本周另一张图的两个分栏:

  • **左栏:**我们给模型造的环境——闭环、自动跑验证、有惩罚、还会在环境太宽容时主动加难度。
  • **右栏:**我们自己正在用的环境——没有 Validate。

Coddy Tech 对 305 名开发者的调研,ZDNET 和至顶网这两天在集中讨论。数字我们直接上:

指标数据含义
感觉 AI 使用更像依赖而非优势80%工具已经反向定义工作节奏
本应收工仍继续使用43%时间边界被工具溶解
为继续使用推迟睡眠32%已跨越健康边界
重度使用更可能升职加薪74%组织在用产出量反向激励
同时更容易职业倦怠51%收益与代价绑定发放
对 AI 准确性的信任度(Stack Overflow)40% → 29%越用越不放心

Rootly 联合创始人/CTO Quentin Rousseau 凌晨两点四十七分在 LinkedIn 上写的那段话,把整个状态写到了极致:

“It’s 2:47 a.m… I’m not debugging an outage. There’s no deadline. I’m just watching Claude Code refactor a module… and I can’t stop.” “Agentic coding is addictive. When the agent gets things right, you get a dopamine hit. When it fails, you get an adrenaline rush.”

他最后不得不寻求医疗帮助。这不是个体问题——Agent loop 本身就是一个只有奖励没有判据的变比强化界面。它是这个时代绝大多数「上瘾 app」背后的同款行为机制,被塞进了专业工作流。

而文章开头那条「Hermes 单日烧 2T Token」的事件,不过是上面那个反馈循环在企业尺度上的复刻:

8 月 24 日凌晨,Hermes 在 OpenRouter 单日消耗超 2T Token。评论发现单次请求 Context 可达 50K–100K(AGENTS.md、Tools、MCP、Memory 叠加多轮 Agent Loop)。文章指出未来评价 Agent 应看「每百万 Token 成功解决多少任务」,而非炫耀 Token 消耗量。

2T Token 烧出来,有多少真正变成「任务完成」?没人知道。Token 消耗是可观测的,任务完成是不可观测的——**于是我们优化了可观测的那一个。**古德哈特定律,完整复刻。

七、这个礼拜给工程团队的三个具体动作

把 EnvHarness 论文和这周的具身评测基建并列起来看,能直接落到三个今天就能动手的事:

1. 把团队仪表盘里的指标换一换

不要把「AI 工具使用率」「代码接受率」「月活使用时长」当成 KPI。这些是「消耗」,不是「完成」。建议加三类:

  • **每百万 Token 解决的任务数:**对齐 Hermes 烧 2T Token 那篇文章的口径。Hermes 一天 2T Token,到底交付了多少独立完成的任务?
  • **verification debt(验证债务):**接受 AI 输出之后被回滚、debug、重写的比例。ZDNET 那篇文章里有个词很好,叫「almost right, but not quite」——这就是 verification debt 在 PR review 里的实际形态。
  • **关停信号:**本应收工仍继续使用的比例。可直接复用 Coddy 那种调研。74% 认为有助升职的同时 51% 更容易倦怠——这个剪刀差是组织层面的危险信号,不是个人问题。

2. 给 agent 配一道「Validate 闸门」

EnvRigger 那套系统给的最大启发不是组件设计,是**「让生成端不可靠、让验证端可靠」**这个套路。我们写过的所有 AI 提效工具,凡是真正能跑下来的,都有一个共性:

  • 生成可以失败——LLM 写出来的 SQL 经常是错的,这没关系。
  • 必须有一道自动可跑的验证——查询计划、explain、行数比对、对账规则、回滚条件。
  • 验证通过才让结果进入下游。

我们一直说要建 CI/CD、要写单测、要 lint、要 typecheck——这些本质上就是给代码生成开的 Validate 闸门。EnvHarness 在做的事,是把这道闸门从「输出端」搬到了「输入端」——环境本身在 agent 进来之前就被验证过两遍。给整个项目都装上这种闸门,模型会立刻显得「聪明」很多,不是因为它变了,是因为它犯的错被你拦下来了。

3. 投资一个可复位的影子世界

EnvHarness 论文里 reset 的硬约束,和具身智能圈造 RoboColiseum 干的是同一件事。如果你团队的工作环境允许做 reset(CI sandbox、staging environment、feature branch、preview deployment),就值得把环境本身当成可编程的资产——为它建一个可复位的影子世界,让 agent 在里面随便踩坑。

但请注意:EnvHarness 的设计同时也警告了一些东西。比如他们对额外组件的设计都很谨慎。三个组件之所以选 Stage / Contract / Chain,是因为这三种改法几乎能覆盖所有题库难度调优的需求,但 Chain 不能表达带分支或共享中间状态的工作流。这意味着当你真的要把 EnvHarness 的思路搬到生产环境的「影子」上时,先要回答的不是「怎么改」,是「我能不能 reset」——答不上来就先别动。

八、收尾:稀缺的不是智能,是诚实的反馈

把这一周的事合在一起看:

  • EnvHarness 把「环境」从数据重新定义为系统,让环境本身可编程、可验证;
  • RoboColiseum 们为不可复位的物理世界造一个可复位的影子世界;
  • 开发者调研和 Hermes 烧 Token 暴露的是:我们给自己的反馈循环里,Validate 那一格是空的。

三个方向,三种「环境」被同时重做。稀缺资源是一样的:

稀缺的不是更聪明的模型,是能让模型老实变聪明的反馈环境。

对模型来说,这个环境叫 EnvHarness;

对机器人来说,这个环境叫 RoboColiseum 类的影子世界;

对人来说,这个环境叫——一道真正能拒绝「almost right, but not quite」的 Validate 闸门。

谁先把这道闸门装上,谁就拿到了下一个周期的入场券。

至于 80% 的「上瘾」和 2T Token 的「消耗」,它们提醒我们同一件事的另一面:我们给模型造的反馈环境是好的,我们给自己造的反馈环境是坏的——而后者决定的是行业的下一个十年。

信息来源

  • Chengsong Huang et al. (Washington University in St. Louis × Google Cloud AI Research) — *EnvHarness: Awakening Static Worlds for Agent Learning*. arXiv:2608.19880, 2026-08-20. 项目主页 envharness.com,代码 github.com/google-research/envharness。本周登顶 Hugging Face 论文榜。
  • 药研智能社:《Hermes 单日烧 2T Token 引爆 Harness 效率之争》,2026-08-24,来源 OpenRouter 社区。
  • 南方都市报:《缺乏统一标尺?具身智能迎来仿真评测「竞技场」》,2026-08-22;东方财富:《模型跑得快、评测跟不上?具身智能「本领」亟待统一「标尺」》,2026-08-18。
  • 东方网:《具身智能寻找评测「标尺」》,2026-08-21。
  • 人民日报:《既要会运动,又要能劳动》,2026-08-24(第 06 版),关于第二届世界人形机器人运动会取消人工遥控。
  • 至顶网 / ZDNET:《八成开发者:AI 编程让人上瘾,而非真正提效》《80% of developers find AI coding more addictive than helpful》,2026-08-23。引用 Coddy Tech 305 人调研 + 2025 Stack Overflow Developer Survey(信任度 40% → 29%)。
打开原图 ↗