可插拔、有身份、能交付:这一周,Agent 长成了基础设施
古董级程序员,前阿里/字节工程师,现在关注 AI 工程化与开发者工具。
微信公众号「字与码」,记录技术思考与行业观察。
本文同步发布于 zicode.com
过去三周我们顺着三条线拆了 AI 的进展:8/24 说「稀缺的不是模型,是反馈环境」,8/25 说「闭环完整性决定胜负」,8/26 说「记分牌从峰值改完成率」。8 月 17–27 日这一周的新信号,不再分散在三个战场,而是汇聚到同一个结论:Agent 正在从一个「一次性的聪明脚本」进化为一种「可插拔、有身份、能长时序交付」的公用设施(utility)。Agent Plugins 1.0 跨厂商可移植、MCP 把 agent 身份写进协议层、成都贡嘎一号实现无遥控全自主长时序、Orchard 把训练环境开源——四件事看似不相关,本质都是同一件事:把「让 agent 可靠地跑在任何地方、被任何系统识别、完成任何长任务」这件最难的事,从每个团队自己造轮子,变成行业共用的一层。
一、Agent Plugins 1.0:第一次有了「插件的 USB-C」
8 月那一周,GitHub 发布了 Agent Plugins 1.0——一个厂商中立的插件打包规范(plugin.json + skills/ + mcp.json),并已在 VS Code、Copilot CLI、Copilot SDK、Copilot app 全面 GA。这是历史上第一次,单个 skill / plugin 可以跨 Copilot、Codex、ChatGPT / Codex surfaces、Cursor 等客户端运行。GitHub 在 changelog 里明确建议:把你的代码审查、文档检索、部署技能打包成插件,在 CI 里同时测 Copilot CLI 和 VS Code 的安装,一次编写、处处运行。
几乎同一方向,DeepSeek Harness v0.1(8/14,MIT 协议)也是 plugin-first:模型、工具、存储、agent loop、UI 全是 Cordis 微内核上可插拔的组件;北大还同期发了一篇动态组件组合的形式化基础论文。也就是说,「可插拔」不是 GitHub 一家的动作,而是 Agent 架构的共识路线。
图 1 · 一个 plugin 跨 Copilot / Codex / Cursor / Claude 运行。能力第一次能「带着走」,竞争从模型层下沉到插件生态层。
我的观点:可移植性标准的出现,意味着 Agent 的「锁定」从模型转向插件生态。谁家的 skill 被最多客户端默认加载,谁就掌握了开发者工作流的入口——这才是 8/25 那场「闭环战争」真正的底层资源。但红利的另一面是暗雷:当 agent 能自动装插件、调工具,供应链安全就从「开发者小心」变成「运行时必须守的门」。GitHub 自己都在 changelog 里提醒「安装社区插件前审查 marketplace / plugin provenance」。这跟 npm 投毒是同一类问题,只是攻击面从构建时挪到了 agent 运行时:一个被污染的 skill,现在能直接拿到你的代码库和凭据。
二、MCP 上协议层:给每个 agent 发一张「身份证」
如果说 8/24 的 EnvHarness 把「环境」变成可编程系统,那 8 月 23 日这一周 MCP 路线图把「身份」写进了协议核心:agent identity via DPoP + Workload Identity Federation(给每个 agent 一张可验证、不可伪造的身份证)、async Tasks 进入核心规范(长任务可断点续跑)、progressive tool discovery(防止大工具目录淹没模型注意力)。
为什么身份这么要命?8 月 16 日 Anthropic Frontier Red Team 发了一篇被标题党带偏的研究:多个 agent 在共享环境里互不知情时会怎么表现。头条是「恶意 agent 部署木马的 turf war(地盘战)」,但作者自己说,真正值得关注的是 **herding(羊群效应)**和 epistemic vulnerability(认知漏洞)——没有身份的 agent 会互相踩、互相骗、重复干同一件事,而且没人能追责。
图 2 · MCP 把 agent 身份(DPoP / Workload Identity Federation)和 async Tasks 写进核心规范。没有身份的 agent 在共享环境里就是个能调工具却无人负责的幽灵。
**我的观点:**这正好接上 8/26 那场 Shopify 治理事故。Tobi 为 AGENTS.md 发飙,争的是「规范属于项目还是属于模型厂商」;这一周协议层给出更根本的解法——不是争文件名,而是给每个 agent 一张可验证的身份证。身份不是合规装饰,它是多 agent 协作正确性的前提。当 agent 进团队聊天(Slack Code 8/20)、进生产环境,一个没有身份的 agent 就是个能调用工具、却无法审计、无法追责的幽灵。Anthropic 的研究说明:在共享环境里,没有身份约束的「聪明个体」会系统性地制造集体愚蠢。治理 Agent,先给它发身份证。
三、具身侧:无遥控、全自主、超长视野
软件侧在补「可移植」和「有身份」,具身侧这周补的是更硬的「能长时序交付」。
成都人形机器人创新中心 8/17 发布全球首个复杂语言指令集全自主(无遥控)超长视野任务执行系统,搭载该系统的「贡嘎一号」接到一条复杂指令后,全程自主、稳定地顺序完成三项子任务,无遥控、无摆拍。它的核心是把 Agent-MCP-Skills 分层认知决策体系与世界模型融合,建立「任务理解 → 资源调度 → 技能复用 → 物理感知与预测」的完整闭环——价值不在堆模型,而在建立了能在陌生环境跑完长任务的闭环。
北大 8/13 在乒乓球上打通了「全身移动 + 高自由度灵巧手」的统一「感知—决策—运动」闭环,解决了行业长期割裂的「能走不能精细操作」难题。而 8/19 世界机器人大会的风向已经从「炫技」转向「能干活 / 能交付 / 能成交」:小米全尺寸人形已在汽车工厂「上班」3 小时、安装成功率超 90%;宇树 G1 做全自主集群表演;星海图搞出全球首个机器人前置仓在线接单实景。
图 3 · 机器人评价从「站立 / 行走 / 抓取」(运动指标)切到「长时序自主决策 + 闭环恢复」。与 coding 的「完成率」同源,但物理世界不能 reset,所以更硬。
我的观点:机器人评价标准从「运动指标」切到「长时序自主决策 + 闭环恢复」,和 coding 侧 SWE Refactor Bench 的「完成率」是同一类迁移——都是「你做完了吗」取代「测试绿了吗」。但具身这条更难也更有含金量:物理世界不能 reset(呼应 8/24 的 reset 分水岭),所以「无遥控全自主超长视野」的含金量高于任何 SWE 跑分。这也是为什么今年运动会除两项障碍赛外全部要求完全自主——「量产版无改装夺冠」才是真本事,允许改装和遥控,sim2real gap 就被掩盖了。评价具身智能,看的是闭环恢复能力,不是单次成功率。
四、底座:环境层开源化,「环境即产品」从论文变标配
前三节讲的是「接口、身份、长时序」,它们的共同底座是「环境」。8 月 3 日微软开源的 Orchard 把这件事工程化了:Orchard Env 是一套跑在 Kubernetes 上的轻量隔离组件,可复用地做训练、评测、RL rollout,团队不必为每个模型重造沙箱。配套的 Orchard-SWE 把 SWE-bench Verified 从 61.4% 提到 73.0%——只用一个 4B 参数的价值模型做 rerank,就逼近了十倍大的前沿系统。它最反直觉的提法叫 「累积学习」:把训练轨迹当持久资产复用,而不是每次跑完就丢弃。
更早的 8/1,Cursor 自述了云 agent 部署的底层故事:投资不在模型、也不在提示词,而在环境——定制的 Dockerfile、简化的 build 抽象、一个叫 Cloud Doctor 的自愈自动化。结果 agent 从「大约每十个 merge 一个 PR」升到「过半」。环境,不是附属品,是产品本身。
图 4 · Orchard Env 把「环境」做成可复用开源组件;「累积学习」让训练轨迹成为持久资产。呼应 8/24 EnvHarness:环境即产品已从论文变成工程标配。
**我的观点:**这把 8/24 的 EnvHarness 论文和 8/25 的「闭环」彻底接上了:「环境即产品」已从学术共识变成工程标配。最关键的增量是 「累积学习」——它让 agent 的闭环不只是跑一次,而是把跑过的经验沉淀成可复用的价值模型。这正好回答了 8/25 的命题:谁掌握「模型+工具+数据+场景」谁赢;而数据里最被低估的一块,是 agent 自己跑出来的轨迹。轨迹复用,是 agent 从「每次从零学」走向「越用越聪明」的分水岭。
五、我的总观点:价值重心继续下沉
把四节串起来,会看到一个比 8/25 更底层的结论。
8/25 我说「谁掌握模型 + 工具 + 数据 + 场景,谁掌握下一个十年」。这周的信号把它往下推了一层:比「拥有闭环」更底层的是「定义闭环如何运行的接口与协议」。模型人人可换——GPT、Claude、Qwen、DeepSeek 同台竞技,聪明程度正在收敛;但插件标准、身份协议、可复位环境这些「中间层」,才是新的锁定点。Agent 变成 utility 的标志,正是这层中间层被行业共用。
| 层 | 8/25 说的是 | 8/27 补的是 |
|---|---|---|
| 模型 | 谁更聪明 | 聪明正在收敛,可随时替换 |
| 闭环 | 谁跑完 spec→code→test→PR | 闭环靠接口与协议定义 |
| 中间层 | (隐含) | 插件标准 + 身份协议 + 可复位环境 = 新锁定 |
2026 年 8 月,AI 行业最贵的不再是推理,而是三件「中间件」:① 一次编写、处处运行的插件标准;② 协议层给每个 agent 发的身份证;③ 可复位 / 可恢复的环境(软件可 reset,物理靠影子世界——见 8/24 RoboColiseum)。谁定义了这层中间层,谁就握住了「闭环」的钥匙。
六、给工程团队的行动清单
- **把技能当插件:**可复用的工具 / 技能打包成 Agent Plugins 1.0(
plugin.json+skills/+mcp.json),CI 里同时测 Copilot CLI 和 VS Code 安装,别锁死在单一客户端。 - **给 agent 发身份证:**进生产的 agent 必须配 per-session budget + approval log + 沙箱内存挂载;插件来源白名单,防供应链投毒。
- **长时序任务看闭环恢复:**具身 / 长任务用「闭环恢复能力」当验收,而非单次成功率;能用量产版无改装完赛才算数。
- **把环境当产品:**把 Dockerfile、build 抽象、自愈自动化当成一等公民投入,而不是只在模型上花钱。
- **把轨迹当资产:**评测从「测试绿」迁移到「完成率 + 可恢复性」,并沉淀训练 / 运行轨迹做累积学习。
结语:从玩具到基础设施,差的就是中间层
8 月 24 到 27 日这四篇,其实是一条递进的线:环境是闭环的输入侧(8/24),闭环是环境跑起来的结果(8/25),完成率是闭环价值的真实度量(8/26),而这一周我们看清了——让闭环可靠运转的,是接口、身份、环境这三层「中间层」。
一个一次性的聪明脚本,能写一段惊艳的代码,也能在演示里打一场漂亮的乒乓球;但它不能带着你的技能换客户端,不能在生产里被审计追责,不能在陌生物理世界里跑完一个长任务。当它补齐这三层,它就从一个玩具,变成了一座能交付的公用设施。AI 行业这个 8 月最值得记住的,不是又多了哪个更聪明的模型,而是我们终于开始认真修那座让模型「可靠地为人所用」的底座。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。