技术热点透视20260921:OpenAI 把 Agent 的「地基」焊成了公共品
原创 · 约 17 分钟阅读 · 阅读 --

技术热点透视20260921:OpenAI 把 Agent 的「地基」焊成了公共品

作者: Alex Xiang


本文完全由 WorkBuddy 独立收集资料、调试代码并完成文章写作。

扫码注册 WorkBuddy 即可获取 2000 积分

我是 Alex Xiang,前百度/微博工程师,现在专注于 AI 工程与工具产品。更多文章欢迎关注微信公众号「字与码」。

今天 OpenAI 把 Agents API 推到了 public beta。表面看,这是「又一个 API 开放」;往里看,这是把驱动 Codex 与 ChatGPT 的那套 agent 基础设施——harness——从内部工程资产,变成了一次调用就能租用的公共品。

而被大多数人忽略的事实是:过去两年真正卡住 agent 落地的,从来不是模型不够聪明,而是「怎么让它跑三个小时不崩」。

一次调用,装出一台生产 agent

按官方描述,创建一个生产可用的云 agent 只需要一次 API 调用,你填四样东西:task、model、tools、environment。剩下的它负责跑起来。

关键在于,这不是包了一层的 SDK,而是基于开源的 Codex harness 构建。所谓 harness,是那层协调模型调用、工具调度、上下文流转的核心控制逻辑——它是 agent 的骨架,也是过去一年多里各家 agent 产品真正分出高下的地方。OpenAI 把这层的源码开放出来供检视,同时自己承担运维,并随每次模型发布持续升级,开发者拿到的是一个「版本化」的能力,而不是一份需要自己长期维护的 fork。

这句话的分量,亲手做过的人最清楚:模型每半年换一代,你的 harness 就要跟着大改一轮,这属于纯消耗、不出差异化的消耗。

一次 API 调用,把 Codex 的开源 harness、持久会话、工具并行、子代理与托管沙箱焊成可租用能力

持久会话、自动压缩、子代理:三个被低估的工程细节

能力清单里最容易被划过去的,是「持久会话」:agent 可以连续工作数小时,跨多轮、跨多个上下文窗口。支撑它的是第二件事——自动上下文管理,会话逼近上限时自动 compact 早期上下文,只保留继续所需的信息,开发者不必自己实现压缩逻辑。

这两条加起来,等于把「长任务工程」里最脏最累的活收走了。凡是自己写过 agent 循环的人都经历过那个时刻:任务跑到第四十轮,上下文快满,你是截断、摘要,还是外挂记忆库?每个选择都掉精度,每种实现都是一次没有标准答案的调参。现在这件事变成了平台的默认行为。

第三件事是工具的经济性。Tool search 按需加载相关工具定义,把 schema 的 token 开销压下去,同时保留缓存;programmatic tool calling 支持并行调用、链式操作,以及在代码里直接过滤、合并结果——中间结果不必全都绕回模型上下文里走一趟。底层支持 MCP、自定义函数与内置 web search,这意味着你已有的那套工具抽象不用推倒重来。

再往上是子代理:复杂任务被拆成独立片段并行委派,每个子代理各持上下文,主代理只负责协调与汇总。客户 Ciridae 的 CTO 给出的数字是延迟下降约 4 倍。这个数字要打折看,但它指向的方向很清楚——从「一个 agent 想很久」,转向「一群 agent 各干一段」。

我的判断是:这四条能力里,真正构成壁垒的不是听上去最酷的子代理,而是 compact 加 durable session 这套组合。炫技式的编排谁都能写,能把上下文生命周期管到不出血,是模型侧与运维侧长期磨合出来的东西。

沙箱二选一:它替你运维,还是落进你自己的 VPC

执行环境给了两条路。

一是 OpenAI 托管沙箱,直接复用驱动 Codex 与 ChatGPT 的同一套基础设施,OpenAI 替你开通与运维,你挂载自己的文件、包、skills、plugins。二是合作方环境,名单很长:Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel。可以全托管,也可以部署在你自己的 VPC 内,并且按不同 CPU/GPU/内存配置与冷启动、成本档位做区分。

这个分层设计其实很聪明,因为它同时承认了两件事:大部分团队只想赶紧跑起来;而真正有钱、有合规压力的客户,一定要东西落在自己网里。它没有假装一个方案能通吃。

「不收基础设施费」这句话,要读两遍

官方口径是不为使用 Agents API 收取额外的基础设施费用,只按 agent 实际消耗的 token 与工具用量付费。

听起来像白送一台运行时。但把它翻译成账单语言就是:你的成本上限不再由架构决定,而由 agent 的行为决定。传统服务你能估 QPS、估机器数;agent 不一样——一个卡在循环里自我重试的持久会话,可以安安静静烧掉几个小时推理。上下文压缩省了 token,子代理并行又把并发量抬上去,两头都是变量。

这不是说它贵,而是说成本曲线从一个可预测的阶梯,变成了一根和行为绑定的斜线。做预算和做增长的人,都得重新学一遍。

护城河正在从模型移向 harness

把这条新闻放回本月的时间线里,结论几乎不需要推理:

9/10 Codex harness 被托管为 Agents API;9/11 Cognition 发 SWE-2,Kimi K3 底座、成本约低 64%,9/14 估值到 480 亿美元;9/15 Google 把编程 agent Antigravity 折进 Gemini API,做成免费的 Managed Agent;9/16 Factory 估值升至 50 亿美元,叙事升级为「软件工厂」;9/17 Google Home 推 Developer MCP,把家庭设备向 agent 开放。

一周之内,模型厂、agent 厂、云厂、平台厂,全在做同一件事:把「谁来跑」和「怎么编排」变成自己的地盘。今天这次开放的实质,是模型厂兼做基础设施。护城河从「模型强」转向「harness 强 + 后训练 RL + 数据飞轮 + 成本曲线 + 编排」,这已经是本年度最清晰的一条主线。

护城河从「模型强」滑向「harness 强 + 后训练 RL + 数据飞轮 + 成本曲线 + 编排」

对独立工具商来说,这里有个不太舒服的推论:当 harness 变成一次 API 调用,原本靠「我帮你把 agent 跑稳」吃饭的那一层,会迅速被渠道化。剩下能站住的,要么是极度垂直的场景与数据,要么是执行环境本身——这也解释了沙箱合作方名单里为什么清一色是做 runtime 的公司。

开源 harness 是一步狠棋

很多人看到「开源」二字会以为这是慷慨。我不这么看。

OpenAI 敢把协调模型、工具、上下文的核心逻辑摊开,是因为源代码从来不是这层竞争的胜负手——运维能力、随模型迭代的升级节奏、以及接口的事实标准才是。开放源码换来三样东西:开发者愿意检视并建立信任、生态围绕这套抽象写工具与插件、以及「agent 该怎么被定义」这件事的默认答案由它来写。

这是典型的用开放换标准主导权。等到大家的 task / model / tools / environment 四元组都按它的形状来设计,切换成本就不再来自代码不可见,而来自心智模型已经被养成

代价它也不是没有:源码公开,等于让同行把这条路看得清清楚楚。但在现阶段,标准的身位远比独家实现值钱。

冷静边界:小字里有三件事

第一,锁定的形态变了。以前锁定你的是私有协议,现在锁你的是「省心」——沙箱、压缩策略、子代理调度、工具加载全被托管,未来迁移时你要重建的不是接口,而是行为。托管沙箱的出口(egress)与数据驻留怎么算,合作方环境里哪几家真能覆盖你的合规要求,这些必须在采用前谈清楚,而不是上线后补课。

第二,成本不确定。持久会话与子代理让「任务时长」成为一个新变量,而这个变量由 agent 自己决定,你只能事后看账单。

第三,这是 beta。公开测试版意味着没有一份可以拿去让老板签字的 SLA。把它用在内部工具和探索性负载上非常合适;直接塞进核心交易链路,现在还不是时候。

用 Long Lake 的 CTO Rasmus Wissmann 的话说:「Agents API 提供 harness;环境、上下文和 UX 仍然归我们。有了我们的 AI 平台 Nexus,我们现在能在多个行业里几个小时内把 agent 立起来。」前半段是赞美,后半段才是重点——省下的是搭建时间,留下的是你的产品责任

收束

这件事真正值得记住的不是某个功能,而是它承认了一个事实:让 agent 跑得久、跑得稳、跑得并行,是一道所有团队都要重复缴纳的工程税。OpenAI 选择把它收上来,集中成平台能力,再用一次调用卖给你。

对大多数团队来说,这几乎肯定是划算的——你的差异化本来就不该建在上下文压缩算法上。但要清醒的是:当你把地基焊进别人的平台,你换来的是速度,抵押的是议价权。这一周所有大厂的密集动作,本质上是在争同一件东西——下一代软件的地基,归谁浇筑。

其他动态

Anthropic 发布 MCP 2.1。9/20 推出的新版本引入流式上下文更新(streaming context),让大模型与工具之间的上下文同步延迟下降约 75%,长链路工具调用更跟手。这是 MCP 协议继 2024 年开源后第一次在「状态同步」层做结构性升级。

华为开放 Ascend agent 技术栈。9/21 在 openEuler 生态内推出 ThinkPro(agent 执行、状态与演化的「原子单元」)与 Agentic Cloud,配套约 1 万 NPU 共享集群与「100 NPU·小时」开发者计划,并放出 5000+ 通用、1000+ 行业 MCP 资产。这是国产算力侧把 agent 基础设施向下沉到硬件与 OS 层的动作。

Faraday Future 发布 9 款 EAI 机器人。贾跃亭旗下的 Faraday X 于 9/19–20 展出 9 款「一脑多形」EAI 机器人(同一大脑驱动不同形态本体),售价区间 9990 至 137900 美元,把具身智能的叙事从「demo」推向「货架」。

智身科技 GENISOM 完成数亿元 B 轮融资。9/20–21 披露,其具身智能产品累计量产已突破 15000 台,是本周国内具身赛道少有的「量产 + 融资」双线进展。

《人工智能安全治理框架 3.0》发布。9/21 国家网络安全宣传周期间发布,相较 2.0 进一步细化了生成式 AI 与 agent 应用的安全要求,是今年 AI 治理侧最重要的框架性文件之一。

腾讯 WorkBuddy 居智能体双榜第一。沙利文、IDC、Omdia 三方报告均将 WorkBuddy 列为智能体平台与 AI 编程双赛道第一,国产 agent 产品在主流评测里开始占据头部位置。

打开原图 ↗