技术热点透视20260905:模型厂不再只卖模型,开始亲手做 Coding Agent
古董级程序员,前百度/微博工程师,现在关注 AI 工程化与开发者工具。
微信公众号「字与码」,记录技术思考与行业观察。
本文同步发布于 zicode.com
GPT-6 Astra 在 9 月 3 日发布、9 月 4-5 日放量到 ChatGPT Work / Codex / API 之后,真正值得记下的不是「又出了个更强的模型」,而是它直接「装机」进了 coding agent 的 harness:Codex 跨窗口持久记忆、给写 PR 的 agent 加语音对话、Cognition 把 Astra 塞进 Devin 在 FrontierCode 上逼近 Fable 5 而成本低 64%。同一天 Claude Code 周限额重置。模型厂不再满足于卖 API,开始亲自把模型做成「会写代码的 agent」——coding agent 的护城河,正在从「谁的模型强」挪到「谁的 harness 强」。
一、Astra 不是发布,是直接「装机」进 coding agent
9 月 3 日 OpenAI 发布 GPT-6 Astra:105 万 token 上下文、12.8 万 token 输出、Computer Use 代际跃迁(OSWorld 2.0 从 65.7% 升到 72.6%、耗时降约 47%),并被列为「关键级(Critical)」网络安全能力。9 月 4-5 日它放量到 ChatGPT Work、Codex 与 API 的 Pro / Enterprise / Business Premium 用户,Plus 与 Business 分批推送。这些数字本身不算新闻——真正的变化发生在 harness 层,也就是「把模型变成能干活的程序员」那一层。
三个动作拼起来看,信号很清晰:
- Codex compaction:记忆跨窗口持久化。 Astra 的 Codex 压缩机制能把「工作笔记」保留到上下文窗口之外,让更早的窗口(包括消息和工具调用)变得可搜索。这恰是我们在 9 月 2 日聊过的「给 agent 装外部记忆」的产品化落地——长任务不再因为上下文被截断而丢失背景。
- Codex 线程加语音。 开发者现在能直接和「写了那个 PR 的同一个 agent」对话:聊架构、聊实现、聊下一步,谈完把工作交回自主执行。人机的来回成本又降了一截。
- Cognition 把 Astra 塞进 Devin。 在 FrontierCode 1.1 上,Astra 距 Fable 5 仅 0.4 分,成本却低 64%,并在其内部基准刷出新 SOTA、报告更完整。
同一天 Anthropic 重置了 Claude Max 的周限额。 一家把最强模型推进自己的 coding agent(Codex + Astra),一家重置额度鼓励继续用 Claude Code 构建——这不是巧合,是「模型厂 vs 模型厂」在 coding agent 这条主战场上的贴身对攻。上一期我们聊了「黑色星期四」的可用性课,这一期要聊的是:战场本身换了——从「谁的模型强」变成了「谁把模型做成了能交付的 agent」。
二、护城河从「模型强」挪到「harness 强」
过去一年 coding agent 的竞争叙事,本质是谁「接模型接得好」:Cursor、Claude Code、Codex、Windsurf,外层是工具壳,内核是 frontier 模型。但 2026 年下半年,frontier lab 自己下场了——Codex 是 OpenAI 的,Claude Code 是 Anthropic 的,Astra 又直接进了 Devin。当模型厂既卖模型又卖 harness,独立工具商的「壳」就悬了。
图 1 · coding agent 正在裂成两层:底层是少数 frontier 模型,上层是把模型接成稳定工作流的 harness / 编排层。模型智商只是入场券,真正难复制的是上层。
所谓 harness,指的是一套让模型能稳定产出代码的能力组合:上下文与记忆管理(compaction、跨窗口检索)、工具调用的编排、模型路由、护栏与权限、可观测与评估。注意 Astra 这次补的恰恰都是 harness——compaction 持久笔记、voice 协作、异步工具调用带 steering——而不是单纯的「模型更聪明」。模型智商已经成了入场券,真正的壁垒在它之外。
**我的判断很直接:**2026 下半年 coding agent 会清晰地分成两层——底层是少数几家 frontier 模型(OpenAI / Anthropic / Google / Meta),上层是把模型接成稳定、可交付工作流的 harness / 编排层。决定一家 coding 工具生死的,不再是「它接了哪个最强模型」,而是「它的 harness 有多不可替代」。模型层的同质化会加速,harness 层的差异化才是护城河。
三、成本曲线正在改写「谁赢」:智能溢价被路由摊薄
看价格会更清醒。Astra 的单价是前代 GPT-5.6 Sol 的 2.5 倍(输入 $10 / 百万 token、输出 $50 / 百万 token),知识截止 2026 年 4 月。但同一份 Astra,在 Devin 里比 Fable 5 便宜 64%;另一边,GitHub Copilot 的 HydraFusion 用「多模型编排」宣称同等质量下成本最高降 67%。两个数字指向同一件事——单模型「更聪明」的溢价,正在被「编排 / 路由 / 记忆」摊薄。
图 2 · 剪刀差:单模型单价在涨(Astra ×2.5),但编排 / 路由把「每任务成本」往下拉(Devin −64%、HydraFusion −67%)。开发者最终买单的是后者。
Cursor 刚发的 Insights 报告给了另一个侧面:以今年 1 月第一周为 100 基线,每位开发者的 AI 编辑量近 3 倍增长,而最活跃的 10% 用户烧掉了过去四周约三分之二的 token。token 消耗极度不对称,是真实的成本焦虑,不是账面数字。换句话说,买方市场正在从「谁的榜单分数高」转向「谁的每个任务性价比高」。
这会重塑采购逻辑。 当「更聪明的模型」贵 2.5 倍,而「编排多个模型」能便宜 67%,团队自然会用路由把简单活派给便宜模型、难活才上贵模型。会省钱,比会堆最贵模型更重要。这也意味着:模型厂想靠「单次调用更贵」回收训练成本,会被编排层一点点吃掉利润——除非它自己掌握编排层,而这正是 Astra + Codex 在做的事。
四、对独立工具商的警报:既当模型厂,又当工具商
9 月 3 日那篇「模型战」里埋过伏笔:OpenAI 通知终止向 Cursor 提供模型(SpaceX 收购 Anysphere 触发的变更控制条款,被指违反 xAI / X 相关协议)。当时 Cursor 仅约 5% 流量依赖 OpenAI、Anthropic 随即加码,看似影响不大。但结合这一期——OpenAI 把 Astra 直接做成 Codex agent,等于既当模型厂又当工具商——含义就变了:独立 coding 工具商被夹在中间。
出路不在「再找个模型接」,而在「把 harness 做出不可替代性」:多模型路由(不绑定单一 provider)、私有化与数据边界、企业合规、领域适配、把评估 / 可观测做成产品。反过来,HydraFusion 那套「编排多模型」的思路,正是独立工具商该学的活法——不赌某家模型常青,用编排换成本与质量。谁还停留在「某个 frontier 模型的壳」,谁的议价权就在流失。
**一句话点破:**模型厂向下做 agent,工具商向上做 harness,中间被挤压的,是「纯壳」。Cursor 们的下一场仗,不是「接不接得到 Astra」,而是「用户为什么不直接用 Codex」。
五、给团队与开发者:把 coding agent 当生产依赖,而非玩具
把这一期和上一期的「黑色星期四」连起来看,对正在把 coding agent 塞进生产环境的团队,有三条现在就能落地的判断:
- 多供应商路由 + 本地兜底,先设计再上线。 模型厂会宕机(9/3 已验证),也会临时改供货条款(9/3 已验证)。coding 流水线要有自动切换:OpenAI 挂了能切 Anthropic 或开源模型,关键路径要有自托管兜底。
- 看 harness 成熟度,比追新模型更影响日常产出。 记忆 / 上下文管理、可观测、护栏,这些「看不见」的能力决定你每天能不能稳定交付。Astra 的 compaction、voice、Devin 的 SOTA,全是 harness 层面的功夫。
- 把成本变成可观测指标。 token 消耗、单任务成本进 dashboard,选模型看「每任务性价比」而不是发布会热度。头部 10% 用户烧掉 2/3 token 的事实提醒我们:不度量,就会被账单教育。
六、其他动态(9 月 4-5 日)
政策工信部发布《人工智能中小企业创业支持计划(2026—2028)》。 三年新培育科技 / 创新型中小企业 1 万家以上,明确支持「一人公司」、超级个体与智能体开发者依托智能工具创新创业,配套普惠算力与开放行业数据集。产品阿里千问办公上线首月用户破 3000 万。 企业用户占比过半并推出国际版;长安汽车接入后,线束参数计算从两天缩至 5 分钟,AI 工具日均活跃率超 50%。平台GitHub Copilot HydraFusion 多模型编排上线。 计划 / 编写 / 批评 / 完成由不同模型分担,宣称同等质量下成本最高降 67%,把「模型路由 > 模型选型」做成产品。企业中国核电「知了」智能体平台发布。 从 235 个申报场景遴选出 30 个优秀场景,一线人员自己动手把想法直接变成智能应用,主打全员全场景 AI 工作助手。具身IFA 2026 柏林开幕,机器人「到家」元年。 小米 CyberOne 海外首秀,追觅 / 科沃斯 / 石头集中展示具身服务机器人;同日广东「十骏」人形机器人在中博会组团亮相,银河通用「小盖」赴港三店全自主打工。具身中国经营报:上半年人形机器人出货破 2.2 万台。 同比近 300%,但智能制造占比仅 13%、真正「干活」不足两成,物流分拣 / 零售等有限场景才跑通商业闭环。生产生产环境 agent 跑出可数结果。 Shopify 的 River 11 天把未修复漏洞积压降约 70%;Next.js 的 closability agent 一个月关掉 1500 个 issue,把「修 issue」交给 agent、把「关不关」留给维护者。模型Meta Muse Code 正式版上线。 多 agent 工作流 + 跨会话状态共享 + 开发者 SDK;吴恩达同日发布 AI Engineering Skills Map,梳理有效使用 coding agents 的核心技能。
**一句话收束:**GPT-6 Astra 这一期最该被记下的,不是「又强了」,而是它直接装机进 coding agent 的 harness——模型厂从卖 API 变成亲手做「会写代码的 agent」。coding agent 的护城河正在从「模型强」挪到「harness 强」:上下文记忆、工具编排、路由、护栏、可观测才是难复制的部分;而成本曲线上,单模型单价在涨、编排却把每任务成本往下拉,开发者最终为「性价比」而非「榜单」买单。对独立工具商,这是「既当模型厂又当工具商」的 squeeze;对团队,继续把 coding agent 当生产依赖来设计——多供应商路由、本地兜底、成本可观测。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。