技术热点透视20260831:账单日来了,但真正的护城河是 Harness
原创 · 约 10 分钟阅读 · 阅读 --

技术热点透视20260831:账单日来了,但真正的护城河是 Harness

作者: Alex Xiang


古董级程序员,前百度/微博工程师,现在关注 AI 工程化与开发者工具。
微信公众号「字与码」,记录技术思考与行业观察。
本文同步发布于 zicode.com

8 月 31 日,两件关于 AI coding 的事在同一天落地:一边是 Claude Sonnet 5 正式涨价、且分词器改动让代码类任务的 token 凭空多出一截;另一边,最新的 agent harness 榜单把 Claude Code 推上了长自主会话的第一名。把它们放在一起,一条比「谁模型更聪明」更冷的主线浮现出来——模型在变贵,而真正的护城河正在从「模型能力」滑向「harness(运行时外壳):会话管理、优雅失败、吞吐调度」。

一、账单日:Sonnet 5 今起涨价,而且是双重打击

从今天起,Claude Sonnet 5 的定价正式上调:输入从 $2/百万 token 涨到 $3,输出从 $10/百万 token 涨到 $15,涨幅约 50%。如果只看这张价目表,你会以为成本只多了五成。

但真正动手写过代码的都知道,更狠的一刀在分词器。Anthropic 同步做了一个 tokenizer 变更,对代码类内容会多产生 10%–35% 的 token。也就是说,同一段 Python、同一个 diff,今天喂给模型要比上周多花一截。

维度8 月 30 日及之前8 月 31 日起
输入价$2 / 百万 token$3 / 百万 token
输出价$10 / 百万 token$15 / 百万 token
代码 token 量基准 100%基准 110%–135%
有效成本1.0×约 1.65×–1.85×

把价格涨幅和 token 膨胀叠起来,一个重度依赖 Sonnet 5 跑 coding agent 的团队,有效成本实际上涨了大约 65%–85%,而不是账面上那 50%。同一天,GPT-5.4 / GPT-5.4 mini 退出 Codex、改走 ChatGPT 登录通道(API key 仍可走);Kimi-k2.5 与 moonshot-v1 退役,迁移到 kimi-k3。模型层的重新定价与迁移,在周一早晨同时砸向开发者。

01-price-shock 图 1 · 价格涨 50% 叠加代码 token 膨胀 10%–35%,coding 工作负载的有效成本实际上涨约 65%–85%。

**真正要警惕的,不是 Anthropic 涨价。**这是 agent 时代「算力税」的开始:当 coding agent 把一次需求拆成几十上百轮工具调用,token 消耗是指数级放大的,价格与分词器的任何风吹草动都会被杠杆放大。团队如果只看「每百万 token 单价」做预算,会严重低估真实账单。正确的看板应该盯住 「每个被合并的 diff 花了多少钱」,而不是「调了几次模型」。

二、同一天,Claude Code 登顶 harness 榜

涨价的新闻盖过了一另一条同样重要的线:8 月最新的 agent harness 排名里,Claude Code 在「长自主会话」维度排到了第一,领先 Codex CLI、Cursor、Gemini CLI 和 GitHub Copilot。评测看的不是「模型谁更强」,而是 hooks 的深度、subagents 的编排、动态工作流,以及——最关键的一条——「失败时的表现有多优雅」

榜单的微妙之处在这里:这几家跑的往往是同一个前沿模型,差异来自外壳(harness)本身。

Harness领先维度
Claude Code长自主会话、hooks 与 subagents 深度
Codex CLI云端 PR 型自主(pull-request-shaped autonomy)
Cursor编辑器内工作流
Gemini / Copilot补全前五,各有场景

结论很清楚:它们不是在抢同一份活。谁能把同一个模型用得更稳、跑得更长、挂得更体面,谁就赢。

02-harness-layer 图 2 · 同一前沿模型之下,差异来自 harness:会话管理、子代理编排、失败恢复,而非模型权重。

**模型人人可换,harness 才是黏性。**一个更好的 harness 能在「不提高单步速度」的前提下提高整体吞吐——Linear 上周的遥测数据就指向这一点:换更好的外壳后,单位时间交付的 diff 变多了,但模型推理没变快。对工程团队来说,这意味着把投资从「追新模型」挪一部分到「打磨自己的 agent 运行时」:上下文压缩、错误恢复、沙箱隔离、成本护栏。

三、为什么 harness 比模型更值钱

长自主会话的难点,从来不是「模型够不够聪明」,而是一个工程问题集合:

  • 上下文压缩:跑了几百轮后,怎么在不丢关键信息的前提下把历史压下去;
  • 子代理编排:什么时候 fork、什么时候 merge、怎么避免子树爆炸;
  • 失败恢复:工具调用挂了、测试红了,是重试、回滚还是换路径;
  • 成本护栏:到哪个额度强制停、哪些操作需要人工确认。

这些都不是模型权重能解决的。它们是运行时工程,是写一次、处处复用的中间层资产——正好对应我们上周聊的「Agent 变成 utility(公用设施)」那条线:插件标准、身份协议、可复位环境之后,harness 是最后、也最贴近用户的一层。

03-throughput-speed 图 3 · 更好的 harness 提高的是「吞吐」(单位时间交付量),而不是「单步速度」。

四、给工程团队的三条动作

把今天这两件事合起来,对正在把 coding agent 塞进生产环境的团队,有三条立刻能做的:

  1. KPI 从「调用量」换成「token-to-shipped-diff 效率」。让每一块钱的账单对应到一个真正进仓库的改动。
  2. 把 harness 当产品来投资。错误恢复、上下文压缩、沙箱隔离,这些才是你能掌控、且友商抄不走的部分。
  3. 模型保持可替换。Sonnet 5 会涨价、GPT-5.4 会退出 Codex,把链路设计成「模型可热插拔」,才不会在供应商一抖腿时跟着摔。

**一句话收束:**模型在变贵,这是趋势不是意外。但贵的那部分恰恰说明——价值正在从「模型智商」向「把模型安全、可观测、可追责地跑完一个长会话的能力」转移。下一次你评估一个 coding agent,别只问它接了哪个模型,要问它的 harness 能不能在半夜三点、网络抖动、测试全红的时候,还把活干完。

打开原图 ↗