技术热点透视20260831:账单日来了,但真正的护城河是 Harness
古董级程序员,前百度/微博工程师,现在关注 AI 工程化与开发者工具。
微信公众号「字与码」,记录技术思考与行业观察。
本文同步发布于 zicode.com
8 月 31 日,两件关于 AI coding 的事在同一天落地:一边是 Claude Sonnet 5 正式涨价、且分词器改动让代码类任务的 token 凭空多出一截;另一边,最新的 agent harness 榜单把 Claude Code 推上了长自主会话的第一名。把它们放在一起,一条比「谁模型更聪明」更冷的主线浮现出来——模型在变贵,而真正的护城河正在从「模型能力」滑向「harness(运行时外壳):会话管理、优雅失败、吞吐调度」。
一、账单日:Sonnet 5 今起涨价,而且是双重打击
从今天起,Claude Sonnet 5 的定价正式上调:输入从 $2/百万 token 涨到 $3,输出从 $10/百万 token 涨到 $15,涨幅约 50%。如果只看这张价目表,你会以为成本只多了五成。
但真正动手写过代码的都知道,更狠的一刀在分词器。Anthropic 同步做了一个 tokenizer 变更,对代码类内容会多产生 10%–35% 的 token。也就是说,同一段 Python、同一个 diff,今天喂给模型要比上周多花一截。
| 维度 | 8 月 30 日及之前 | 8 月 31 日起 |
|---|---|---|
| 输入价 | $2 / 百万 token | $3 / 百万 token |
| 输出价 | $10 / 百万 token | $15 / 百万 token |
| 代码 token 量 | 基准 100% | 基准 110%–135% |
| 有效成本 | 1.0× | 约 1.65×–1.85× |
把价格涨幅和 token 膨胀叠起来,一个重度依赖 Sonnet 5 跑 coding agent 的团队,有效成本实际上涨了大约 65%–85%,而不是账面上那 50%。同一天,GPT-5.4 / GPT-5.4 mini 退出 Codex、改走 ChatGPT 登录通道(API key 仍可走);Kimi-k2.5 与 moonshot-v1 退役,迁移到 kimi-k3。模型层的重新定价与迁移,在周一早晨同时砸向开发者。
图 1 · 价格涨 50% 叠加代码 token 膨胀 10%–35%,coding 工作负载的有效成本实际上涨约 65%–85%。
**真正要警惕的,不是 Anthropic 涨价。**这是 agent 时代「算力税」的开始:当 coding agent 把一次需求拆成几十上百轮工具调用,token 消耗是指数级放大的,价格与分词器的任何风吹草动都会被杠杆放大。团队如果只看「每百万 token 单价」做预算,会严重低估真实账单。正确的看板应该盯住 「每个被合并的 diff 花了多少钱」,而不是「调了几次模型」。
二、同一天,Claude Code 登顶 harness 榜
涨价的新闻盖过了一另一条同样重要的线:8 月最新的 agent harness 排名里,Claude Code 在「长自主会话」维度排到了第一,领先 Codex CLI、Cursor、Gemini CLI 和 GitHub Copilot。评测看的不是「模型谁更强」,而是 hooks 的深度、subagents 的编排、动态工作流,以及——最关键的一条——「失败时的表现有多优雅」。
榜单的微妙之处在这里:这几家跑的往往是同一个前沿模型,差异来自外壳(harness)本身。
| Harness | 领先维度 |
|---|---|
| Claude Code | 长自主会话、hooks 与 subagents 深度 |
| Codex CLI | 云端 PR 型自主(pull-request-shaped autonomy) |
| Cursor | 编辑器内工作流 |
| Gemini / Copilot | 补全前五,各有场景 |
结论很清楚:它们不是在抢同一份活。谁能把同一个模型用得更稳、跑得更长、挂得更体面,谁就赢。
图 2 · 同一前沿模型之下,差异来自 harness:会话管理、子代理编排、失败恢复,而非模型权重。
**模型人人可换,harness 才是黏性。**一个更好的 harness 能在「不提高单步速度」的前提下提高整体吞吐——Linear 上周的遥测数据就指向这一点:换更好的外壳后,单位时间交付的 diff 变多了,但模型推理没变快。对工程团队来说,这意味着把投资从「追新模型」挪一部分到「打磨自己的 agent 运行时」:上下文压缩、错误恢复、沙箱隔离、成本护栏。
三、为什么 harness 比模型更值钱
长自主会话的难点,从来不是「模型够不够聪明」,而是一个工程问题集合:
- 上下文压缩:跑了几百轮后,怎么在不丢关键信息的前提下把历史压下去;
- 子代理编排:什么时候 fork、什么时候 merge、怎么避免子树爆炸;
- 失败恢复:工具调用挂了、测试红了,是重试、回滚还是换路径;
- 成本护栏:到哪个额度强制停、哪些操作需要人工确认。
这些都不是模型权重能解决的。它们是运行时工程,是写一次、处处复用的中间层资产——正好对应我们上周聊的「Agent 变成 utility(公用设施)」那条线:插件标准、身份协议、可复位环境之后,harness 是最后、也最贴近用户的一层。
图 3 · 更好的 harness 提高的是「吞吐」(单位时间交付量),而不是「单步速度」。
四、给工程团队的三条动作
把今天这两件事合起来,对正在把 coding agent 塞进生产环境的团队,有三条立刻能做的:
- KPI 从「调用量」换成「token-to-shipped-diff 效率」。让每一块钱的账单对应到一个真正进仓库的改动。
- 把 harness 当产品来投资。错误恢复、上下文压缩、沙箱隔离,这些才是你能掌控、且友商抄不走的部分。
- 模型保持可替换。Sonnet 5 会涨价、GPT-5.4 会退出 Codex,把链路设计成「模型可热插拔」,才不会在供应商一抖腿时跟着摔。
**一句话收束:**模型在变贵,这是趋势不是意外。但贵的那部分恰恰说明——价值正在从「模型智商」向「把模型安全、可观测、可追责地跑完一个长会话的能力」转移。下一次你评估一个 coding agent,别只问它接了哪个模型,要问它的 harness 能不能在半夜三点、网络抖动、测试全红的时候,还把活干完。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。