DeepSeek Harness:免费的车,收费的油
本文完全由 WorkBuddy 独立收集资料、调试代码并完成文章写作。
我是 Alex Xiang,前百度/微博工程师,现在专注于 AI 工程与工具产品。更多文章欢迎关注微信公众号「字与码」。
2026 年 8 月 13 日,DeepSeek 做了两件事。绝大多数报道把它们分开写了。
第一件是开源。Agent 框架 DeepSeek Harness 发布 v0.1 开发者预览,MIT 协议,命令行名 dsh;同一天,DeepSeek-V4-Pro-0813 正式可用。铺开的标题几乎一致——「开源版 Claude Code」。
第二件是涨价。同一天,DeepSeek 宣布 API 改为峰谷定价,8 月 16 日 16:00 UTC 生效。V4-Pro 的输出从原来单一档位,变成空闲时段每百万 token 1.98 美元、高峰时段 3.96 美元。第三方的拆解更不留情面:所谓「空闲半价」,分母是新价不是旧价——空闲档约为原输出价的 2.28 倍,高峰档约为 4.55 倍。措辞是打折,实质是提价。
一个免费的开源框架,配一次提价。看起来矛盾的两件事,其实是同一份商业计划书的正文和附件。
关于 dsh 怎么装、插件怎么挑、WSL 里怎么写代码,前面三篇已经拆完了。这篇不再列功能,只谈一个判断:dsh 真正的赌注,不是做一个更好的 Agent 框架,而是把 harness 这门生意主动做没了——然后在别的地方收租。那句被反复引用的「一切皆插件」,不是理想主义的口号,它是一份定价策略的架构表达。
「一切皆插件」的另一种读法:主动放弃主权
先看它的底座。dsh 建在一个叫 Cordis 的插件元框架上,背后是北大与 DeepSeek 合写的一篇论文《A Programming Paradigm for Spatiotemporal Composability》。工程上的结果很直接:这个系统没有特权内核。
模型适配器是插件,工具注册表是插件,沙箱是插件,会话存储是插件,调度是插件,Web UI 是插件——连 agent loop 本身,也就是那个「想一步、做一步、看一步」的核心循环,都是插件,就摆在默认配置的插件列表里。有人装完数过,默认配置载入 133 个插件,agent-loop 赫然在列。
多数 Agent 框架的做法是反过来:先写一个内核,再在内核上凿几个扩展点。dsh 是先立下「一切皆插件」这条第一性约束,再在这个前提下把 agent 拼出来。项目负责人崔添翼的说法是,这条原则在写第一行代码之前就定下了。
值得停下来想一想的是,这句话还有另一种读法——如果一个系统的每一个零件都声明为可替换,那就等于承认:没有一样东西是 DeepSeek 独有的。
模型适配器可替换,意味着你可以接 OpenAI、Anthropic、Moonshot、Z.ai,也可以接本地 Ollama;官方甚至提供了把 Claude Code 和 Codex 当作子代理拉起来的包。工具可替换,意味着能力边界不由 DeepSeek 划定。连 agent loop 都可替换,意味着「什么算一个 agent」这件事本身,可以被别人重写。
在软件史上,这条路有人走过。
微内核(Mach、L4)把内核拆到极小,理论上更优雅,学术上大获成功,商业上却被「打包者」吃掉——Windows NT 和 macOS X 都吸收了微内核思想,但用户买的从来不是内核,是完整体验。编译器同样如此:gcc 和 clang 免费、开源、质量极高,但几乎没有一家公司靠卖编译器赚到大钱,价值全部上移到了 IDE、平台和云。
harness 正在走进同一条河。一旦「可替换」成为默认设置,harness 本身就不再是护城河,而是一段公共设施。DeepSeek 用 MIT 协议开源它,等于把这件事明说了一遍。

免费的车,收费的油
那么,一家公司为什么会亲手把自己这一层的价值挤掉?
因为它打算在别处收钱。
先看一个被反复提起、但很少被深挖的数字:有实测显示,向 dsh 发一句最简单的「回复 PONG」,首次请求消耗了约 13,467 个输入 token。一句 PONG,一万三千个 token 的上下文。另一次清点显示,一次 npm install 拉了 531 个包、306MB。
这不是 dsh 的缺陷,这是所有 harness 的共同成本结构,业内叫 scaffolding tax——脚手架税。模型看到的东西里,真正的任务只占很小一块,其余全是系统提示、工具 schema、注入的仓库规则、skill 摘要。而模型看不见这些东西就干不了活。
关键推论在这里:插件装得越多,prompt 越厚;越彻底地「一切皆插件」,单位任务的 token 成本就越高。
把三件事串起来,商业逻辑就闭合了:
- harness 免费且开源 → 所有人都能上车;
- harness 越好用 → 单次任务越长、越自主、越少人工打断 → 烧掉的 token 越多;
- token 由谁卖 → DeepSeek。
这不是「开源帮别的模型做嫁衣」。恰恰相反:dsh 可以接别家模型,但会话的形状——system prompt 怎么拼、工具怎么描述、上下文怎么注入、轨迹怎么记——是 dsh 定的。谁定义了会话的形状,谁就定义了后面所有优化工作的靶子。而优化 token 的第一步,是先有 token 的账本。
免费的是度量衡,收费的是度量衡上跑的量。

峰谷定价被写成了打折
再看那次提价的形状。
新的价格不只是一个更高的数,而是一张按时段切分的时间表:北京时间 9:00–12:00 和 14:00–18:00 为高峰,其余为空闲,空闲价格是高峰的一半。V4-Flash 高峰输出每百万 token 9 元、空闲 4.5 元;V4-Pro 高峰 27 元、空闲 13.5 元。缓存命中的输入便宜到几乎可以忽略——V4-Flash 在空闲时段是每百万 token 5 分钱。
如果只把它读成「涨价」,会漏掉真正的动作:这是一次用价格调度工作负载的尝试。
Agent 的工作负载有个天然特征:它极其适合批处理。一个跑三小时的仓库重构、一次夜间全量巡检、一批离线数据清洗,这些任务对延迟不敏感,可以任意挪动。峰谷定价把这类任务从白天的高峰时段推开,去填满数据中心的谷。
换句话说,dsh 不只是把用户接进来,它还把 agent 变成了电网里可以调度的负载。按时间卖推理,本质上是把数据中心的利用率曲线,切成两半卖给两类客户:白天要交互的人付高峰价,夜里能等的人付空闲价。这套设计只有在 harness 已经普及、agent 负载形成规模之后才有意义——而这恰恰是 dsh 带来的东西。
一个更远的判断:按 token 计费只是过渡形态。
因为它奖励「话多」。模型把同一个问题绕三圈、多调十次工具、把大段内容重新读一遍,都是在给供应商创造收入。而用户真正想要的从来不是 token,是任务被完成。当一个 harness 能把轨迹记全、能验证结果,计价方式就有条件从「按消耗」切换到「按交付」——按任务完成数、按变更被采纳率、按人工节省的时间。
dsh 现在还是 token 计价,但它把 trajectory 完整记了下来。想改计价口径的时候,它手上已经有账本了。它只是先把接口留好了。

真正被记下来的东西,是轨迹
要理解 dsh 主动让出 harness 之后还剩下什么,得看它的会话设计。
dsh 把一个会话建模成一条只追加的、带类型的事件流。用户输入、模型输出、每一次工具调用与返回、子代理调度、上下文注入、token 统计,全部顺序落盘。核心不变量是「模型可见即已记录」——模型当时能看到的东西,事后一定可以从日志里重建出来。而且模型侧的消息历史是从这条日志派生的,不是另存一份可变的副本。
这条不变量看起来朴素,解决的是 Agent 调试里最难的那个问题。它不是你问「它为什么答错了」,而是你问「它当时到底看到了什么」。普通对话式 Agent 跑挂之后,你只能看到最终结果,中间发生了什么靠猜;dsh 里可以按来源拆开:这个结论来自哪个工具返回值、哪条规则被注入了、模型在哪一步做了错误假设。
但轨迹真正的价值,不在调试。
harness 一旦商品化,稀缺的就不再是 harness,而是它产出的证据流。
对 DeepSeek 自己,轨迹是评测台。把除模型以外的一切变量锁死——同样的工具、同样的沙箱、同样的循环策略——只换模型插件,跑同一份会话对比轨迹。dsh 自报的 Terminal-Bench 2.1 的 82.7 分,是在 Minimal 模式下测的,也就是把脚手架压到只剩持久 Bash 和字符串替换编辑器。这个数字别人可以复现,也可以挑战,因为它是在一个公开的台上测的。
对企业,轨迹是准入证。一个 agent 在夜里改了十四个文件、删了一个目录、跑了一次部署,第二天谁来解释?没有证据流的 agent,进不了任何一家有合规部门的公司。
对个人,轨迹是唯一能把「我上周那个 bug 是怎么被修好的」变成可检索资产的机制。
这里必须补一句多数介绍不会说的边界,也是我认为接下来最值得关注的地方:回放不等于重放副作用。
轨迹是证据流,不是交易账本。你可以把一段轨迹读出来、重建当时的上下文、比较不同策略;但你绝对不能拿一段轨迹去重新发一封邮件、重新部署一次、重新扣一次款。trace 和 side-effect ledger 之间那条线画在哪里——事务边界在哪、哪些动作必须具备幂等、哪些环节必须留人工确认——这是 agent 真正进入业务流程前要解决的下一个问题。
dsh 给了你记录的能力,没有给你归责的能力。而后者才是成交的最后一公里。
三个判断
harness 会像编译器一样商品化,胜负移向「按任务完成计价」
2026 年 8 月,一份 agent harness 排名把 Claude Code 排在第一。理由不是模型更强——排在前面的几个工具,跑的往往是同一批前沿模型。差别全在会话管理、子代理编排和「长任务中途出错时怎么收场」。
行业花了两年争论哪个模型赢,然后悄悄换了个战场。当 harness 免费化、可替换化之后,按 token 计费就成了过渡形态,因为它奖励话多。下一步是按任务完成计价,再下一步是按「变更被合并、被采纳、被复用的比例」计价。
dsh 在这个方向上做的准备,是把轨迹记全了。它先给自己留好了改计价口径的接口。
会出现「Agent 的 POSIX」,它比模型之争更持久
MCP 和 AGENTS.md 已经被比作 agent 世界的 HTTP 与 HTML。dsh 的一系列动作——做 Claude Code Mods 兼容层、把 Claude Code 和 Codex 当子代理拉起、支持四十多家 provider——净效果都是把互操作的面摊大。
这件事的意义容易被低估。开源一份会话格式,比开源一个模型的影响更远。模型会被下一代超越,但格式一旦成为默认,就会活很多年。真正在争的不是市场份额,是「agent 之间怎么对话」的语法由谁来写。
吞吐量悖论:瓶颈已经不在生成侧,在信任侧
有一个数据值得反复看:有报道引述 Linear 的遥测,coding agent 让团队的 PR 数量翻了三倍,但周期时间几乎没有变化——因为瓶颈卡在 review,不在生成。
也就是说,更好的 harness 提高了吞吐量,却没有提高速度。生成变快了,所以排队等待人类判断的队列变长了。
推论是:harness 的下一轮竞争,不在「让 agent 更能干」,而在「让人类更敢放行」。权限怎么声明、操作怎么回滚、行为怎么归责、什么时候优雅地停下来问一句——这些会成为比「再多一个工具」值钱得多的插件类别。
有意思的是,沙箱和审计几乎正好是 dsh 主动交出去的那两块:它们是插件,不是内核。这是它的机会,也是它的风险——机会在于谁都能补,风险在于谁都能补,补得最好的那个未必是 DeepSeek。

不拦人过桥,只做所有桥都要压的那层地基
回到 8 月 13 日。
那一天 DeepSeek 真正在卖的东西,不是框架,是「agent 该怎么记账」这件事的默认答案。它把 harness 做到免费、开源、可替换,主动放弃这一层的排他性,换来的是一件事:所有人构造 agent 的方式,都开始沿用它的形状。
免费的车谁都可以开,但油箱只有一家在卖。而下一次,当计价口径从 token 换成任务完成时,卖油的那家依然在,因为它从一开始就握着账本。
有人会问:如果别人也做一个开源 harness,这条路不就白走了吗?
恰恰相反。别人做得越多、越开放、越像 dsh,这套会话规范和轨迹格式就越可能落在 dsh 已经定义的那个形状上。这不是护城河的打法,是路基的打法——不拦人过桥,只做所有桥都要压的那层地基。
真正的风险不在竞争对手,在时间。developer preview 阶段每天都可能破坏性变更,生态里的插件作者已经在被官方内置能力吞掉(有插件作者因此直接停更)。地基要成立,得先让人相信它不会天天重浇。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。