Agent 的胜负手,已经不在模型里
古董级程序员,从大厂到创业公司,现在还在一线做 AI 相关开发。微信公众号「字与码」会继续更新工程实践、新技术判断,以及这些年踩过的坑。文章若对你有用,欢迎顺手关注。
一、同一天,五条新闻,同一个真相
2026 年 8 月 19-21 日,72 小时内我数到 五条重要更新,分属完全不同的领域,但读完之后脑子里冒出的第一个念头是:
这一轮 AI 的胜负手,已经从「谁的模型更聪明」转移到「谁的 Harness 更好用」。
| 时间 | 事件 | 领域 |
|---|---|---|
| 08-19 | 2026 世界机器人大会开幕,天工 Omni 首秀、Pelican-VL 2.0 商用 | 具身智能 |
| 08-20 | Slack 发布 Slack Code,把 Claude / Devin 装进项目频道 | AI 编程 |
| 08-20 | 阿里发布 Qwen-UI-Agent,27B 主力模型 5 个 GUI 榜单 #1 | 数字 Agent |
| 08-20 | 北京人形发布 Pelican-Unify 大一统具身模型 + 天工 Omni | 具身智能 |
| 08-21 | 腾讯技术工程复盘:Multi-Agent 工作流 token 成本 降 50%-65% | AI 编程 |
| 08-21 | DeepSeek Harness (DSH) 8 天 2600+ 插件仓库,OpenViking 三层加载减 91% token | Agent 基建 |
如果你只看标题,会以为这是 5 个互不相关的新闻。但如果你真的把这些事连起来看,会发现一个非常清晰的信号——所有人都在抢 Harness。
二、先把概念对齐:什么是 Harness?
「Harness」这个词源自马车,意思是把马的力气挂到车上。Databricks 在 2026 年把它变成了 AI 工程的标准公式:
Agent = Model + Harness
其中 Harness 包含四件东西:
- Tools 工具:Bash、Read、Write、MCP、GUI、CLI —— 模型「伸出去的手」
- Environment 环境:沙箱、真机、Slack 频道、浏览器 —— 任务跑得动的「场地」
- Hard Controls:审批、沙箱权限、审计日志、限额 —— 模型「不能做什么」
- Soft Controls:系统提示词、计划、记忆、反思 —— 模型「推荐怎么想」

图 1:把 Harness 拆开看,2026 的工程共识其实就这么简单
一个反直觉的数据:Pi-coding 的 Agent 系统提示词只需要 ~200 token,而 Claude Code 优化前一度要用 ~10 000 token,相差 50 倍。同样一个模型,跑在不同的 Harness 上,token 成本、能力、稳定性可以差出一个数量级。这就是 2026 年工程团队真正的较量场。
三、战场一:AI Coding —— Slack Code 把 Harness 开到「人」那一层
3.1 发生了什么
8 月 20 日,Slack 上线 Slack Code。逻辑很简单:把 Claude Code / Devin / Copilot / Vercel Agent 这些 Coding Agent 装进「项目专属频道」,所有人围观、提反馈、审批。频道自带 HTML 实时预览,Agent 每一步可被暂停 / 改向 / 停止;任务完成后频道自归档,整段审计日志留下。
Rob Seaman(Slack 临时 CEO)原话:“One of the things I love about this is that code is no longer the bottleneck. The real constraints now lie in human judgment and creativity.”
3.2 我看到的「Harness 三件套」
把 Slack Code 套到上面那张图里:
| Harness 组件 | Slack Code 的实现 |
|---|---|
| Tools | Claude Code / Devin / Copilot 等(外包) |
| Environment | 项目频道(人类 + Agent 同处) |
| Hard Controls | 「改 prod 需专家审批」+ 频道自归档审计 |
| Soft Controls | 人类实时反馈 / 改向 |
3.3 为什么这步比模型升级更关键
Cognition 内部数据:合并 PR 数量 10x 增长,但人员只增加 40%。Slack 把 Coding Agent 从「单兵工具」变成「团队一员」,信任和审计问题被 Harness 层解掉——这才是企业真正敢大规模用 AI 写代码的开关。
我的判断:2026 下半年,Coding Agent 的竞争会从「谁的模型写代码更准」转向「谁先把人 / 团队 / 审批接进来」。Copilot Autopilot GA(per-agent 计费)、GitHub SLSA L3 自动认证、Cursor Teams,全是这个方向。
四、战场二:Digital Agent —— 27B 的 Qwen-UI-Agent 凭什么超过 GPT-5.6?
4.1 发生了什么
8 月 20 日,阿里千问发布 Qwen-UI-Agent,GUI 图形界面 Agent 基座模型。覆盖手机、PC 网页、深度搜索环境,主力版本 27B 参数。在 6 个核心 GUI 基准里 5 个第一,超过 GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro:
| 基准 | Qwen-UI-Agent | 次席 |
|---|---|---|
| MobileWorld | 82.1% | — |
| MobileWorld-Real(真机) | 92.2% | — |
| AndroidDaily | 97.5% | — |
| OSWorld-Verified(PC) | 79.5% | — |
| WebArena | 73.6% | — |
| ScreenSpot-Pro | 81.5% | — |
4.2 关键不是 27B,是 Harness 的「环境」
看技术报告很容易漏掉的一句话:「搭建了覆盖 100+ 台真实手机、150+ 应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,上万并发环境用于训练迭代」。
这意味着:模型权重只占 30%,剩下 70% 是真机环境 + 数据飞轮 + 在线 RLHF。换句话说,Qwen 真正的护城河不是 27B 的权重,而是 100 台真机 + 150 个 App 留下的真实轨迹数据。这个东西开源抄不走——资本可以复制(买硬件),但数据留在你的环境里。
4.3 27B 凭什么赢 200B+?
我的判断:对于 GUI 这种 闭环 / 强反馈 / 状态可枚举 的任务,环境规模的边际收益已经超过模型规模。小模型 + 大环境 = 大模型 + 小环境。这对整个 Agent 行业是一个重要信号:押注 Harness 押注环境,比单纯堆参数回报更高。
延伸观察:这跟 Cursor 5 月的策略变化呼应——Cursor 之前比模型,现在比 IDE 集成深度和索引能力。和 DSH 插件生态里
open-design89k Star 这种「设计 Agent Harness」也是同一个故事。把 Harness 当产品做,把模型当 API 调用。
五、战场三:具身智能 —— Pelican-Unify 反方向走,把 Harness 内化到模型里
5.1 发生了什么
8 月 20 日,北京人形机器人创新中心发布 Pelican-Unify,同时亮相轻量人形机器人 天工 Omni。Pelican-Unify 把三件过去分开的事合并了:
- VLM 视觉语言(看得懂)
- Action Model 动作控制(做得到)
- WFM 世界模型(预演未来)
技术路线从「模块化」→「端到端」。鞠笑竹的描述很到位:“统一理解、统一推理、统一生成,理解→推理→规划→行动成为闭环,让机器人从’看懂世界’走向’预演未来、精准执行’。“
5.2 反直觉的选择:具身智能在「合」,Coding 在「分」
到这里你会发现一个很有意思的对照:
| 方向 | 趋势 | 原因 |
|---|---|---|
| 具身智能(机器人) | 端到端:VLM + Action + WFM 合并 | 层间误差累积是瓶颈 |
| AI 编程 / Digital Agent | 分层:多 Agent + 人类审批 + 渐进式披露 | 上下文膨胀 + 责任归属是瓶颈 |
这其实不矛盾。看清楚这两个方向的瓶颈,你就知道为什么——
端到端 vs 分层架构,不是品味之争,是瓶颈定位之争。
当你的系统层与层之间的信息损耗是主要成本时,就合; 当你的上下文膨胀和责任模糊是主要成本时,就分。
5.3 中国具身智能的「国家队打法」
同一天,成都「具身智能军团」50 余款产品集体进京;亦庄 20+ 企业近 100 款新品;光谷 17 家企业组团。Pelican-VL 2.0 是国内首个网信办备案的具身大模型,token 调用量行业第一。这意味着中国具身智能的玩法和硅谷不同——政府背书 + 行业准入 + 开放本体 + 商业场景,是「Harness」的一种非技术维度补充。

图 2:把上面三个战场摆在一起看,故事非常一致
六、看不见的战场:腾讯降本 50%-65% 告诉我们的事
如果说上面三个战场是「抢 Harness 的用户入口」,那腾讯技术工程 8 月 21 日发的那篇复盘,就是把 Harness 内部成本结构掰开揉碎。强烈建议所有做 Agent 的同学读原文。
6.1 背景
他们用 AI Agent 驱动前后端全流程开发(需求分析→方案→编码→测试→视觉验证→评测),1 个 TL 调度 6 个子 Agent,跑一次中型需求 ≈ 5-6 Wave / 20+ 子 Agent / 数百轮工具调用。第一个月:钱烧得很快,但完全不知道烧在哪。
6.2 用 AgentLens 拆出来的六类成本
- 系统提示词(每轮都带)
- 工具返回信息(最大头)
- 历史消息(越长越贵)
- Skill 描述(每轮都带)
- MCP 工具 Schema(每轮都带)
- 输出 Schema
三件套:每轮都带、随 Agent/MCP 数量倍增。这就是「运行 N 个 Agent 后成本爆炸」的真正原因。
6.3 10 个降本方向(核心 4 条加粗)
- ① 稳定前缀缓存:同一段系统提示词只算一次
- ② 渐进式披露:当前步骤才加载对应上下文
- ③ 代码图谱按需检索:别把全仓喂给 Agent
- ④ CLI 替代 MCP:代码场景 MCP Schema 太重
- ⑤ 长期记忆按需索引
- ⑥ 工具调用并行化
- ⑦ 输出裁剪 + 大文件落盘
- ⑧ 架构拆分(按子任务切 Agent)
- ⑨ 上下文预算(窗口 80% 自动压缩)
- ⑩ Hook 拦截 + 离线工程基准
结果:端到端 token 成本下降 50% – 65%。原文一句话总结得比我好:“让 AI 只看到当前需要的上下文”。

图 3:把六类来源和 10 个方向画出来,一目了然
6.4 我读到的最反直觉的一条:「CLI 比 MCP 更省 token」
腾讯是 MCP 重度用户(其 ADP 4.0 早在 4 月就支持 MCP),但发现在 Coding 场景下,CLI 命令行直接调用比 MCP 服务化调用更省。原因:MCP 的工具 Schema 要随每轮上下文传给模型,调用次数一多就贵。
我的判断:2026 下半年会有一波「反 MCP 化」——不是 MCP 不好,而是 协议层标准化 ≠ 性能最优。MCP 在企业级「开箱即用」依然无敌,但在「高频多轮」Coding 场景会被 CLI / Function Call / 专用协议切走一部分。这也是为什么 DSH(DeepSeek Harness)要内置 PTC(Programmatic Tool Calling)——用 TypeScript 在本地执行多步调用,中间变量不喂给 LLM,和腾讯的思路完全一致。
七、OpenViking 与 DSH 生态:Harness 的「开源底座」
如果上面四件事是「Harness 怎么造」,那下面这组数据是「Harness 怎么免费拿」:
- DeepSeek Harness (DSH) 8 月 13 日开源 → 8 天内 GitHub 9962 个
dsh-plugin仓库,Oh-My-DSH 收录 1922 精选插件,累计 64.7 万 Star - OpenViking 31k Star,三层加载:摘要层 / 概览层 / 详情层,配合 DSH 把 Agent token 消耗降低 91%
- MemOS 10.9k Star,官方支持 DSH,宣称节省 35.24% token
- open-design 89.8k Star,让 Agent 变成「设计引擎」,原生 DSH 运行时
一个细节非常值得品味:DSH 的 Cordis 框架(时空调度)允许插件运行时热加载 / 卸载,自动回滚副作用(revertible effects),这种设计来自前 Jane Street 高频交易系统工程师崔添一。把金融系统级稳定性思路搬进 Agent Harness,是 DSH 真正的差异化点。
当别人还在争论「哪个插件好用」的时候,聪明人已经在看「整个生态里什么值得押注」。
八、我的看法:把上面的信号连成一条线
8.1 三个反直觉的判断
- 2026 是 Harness 元年,不是 Agent 元年。模型已经在 SOTA 上相互咬得很紧,胜负手在 Harness 的工程深度。
- 押注顺序:环境 > 上下文 > 权限 > 模型。大多数人直觉是先选最强模型,实战顺序反过来。
- 「小模型 + 大环境」会吃掉「大模型 + 小环境」在 GUI / 具身这类闭环任务的市场。Qwen-UI-Agent 27B 超 GPT-5.6 是这个论点的硬证据。
8.2 写给做 Agent 的团队
- 先回答「我的 Harness 包含哪 4 件」?Tools / Environment / Hard / Soft,缺哪件就补哪件
- 用 AgentLens 或类似工具先量 token 成本结构,再谈优化
- 把审计日志、权限审批当一等公民来设计,不是上线后再加
- 别追最强模型,追最强 Harness
8.3 写给 AI 编程的开发者
如果你正在用 Claude Code / Cursor / Codex,试着做一件事:把过去一个月的 token 计费账单拉出来,按「系统提示词 / 工具返回 / 历史消息 / Skill / MCP Schema」拆开看。90% 的概率你会发现,最大的那块不是模型输出,而是 Harness 自己的「房租」。
然后照腾讯那 10 条改一遍,50% 的成本大概可以当场砍掉。剩下的 50%,去 GitHub 给 DSH 提 PR。
信息来源
- Slack Code 发布:unite.ai / dataconomy.com / artiverse.ca,2026-08-20
- Qwen-UI-Agent:智东西、新浪科技,2026-08-20/21
- Pelican-Unify / 天工 Omni:经济参考报、中国工信新闻网、北京青年报,2026-08-20/21
- 腾讯 Multi-Agent 降本 10 个方向:腾讯技术工程(网易号转载),2026-08-21
- DeepSeek Harness 生态:SegmentFault / BestHub,2026-08-21
- AI Coding Tools Roundup:oday-bakkour.com,2026-08-20
数据截至 2026-08-22,AI 行业日新月异,欢迎指正与讨论。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。