Agent 的胜负手,已经不在模型里
原创 · 约 22 分钟阅读 · 阅读 --

Agent 的胜负手,已经不在模型里

作者: Alex Xiang


古董级程序员,从大厂到创业公司,现在还在一线做 AI 相关开发。微信公众号「字与码」会继续更新工程实践、新技术判断,以及这些年踩过的坑。文章若对你有用,欢迎顺手关注。

一、同一天,五条新闻,同一个真相

2026 年 8 月 19-21 日,72 小时内我数到 五条重要更新,分属完全不同的领域,但读完之后脑子里冒出的第一个念头是:

这一轮 AI 的胜负手,已经从「谁的模型更聪明」转移到「谁的 Harness 更好用」。

时间事件领域
08-192026 世界机器人大会开幕,天工 Omni 首秀、Pelican-VL 2.0 商用具身智能
08-20Slack 发布 Slack Code,把 Claude / Devin 装进项目频道AI 编程
08-20阿里发布 Qwen-UI-Agent,27B 主力模型 5 个 GUI 榜单 #1数字 Agent
08-20北京人形发布 Pelican-Unify 大一统具身模型 + 天工 Omni具身智能
08-21腾讯技术工程复盘:Multi-Agent 工作流 token 成本 降 50%-65%AI 编程
08-21DeepSeek Harness (DSH) 8 天 2600+ 插件仓库,OpenViking 三层加载减 91% tokenAgent 基建

如果你只看标题,会以为这是 5 个互不相关的新闻。但如果你真的把这些事连起来看,会发现一个非常清晰的信号——所有人都在抢 Harness

二、先把概念对齐:什么是 Harness?

「Harness」这个词源自马车,意思是把马的力气挂到车上。Databricks 在 2026 年把它变成了 AI 工程的标准公式:

Agent = Model + Harness

其中 Harness 包含四件东西:

  • Tools 工具:Bash、Read、Write、MCP、GUI、CLI —— 模型「伸出去的手」
  • Environment 环境:沙箱、真机、Slack 频道、浏览器 —— 任务跑得动的「场地」
  • Hard Controls:审批、沙箱权限、审计日志、限额 —— 模型「不能做什么」
  • Soft Controls:系统提示词、计划、记忆、反思 —— 模型「推荐怎么想」

Agent = Model + Harness 框架图

图 1:把 Harness 拆开看,2026 的工程共识其实就这么简单

一个反直觉的数据:Pi-coding 的 Agent 系统提示词只需要 ~200 token,而 Claude Code 优化前一度要用 ~10 000 token,相差 50 倍。同样一个模型,跑在不同的 Harness 上,token 成本、能力、稳定性可以差出一个数量级。这就是 2026 年工程团队真正的较量场。

三、战场一:AI Coding —— Slack Code 把 Harness 开到「人」那一层

3.1 发生了什么

8 月 20 日,Slack 上线 Slack Code。逻辑很简单:把 Claude Code / Devin / Copilot / Vercel Agent 这些 Coding Agent 装进「项目专属频道」,所有人围观、提反馈、审批。频道自带 HTML 实时预览,Agent 每一步可被暂停 / 改向 / 停止;任务完成后频道自归档,整段审计日志留下

Rob Seaman(Slack 临时 CEO)原话:“One of the things I love about this is that code is no longer the bottleneck. The real constraints now lie in human judgment and creativity.”

3.2 我看到的「Harness 三件套」

把 Slack Code 套到上面那张图里:

Harness 组件Slack Code 的实现
ToolsClaude Code / Devin / Copilot 等(外包)
Environment项目频道(人类 + Agent 同处)
Hard Controls「改 prod 需专家审批」+ 频道自归档审计
Soft Controls人类实时反馈 / 改向

3.3 为什么这步比模型升级更关键

Cognition 内部数据:合并 PR 数量 10x 增长,但人员只增加 40%。Slack 把 Coding Agent 从「单兵工具」变成「团队一员」,信任和审计问题被 Harness 层解掉——这才是企业真正敢大规模用 AI 写代码的开关。

我的判断:2026 下半年,Coding Agent 的竞争会从「谁的模型写代码更准」转向「谁先把人 / 团队 / 审批接进来」。Copilot Autopilot GA(per-agent 计费)、GitHub SLSA L3 自动认证、Cursor Teams,全是这个方向。

四、战场二:Digital Agent —— 27B 的 Qwen-UI-Agent 凭什么超过 GPT-5.6?

4.1 发生了什么

8 月 20 日,阿里千问发布 Qwen-UI-Agent,GUI 图形界面 Agent 基座模型。覆盖手机、PC 网页、深度搜索环境,主力版本 27B 参数。在 6 个核心 GUI 基准里 5 个第一,超过 GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro:

基准Qwen-UI-Agent次席
MobileWorld82.1%
MobileWorld-Real(真机)92.2%
AndroidDaily97.5%
OSWorld-Verified(PC)79.5%
WebArena73.6%
ScreenSpot-Pro81.5%

4.2 关键不是 27B,是 Harness 的「环境」

看技术报告很容易漏掉的一句话:「搭建了覆盖 100+ 台真实手机、150+ 应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,上万并发环境用于训练迭代」。

这意味着:模型权重只占 30%,剩下 70% 是真机环境 + 数据飞轮 + 在线 RLHF。换句话说,Qwen 真正的护城河不是 27B 的权重,而是 100 台真机 + 150 个 App 留下的真实轨迹数据。这个东西开源抄不走——资本可以复制(买硬件),但数据留在你的环境里

4.3 27B 凭什么赢 200B+?

我的判断:对于 GUI 这种 闭环 / 强反馈 / 状态可枚举 的任务,环境规模的边际收益已经超过模型规模。小模型 + 大环境 = 大模型 + 小环境。这对整个 Agent 行业是一个重要信号:押注 Harness 押注环境,比单纯堆参数回报更高

延伸观察:这跟 Cursor 5 月的策略变化呼应——Cursor 之前比模型,现在比 IDE 集成深度和索引能力。和 DSH 插件生态里 open-design 89k Star 这种「设计 Agent Harness」也是同一个故事。把 Harness 当产品做,把模型当 API 调用

五、战场三:具身智能 —— Pelican-Unify 反方向走,把 Harness 内化到模型里

5.1 发生了什么

8 月 20 日,北京人形机器人创新中心发布 Pelican-Unify,同时亮相轻量人形机器人 天工 Omni。Pelican-Unify 把三件过去分开的事合并了:

  • VLM 视觉语言(看得懂)
  • Action Model 动作控制(做得到)
  • WFM 世界模型(预演未来)

技术路线从「模块化」→「端到端」。鞠笑竹的描述很到位:“统一理解、统一推理、统一生成,理解→推理→规划→行动成为闭环,让机器人从’看懂世界’走向’预演未来、精准执行’。“

5.2 反直觉的选择:具身智能在「合」,Coding 在「分」

到这里你会发现一个很有意思的对照:

方向趋势原因
具身智能(机器人)端到端:VLM + Action + WFM 合并层间误差累积是瓶颈
AI 编程 / Digital Agent分层:多 Agent + 人类审批 + 渐进式披露上下文膨胀 + 责任归属是瓶颈

这其实不矛盾。看清楚这两个方向的瓶颈,你就知道为什么——

端到端 vs 分层架构,不是品味之争,是瓶颈定位之争。

当你的系统层与层之间的信息损耗是主要成本时,就合; 当你的上下文膨胀和责任模糊是主要成本时,就分。

5.3 中国具身智能的「国家队打法」

同一天,成都「具身智能军团」50 余款产品集体进京;亦庄 20+ 企业近 100 款新品;光谷 17 家企业组团。Pelican-VL 2.0 是国内首个网信办备案的具身大模型,token 调用量行业第一。这意味着中国具身智能的玩法和硅谷不同——政府背书 + 行业准入 + 开放本体 + 商业场景,是「Harness」的一种非技术维度补充。

三个战场对比图

图 2:把上面三个战场摆在一起看,故事非常一致

六、看不见的战场:腾讯降本 50%-65% 告诉我们的事

如果说上面三个战场是「抢 Harness 的用户入口」,那腾讯技术工程 8 月 21 日发的那篇复盘,就是把 Harness 内部成本结构掰开揉碎。强烈建议所有做 Agent 的同学读原文。

6.1 背景

他们用 AI Agent 驱动前后端全流程开发(需求分析→方案→编码→测试→视觉验证→评测),1 个 TL 调度 6 个子 Agent,跑一次中型需求 ≈ 5-6 Wave / 20+ 子 Agent / 数百轮工具调用。第一个月:钱烧得很快,但完全不知道烧在哪

6.2 用 AgentLens 拆出来的六类成本

  1. 系统提示词(每轮都带)
  2. 工具返回信息(最大头)
  3. 历史消息(越长越贵)
  4. Skill 描述(每轮都带)
  5. MCP 工具 Schema(每轮都带)
  6. 输出 Schema

三件套:每轮都带、随 Agent/MCP 数量倍增。这就是「运行 N 个 Agent 后成本爆炸」的真正原因。

6.3 10 个降本方向(核心 4 条加粗)

  • ① 稳定前缀缓存:同一段系统提示词只算一次
  • ② 渐进式披露:当前步骤才加载对应上下文
  • ③ 代码图谱按需检索:别把全仓喂给 Agent
  • ④ CLI 替代 MCP:代码场景 MCP Schema 太重
  • ⑤ 长期记忆按需索引
  • ⑥ 工具调用并行化
  • ⑦ 输出裁剪 + 大文件落盘
  • ⑧ 架构拆分(按子任务切 Agent)
  • ⑨ 上下文预算(窗口 80% 自动压缩)
  • ⑩ Hook 拦截 + 离线工程基准

结果:端到端 token 成本下降 50% – 65%。原文一句话总结得比我好:“让 AI 只看到当前需要的上下文”

Multi-Agent 成本结构与降本方向

图 3:把六类来源和 10 个方向画出来,一目了然

6.4 我读到的最反直觉的一条:「CLI 比 MCP 更省 token」

腾讯是 MCP 重度用户(其 ADP 4.0 早在 4 月就支持 MCP),但发现在 Coding 场景下,CLI 命令行直接调用比 MCP 服务化调用更省。原因:MCP 的工具 Schema 要随每轮上下文传给模型,调用次数一多就贵。

我的判断:2026 下半年会有一波「反 MCP 化」——不是 MCP 不好,而是 协议层标准化 ≠ 性能最优。MCP 在企业级「开箱即用」依然无敌,但在「高频多轮」Coding 场景会被 CLI / Function Call / 专用协议切走一部分。这也是为什么 DSH(DeepSeek Harness)要内置 PTC(Programmatic Tool Calling)——用 TypeScript 在本地执行多步调用,中间变量不喂给 LLM,和腾讯的思路完全一致。

七、OpenViking 与 DSH 生态:Harness 的「开源底座」

如果上面四件事是「Harness 怎么造」,那下面这组数据是「Harness 怎么免费拿」:

  • DeepSeek Harness (DSH) 8 月 13 日开源 → 8 天内 GitHub 9962 个 dsh-plugin 仓库,Oh-My-DSH 收录 1922 精选插件,累计 64.7 万 Star
  • OpenViking 31k Star,三层加载:摘要层 / 概览层 / 详情层,配合 DSH 把 Agent token 消耗降低 91%
  • MemOS 10.9k Star,官方支持 DSH,宣称节省 35.24% token
  • open-design 89.8k Star,让 Agent 变成「设计引擎」,原生 DSH 运行时

一个细节非常值得品味:DSH 的 Cordis 框架(时空调度)允许插件运行时热加载 / 卸载,自动回滚副作用(revertible effects),这种设计来自前 Jane Street 高频交易系统工程师崔添一。把金融系统级稳定性思路搬进 Agent Harness,是 DSH 真正的差异化点。

当别人还在争论「哪个插件好用」的时候,聪明人已经在看「整个生态里什么值得押注」。

八、我的看法:把上面的信号连成一条线

8.1 三个反直觉的判断

  1. 2026 是 Harness 元年,不是 Agent 元年。模型已经在 SOTA 上相互咬得很紧,胜负手在 Harness 的工程深度。
  2. 押注顺序:环境 > 上下文 > 权限 > 模型。大多数人直觉是先选最强模型,实战顺序反过来。
  3. 「小模型 + 大环境」会吃掉「大模型 + 小环境」在 GUI / 具身这类闭环任务的市场。Qwen-UI-Agent 27B 超 GPT-5.6 是这个论点的硬证据。

8.2 写给做 Agent 的团队

  • 先回答「我的 Harness 包含哪 4 件」?Tools / Environment / Hard / Soft,缺哪件就补哪件
  • 用 AgentLens 或类似工具先量 token 成本结构,再谈优化
  • 把审计日志、权限审批当一等公民来设计,不是上线后再加
  • 别追最强模型,追最强 Harness

8.3 写给 AI 编程的开发者

如果你正在用 Claude Code / Cursor / Codex,试着做一件事:把过去一个月的 token 计费账单拉出来,按「系统提示词 / 工具返回 / 历史消息 / Skill / MCP Schema」拆开看。90% 的概率你会发现,最大的那块不是模型输出,而是 Harness 自己的「房租」。

然后照腾讯那 10 条改一遍,50% 的成本大概可以当场砍掉。剩下的 50%,去 GitHub 给 DSH 提 PR。

信息来源

  • Slack Code 发布:unite.ai / dataconomy.com / artiverse.ca,2026-08-20
  • Qwen-UI-Agent:智东西、新浪科技,2026-08-20/21
  • Pelican-Unify / 天工 Omni:经济参考报、中国工信新闻网、北京青年报,2026-08-20/21
  • 腾讯 Multi-Agent 降本 10 个方向:腾讯技术工程(网易号转载),2026-08-21
  • DeepSeek Harness 生态:SegmentFault / BestHub,2026-08-21
  • AI Coding Tools Roundup:oday-bakkour.com,2026-08-20

数据截至 2026-08-22,AI 行业日新月异,欢迎指正与讨论。

打开原图 ↗