技术热点透视20260923:Qwen Book,把操作系统做成 Agent 的 Harness
2026 年 9 月 23 日,杭州云栖大会,阿里云发布了一款叫 Qwen Book 的产品,官方定位是「首款 AI 智能体电脑」,说它能自主理解用户意图,并且不断进化。
共 13 篇文章
2026 年 9 月 23 日,杭州云栖大会,阿里云发布了一款叫 Qwen Book 的产品,官方定位是「首款 AI 智能体电脑」,说它能自主理解用户意图,并且不断进化。
LangAlpha 是 Ginlix AI 开源的金融研究 agent harness,把 Claude Code 那套持久工作区、沙箱代码执行、子代理并行的架构搬进了投研。拆解它的 PTC 设计、数据层软肋,以及它跟 TradingAgents 的本质分野。
今天 OpenAI 把 Agents API 推到了 public beta。表面看,这是「又一个 API 开放」;往里看,这是把驱动 Codex 与 ChatGPT 的那套 agent 基础设施——harness——从
Cognition 完成 20 亿美元 E 轮、估值 480 亿美元,Devin 自主编程 Agent 被资本按下加速键;拆解估值与营收轨迹、自主性层级,以及 harness 正在取代模型成为新护城河。
OpenAI 把内部账本亮了出来:截至 2026 年 8 月中旬,每 1 个人类研究工作日,公司内部同时跑着 3.1 个 AI Agent 工作日——半年前还不到 1,6 月前 Agent 总运行时间仍低于人类总劳动,6 到 8 月之间天平翻了过来。中位数研究员日均推理算力约 600 美元,第 90 百分位每天烧掉超 7000 美元 token。Agent 真正站稳的不是宏大战略规划,而是研究中间那段不性感的苦活:写基础设施、跑和监控训练、排障。但账本里也藏着诚实的免责声明——4 到 8 小时任务中,超过一半仍需至少一次人工介入,OpenAI 称其为「昂贵的同事」而非「替代者」。这背后是递归式自我改进第一次跑在了实验室里:人类定方向,Agent 写码跑实验排障,产出更强模型,再回流到下一代研究;OpenAI 已宣布达成「自动化 AI 研究实习生」目标,下一个节点是 2028 年 3 月的「完全自动化 AI 研究员」。前沿的比赛早已不在 benchmark 分数,而在生产级 harness、安全边界与经济账。
Bun 1.4 把运行时底层从 Zig 重写成 Rust,一次改动 +1,009,257 / −4,024 行、6,778 次提交、约 11 天、烧掉约 16.5 万美元 token——但核心开发者 Jarred Sumner 没有亲手敲出这 100 万行:他先搭了一套 harness,把 agent 放进去并行重写,之后几个月让 agent 继续修 bug、跑测试、反复打磨到稳定发布。同一天,Claude 用几乎一样的思路端到端形式化证明了费马大定理(约 1,300 万行 Lean、约 60 亿 token、约 11 天)。两件标杆性事件指向同一个判断:软件生产的单位,正在从「人写的一行行代码」变成「人设计的 harness + 被调度去执行的 agent」。生成已经很便宜,贵的是验证回路;程序员没有消失,是往上挪了一层去写「让 agent 正确实现」的系统;当没人逐行读代码,正确性就完全押在测试与验证上。
GPT-6 Astra 在 9 月 3 日发布、9 月 4-5 日放量到 ChatGPT Work / Codex / API 后,真正的变化不是「又出了个更强的模型」,而是它直接装机进 coding agent 的 harness:Codex 跨窗口持久记忆、给写 PR 的 agent 加语音对话、Cognition 把 Astra 塞进 Devin 在 FrontierCode 上逼近 Fable 5 而成本低 64%。同一天 Claude Code 周限额重置。模型厂不再只卖 API,开始亲手把模型做成「会写代码的 agent」——coding agent 的护城河正从「模型强」挪到「harness 强」:上下文记忆、工具编排、模型路由、护栏、可观测才是难复制的部分;而成本曲线上单模型单价在涨、编排却把每任务成本往下拉,开发者最终为「性价比」而非「榜单」买单。
9 月 2 日 AI agent 观察:Cue-Anchored Working Memory 提出记忆是「递送」而非「存储」——Tier2 由 harness 在 path/symbol/semantic/event/temporal 五种 cue 触发时确定性注入,一个存储是记忆还是参考文档由递送机制决定;四层记忆架构(working/episodic/semantic/procedural)指出长上下文成本约为持久记忆检索的 15 倍;StateM 不改模型权重,靠 durable states+phase-local context+checked transitions+recoverable runbooks 把 Terminal-Bench 2.1 拉到 95.3%;AgentScope 2.0 把状态/记忆/可观测/治理做成开箱工程。结论:agent 难点已从「模型够强」转向「状态/记忆/可观测/治理」,要当受管业务系统设计。
72 小时内 5 条新闻、3 个战场,2026 的工程共识:Agent = Model + Harness。从 Slack Code、Qwen-UI-Agent、Pelican-Unify 到腾讯降本 50%-65%,看 Harness 怎么成了 AI 真正的胜负手。
DeepSeek Harness 的开源热度背后,值得关注的不是一串 Star,而是 Agent 运行时会不会成为模型、工具和开发者之间新的长期入口。
DeepSeek 把 Harness 以 dsh 开源。本文从源码拆开 Cordis 插件树、事件溯源会话、工具执行流水线、上下文压缩、沙箱与子 Agent,判断它究竟是一款编程助手,还是一个可替换的 Agent Runtime。
上一篇用 48 小时真实会话证明了它便宜又耐用,这篇拆到适配层看它为什么能被 Codex 用好:~/.codex/models.json 的每个字段怎么改变客户端行为,1.77 万字符的 instructions_template 怎么把模型变成合格的 Codex 代理,以及 DeepSeek Harness 的内测招募、官方基准和社区猜测。
从 DeepSeek Agent 岗位讨论出发,拆解 Harness、企业级运行时、状态机、事务边界和上下文窗口,回答一个 Agent 怎样从演示程序变成可恢复的系统。