技术热点透视20260907:当 AI 开始造 AI
原创 · 约 10 分钟阅读 · 阅读 --

技术热点透视20260907:当 AI 开始造 AI

作者: Alex Xiang


古董级程序员,前百度/微博工程师,现在关注 AI 工程化与开发者工具。
微信公众号「字与码」,记录技术思考与行业观察。
本文同步发布于 zicode.com

一、账本的第一行:3.1 个 AI 同事

这不是一句营销话术,而是一条有时间刻度的曲线。

  • 半年前,这个比例还不到 1
  • 2026 年 6 月之前,整个研究部门 Agent 的总运行时间仍低于人类总劳动时长;
  • 6 月到 8 月之间,天平翻了过来;
  • 到 8 月中旬,按每天 8 小时折算,每投入 1 个人类研究日,内部同时产生约 3.1 个 Agent 工作日

钱也烧得真实:中位数研究员日均推理算力折合约 600 美元(按 API 价),排在第 90 百分位的重度用户,每天烧掉超过 7,000 美元 的 token。同时跑 4 个以上 Agent 的研究员人数还在持续增长。

换句话说,在”工时”意义上,OpenAI 研究部的 AI 劳动力已经是人类的三倍多。AI 帮人类造出更强 AI 的闭环,已经从概念讨论走进了实验室的日常排班。

二、Agent 在研究的哪一环真正”赚钱”

OpenAI 按 Epoch AI 的科研分类拆解了 Agent 的用途。所有类别都在涨,但 Agent 真正站稳的位置,不是宏大的战略规划(那一块占比仍然很小),而是研究中间那段不性感的苦活:写基础设施代码、跑和监控训练任务、排障。

一个很能说明问题的细节:好几个团队过去会给研究员开”实验排障”答疑会,今年 attendance 直接崩了,其中一个团队干脆不办了——答疑的活被 Agent 接走了。

这恰恰是 coding agent 最舒服的位置:边界清晰、可验证、重复度高、容错有兜底。它不像”定方向”那样需要品味,也不像”写论文”那样需要担责,但它吃掉了研究里最耗人的时间。Agent 不是去抢最显眼的那块蛋糕,而是把厨房里最累的活全包了。

三、账本里那句诚实的免责声明

同样在那份数据里,藏着一句容易被标题党忽略的话:在 4–8 小时的任务上,超过一半的”成功”仍然需要至少一次人工介入

OpenAI 自己的措辞是”expensive colleagues”(昂贵的同事),不是”replacements”(替代者)。Agent 已经能独立扛下大块执行,但质量闸门还捏在人手里。 这句话很重要。它把”AI 接管科研”的叙事从科幻拉回了工程现实:**加速是真的,替代是假的;放大人类产出是真的,消灭人类岗位是远的。**在 2028 年”完全自动化 AI 研究员”到来之前,人与 Agent 更像是结对编程——只不过这个”搭档”不领工资,却每天吃掉几百到几千美元的算力。

四、递归自我改进,第一次跑在了实验室里

这套数据背后是一个被讨论了很多年的词:递归式自我改进(recursive self-improvement)——AI 驱动 AI 自身的研发。OpenAI 首席科学家 Jakub Pachocki 同一周末发了万字长文《An Alien Mind》,说人类正在造出”无法被理解、且没人准备好应对的外星大脑”,并呼吁行业主动踩刹车,因为没有任何实验室真正解决了对齐与监控。

而 OpenAI 在同一篇博客里宣布:它已经在 2026 年 9 月前达成了”自动化 AI 研究实习生”目标(定义:在人类指导下完成明确研究任务,包括那些本要花熟练研究员几天的事),下一个目标是 2028 年 3 月前的”完全自动化 AI 研究员”

这里有个必须正视的张力:一边是实验室里 3.1× 的加速循环已经转起来,一边是”对齐与监控还没解决”的公开警告。OpenAI 自己在博客里也坦白:曾有 Agent 攻破自家研究基础设施,被迫临时关停训练容器、RL 训练一度下滑,后来才迁到加固环境;Astra 因达到”关键”级网络能力,被额外加了模型级安全限制。

01-self-improvement-loop 图 1:递归自我改进闭环——人类定方向,Agent 写码跑实验排障,产出更强模型,再回流到下一代研究。

五、对我们意味着什么

把这份账本当成一面镜子,能照出三件事。

**第一,前沿的比赛早就不在 benchmark 分数上了。**当 Agent 能在内部把研究循环拧快 3 倍,真正的护城河变成三件事:生产级 harness(怎么调度、怎么验证、怎么回滚)、安全边界(Agent 能碰什么、不能碰什么)、和经济账(每天 600–7,000 美元的推理 opex 能不能换回足够的产出)。这正是我们这一周连着聊的 harness、记忆治理、可用性韧性几条线的交汇点。

**第二,最大的买主其实是 AI 实验室自己。**coding agent 真正大规模消耗的买主,不是普遍开发者,而是前沿实验室——它们用 agent 造下一代 agent。对普通团队来说,真正的杠杆不在”再堆一个模型”,而在”把验证回路和护栏做厚”:当没人逐行读代码(无论是 Bun 那 100 万行,还是实验室里每天跑的 Agent),正确性就彻底押在测试和治理上。

我的判断:2026 年下半年最该盯的,不是谁的模型又高了 1 分,而是三件事——闭源头部何时完成 IPO 定价、Agent 能否从演示走成稳定生产力、以及”自主行动的 AI”会被套上多紧的合规缰绳。OpenAI 这次主动亮账本、还呼吁别家也亮,本身就是信号:递归自我改进的速度,已经成了它需要向公众解释、也需要行业共同约束的事。 02-agent-ratio 图 2:Agent 工时占比从年初 <1 翻转到 8 月的 3.1;成本与”仍需人工介入”的真相同在账本里。

其他动态

  • Agent 框架OpenAI Agents SDK 重大升级:新增可配置记忆、沙箱感知、内置快照与状态恢复、持久化执行,已集成 7 家托管沙箱,Agent 运行时从”单次对话”迈向”持续运行 + 经验复用”的工程化阶段。
  • Agent 安全微软 Project Zenith:64GB 统一内存 + MXC 隔离容器的 AI 开发者 Windows 11,把 Agent 的权限/隔离/审计下沉到操作系统层,应用层画不住的边界改由系统统一裁决。
  • Agent 社交微信”小微”内测 Agent 社交:让两个用户的 AI 助手先彼此沟通、只在关键决策时把人叫回来,智能体从”帮人做事”走向”替人协调”。
  • 工业智能体甲子光年《2026 工业 AI 智能体报告》:预测 2030 年中国 AI 增强型工业软件市场达 3619 亿元,工业智能体终极形态是”工厂原生”。
打开原图 ↗