技术热点透视20260902:Codex 给 Agent 装上了「外部记忆」
原创 · 约 10 分钟阅读 · 阅读 --

技术热点透视20260902:Codex 给 Agent 装上了「外部记忆」

作者: Alex Xiang


古董级程序员,前百度/微博工程师,现在关注 AI 工程化与开发者工具。
微信公众号「字与码」,记录技术思考与行业观察。
本文同步发布于 zicode.com

同一天里,三件关于 coding agent 的事叠在一起:OpenAI 的 Codex CLI 悄悄补上一个 _context 外部记忆工具,专门对付长任务跑到一半「失忆」;Claude Code 的周限额「名义永久 +25%、实际到手反降 17%」被社区反复算账,同期 OpenAI 那边在修「后台偷烧额度」的 bug;Cognition(Devin)传出拟融资约 10 亿美元、估值冲到 470 亿美元。把它们横过来看——coding agent 的竞争,已经从「谁更会写代码」,挪到了「谁更会记住上下文、谁更划算、谁更敢下注」。

一、Codex 的 _context:把「失忆」做成工程机制

9 月 1 日,OpenAI 的 Codex CLI 代码库里曝光出一个新工具 _context。它解决的是 agentic coding 最磨人的老问题:一个跑了几小时、跨几十个文件的任务,上下文窗口迟早要被填满,压缩历史就会丢背景——之前定过的约定、踩过的坑、读到一半的报错,一轮 compaction 之后全没了,agent 像换了个人重新上手。

_context 的思路不是「把窗口做得更长」,而是「带着可检索的工作档案切窗口」:上下文快满时,硬切到一个新窗口,但把上一程的关键结论写成「工作注释」落盘,新窗口可以随时回头查询历史。等于给 agent 配了一个不会被压缩吞掉的外部记忆。

01-context-mechanism 图 1 · 硬切窗口 + 工作注释 + 历史查询:上下文满了不再原地压缩丢失,而是带着档案换窗口。

**这个细节比它看起来重要。**过去一年大家拼命堆长上下文,但「更长」解决不了「更久」——窗口再大也有上限,且越长越贵。Codex 这步是把「记忆」从模型能力问题,重新定义成 harness 的工程问题:窗口是临时的,档案是持久的。后面那篇讲 agent 记忆架构的文章会看到,这几乎是整个行业在 9 月的最大公约数。

二、限额的「数学魔术」还在继续

Claude Code 那笔账 9 月 1 日被算得很透:9 月 14 日起标准周限额「永久 +25%」,但临时加量(从 100 提到 150)结束,基数回到 100,于是实际可用量从 150 落到 125,重度用户到手缩水约 16.7%。同一天另一个对照很有意思:OpenAI 的 Tibo 宣布重置 Codex 额度,并修复了一个后台偷偷烧额度的 bug,预期同等额度能多用 10%–50%。

动作Claude Code(9/14 起)Codex(同期修复后)
限额口径100 × 1.25 = 125重置 + 修偷烧 bug
用户体感比现状 150 少约 17%同等额度多用 10%–50%
底层逻辑话术「永久涨价」先把泄漏的口子堵上

**两家的方向相反,但指向同一件事:token 经济学已经是 coding agent 产品的核心战场。**Anthropic 用「名义上调、基数回调」做收入管理;OpenAI 先修浪费再谈定价。对团队来说,关键是把预算锚点从「周限额数字」挪到「每个被合并的 diff 花了多少、每个 shipped 功能消耗多少 agent 额度」——前者一抖就乱,后者才是真成本。

三、Cognition 470 亿美元:资本给 coding agent 定价

9 月 2 日,多家媒体报道 AI 编程公司 Cognition(Devin)拟融资约 10 亿美元,估值达 470 亿美元。AI 编程 Agent 这个赛道的估值,正在以肉眼可见的速度抬高。放到更大的盘子里看:Anthropic 的 Claude Code 年化收入已破 25 亿美元,Cursor 三个月收入翻倍、年化破 20 亿美元,Codex 周活据称冲到 2500 万(10 天新增 500 万)。

这些数字合起来说明一件事:市场不再把 coding agent 当「IDE 里的一个补全插件」来估值,而是在按**「下一代基础软件层」**来下注。当一线产品逐个跑出十亿级 ARR,估值就不再是故事,而是现金流的预期折现。

**我更愿意把 Cognition 的估值读作一个信号,而不是一个目标。**它告诉所有在做内部 coding agent 平台的团队:这条赛道被资本确认了「基础层」地位。但这也意味着,未来比拼的不是「有没有 agent」,而是「agent 在你的研发流里,单位产出的成本能不能持续往下走」——否则高估值的一端是机会,另一端是烧钱压强。

02-value-triangle 图 2 · coding agent 的竞争被拆成能力、成本、资本三个角,9 月的新闻恰好各占一角。

四、给工程团队的三条判断

把这三则信号合起来,对正在把 coding agent 塞进生产环境的团队,有三条现在就能用的判断:

  1. 把「记忆」当一等基础设施。 不管是 Codex 的 _context 这类外部档案,还是自研的 runbook/notes 落盘,别再指望长上下文窗口包办一切。窗口是临时的,可检索的持久档案才是 agent 跨长任务的底气。
  2. FinOps 先于狂欢。 限额会抖、额度会偷烧。给 agent 工作负载套上项目级花费上限、用量看板、延迟执行,把成本钉在产出侧,比追一个新模型更影响底线。
  3. 用「基础层」的标准要求自己的平台。 如果你们在搭内部 coding agent,目标不该是「跑通 demo」,而是「可治理、可审计、单位成本可持续」——这正是资本给赛道定下的槛。

**一句话收束:**9 月 2 日这三条 coding agent 新闻,一条讲能力(_context 让 agent 记住)、一条讲成本(限额与偷烧)、一条讲资本(470 亿估值)。它们共同指向一个拐点——coding agent 已经从「炫技工具」变成「被单独计价的生产力基础设施」。下一次你评估一个 coding agent,别只问它接了哪个模型,要问它:任务跑到第 5 个小时,它还记得第 1 小时定下的约定吗?以及,这第 5 个小时,花了多少钱?

打开原图 ↗