AGI 时代,真的来了吗?从 GPT-6 Astra 发布,看通用人工智能的现状与趋势
原创 · 约 19 分钟阅读 · 阅读 --

AGI 时代,真的来了吗?从 GPT-6 Astra 发布,看通用人工智能的现状与趋势

作者: Alex Xiang


古董级程序员,前百度 / 微博工程师。关注 AI 工程化、长期效率与可落地的技术判断。微信公众号「字与码」,同步更新更多 AI 与编程观察。

9 月 3 日,OpenAI 发布 GPT-6 Astra,Greg Brockman 在发布会最后甩下一句话:“Welcome to the AGI era.”

这不是 OpenAI 第一次把 AGI 挂在嘴边,但这一次 accompanied by 一组足够吓人的数字:10 万张 GPU、105 万 token 上下文、ARC-AGI-3 99.9%、ExploitBench 满分、能做 PCB、能报税表、能做完一整份 PPT。可另一边,ARC 用标准框架跑只有 62.7%,OpenAI 还因为网络安全能力太强,不敢把所有功能全量开放。

热闹归热闹,问题是:AGI 到底算不算来了?这篇文章试着把跑分、定义、争议和趋势拆开来看。

一、GPT-6 Astra 到底交出了什么

先列几个硬核数据,看完你就知道为什么 Brockman 敢喊那句话:

项目GPT-6 Astra对比(GPT-5.6 Sol)
上下文窗口105 万 token
训练算力Stargate 园区,10 万 + GPU明显更小
ARC-AGI-3(官方 harness)99.9%7.8%
ARC-AGI-3(标准框架)62.7%
FrontierMath Tier 497.6%83%
ExploitBench100%73.5%
OSWorld 2.072.6%(约 40 分钟 / 任务)65.7%(约 75 分钟 / 任务)
Terminal-Bench 4.057.7%37.3%
AutomationBench41.4%18.1%
越权行为测试(无安全措施)0%48.2%
API 定价(输入 / 输出 / 百万 token)$10 / $50$4 / $20

数据来源:OpenAI 官方博客、第三方评测汇总

AI Agent 操作电脑

比数字更重要的是范式变化。GPT-6 Astra 的核心定位不是”更聪明的聊天机器人”,而是能直接操作电脑、浏览器和专业软件完成多步骤任务的 Agent。

官方演示里,Astra 打开 KiCad 画 PCB、填美国 1040 税表、在 Power BI 里做报表、用 Blender + Unreal Engine 5 搭一个可以走进去的房子、按公司既有模板做完一整套 PPT。Legora 用它核对 41 份财务文件,几分钟找出 4 个预设错误,包括一笔 50 万英镑的收入差异;Playco 让它直接进 Unity 和 Godot 做游戏原型。

这种变化的本质是:AI 从”给你答案”变成了”替你把活干完”。你交代目标、设定边界,最后检查交付物。这跟以前”一问一答”的体验完全不同。

二、99.9% 背后,跑分能不能定义 AGI

基准测试与放大镜

Arc-AGI-3 被很多人视为 AGI 的试金石,因为它考的不是你的训练记忆,而是把模型丢进一个从未见过的二维小游戏,让它边玩边学规则。Astra 拿到 99.9%,Brockman 于是说”这可能是 AGI 诞生的时刻”。

但争议来得同样快:同一份 ARC-AGI-3,用标准测试框架跑,Astra 只有 62.7%。OpenAI 用的是自家的 Responses API Harness,调了记忆管理和 Agent 运行方式。也就是说,99.9% 不只是基础模型的分,也是框架和记忆系统叠加后的分。

这引出一个更深层的问题:AGI 的定义到底是什么?

  • OpenAI 的定义很务实:在大多数有经济价值的工作上超过人类。
  • DeepMind 提过一个”Levels of AGI”框架,把能力、通用性和自主性分开打分,主张 AGI 是个光谱,不是开关。
  • Anthropic 偏向安全优先:先解决对齐和监督,再谈 AGI。

三种定义,三种路线。如果你按 OpenAI 的”经济价值”标准,Astra 在编程、科研、办公自动化上确实开始触到达标的边缘;如果你按 DeepMind 的”通用性 + 自主性”标准,它仍然是在特定环境里有监督的 Agent,离人在任意陌生场景里的适应能力还有距离。

国际 AI 安全报告(2026)提过一个”评测鸿沟”:实验室里的预部署测试,往往无法可靠预测模型在真实世界里的行为。分数高不代表 AGI,分数低也不代表没有危险能力。

所以 99.9% 可以是一个里程碑,但不能自动兑换成”AGI 已至”。真正有意思的是,为什么 OpenAI 选择在这个节点把 AGI 喊出来——答案可能在商业叙事和融资压力里,也可能在它对技术曲线的真实判断里。

三、AGI 到底走到了哪一步

五条并行路径

如果把通往 AGI 看作五条并行的路,2026 年的现状大致是这样的:

1. 前沿模型 Scaling

这条路依然在走,但边际收益正在递减。GPT-6 比上一代强很多,但成本也涨了 2.5 倍。很多过去只有 GPT-4 才能做的事,现在廉价模型比如 Gemini Flash、Claude Haiku 也能做。真正难的问题——不确定性下的多步推理、从未见过的新任务—— still stumps 最强模型。

2. 推理时计算(Inference-time compute)

不训练更大的模型,而是在回答前让它”多想一会儿”。OpenAI 的 o 系列、Gemini Flash Thinking 都走这条路。对数学和逻辑题确实有效,但它能不能扩展到开放性任务,还是一个开放问题。

3. 多模态 Grounding

模型开始看屏幕、听声音、读 PDF、操作 GUI。这是 Computer Use 的基础。真实世界不 speak JSON,它给人类留了键盘、鼠标和屏幕。谁能用这些通用接口,谁就能接入最多软件。

4. 记忆与长上下文

1M token 上下文已经从奢侈品变成旗舰标配,持久记忆、跨会话状态、RAG 也开始落地。但 Altman 反复说”用户要的是记忆”——这说明目前的记忆还远远不够好。

5. Agent 自主性

这是最热闹、也最容易翻车的方向。单个 Agent 在真实环境里还是会幻觉、死循环、遇到没见过的工具就懵。所以行业开始转向多 Agent 编排:一个研究、一个写、一个检查、一个执行,用 orchestrator 调度。

五条路都没有单独到达终点,它们正在缓慢收敛。GPT-6 Astra 的亮点,恰恰是同时在这几条路上都往前拱了一步。

四、2026 的模型军备竞赛,不只是 OpenAI 一家

OpenAI、Anthropic、DeepMind 代表人物

Sam Altman(OpenAI)、Dario Amodei(Anthropic)、Demis Hassabis(DeepMind)

9 月初的发布窗口异常拥挤:OpenAI 发 GPT-6 Astra,Anthropic 发 Claude Fable 5.1,谷歌发 Gemini 3.8 Flash,Meta 发 Muse Spark 1.3,阿里更新 Qwen,智谱官宣 GLM 6.0 已在推进。

这种密度说明两件事:

  • 第一,模型迭代已经从”一年一更”变成”一月一更”,竞争节奏彻底变了。
  • 第二,国产模型已经从”跟跑”进入”并跑”,部分场景开始”领跑”。
时间代表事件
2026.02OpenAI GPT-5.3;国产 GLM-5、豆包 Seed 2.0、Qwen 3.5 春节三连发
2026.04OpenAI GPT-5.5 与 DeepSeek V4 同一天发布
2026.06OpenAI GPT-5.6 Sol 预览;Anthropic Claude Fable 5 短暂被出口管制冻结
2026.07Claude Opus 5 发布,Anthropic 称”接近顶配、价格砍半”
2026.08智谱 GLM-5.3-Flash 匿名登顶 OpenRouter
2026.09.02Claude Fable 5.1、Gemini 3.8 Flash、Muse Spark 1.3 齐发
2026.09.03OpenAI GPT-6 Astra 发布
2026.09.29OpenAI DevDay,Astra 预计全面铺开
2026 Q4传闻 Gemini 4、DeepSeek R2、智谱 GLM 6.0 接续登场

2026 年主要模型发布节点,据公开报道整理

智谱的 GLM 6.0 尤其值得盯。创始人唐杰在半年报电话会上说,下一代要赌”自进化”:让模型自己判断什么时候该停、什么时候该纠错。这是一条没人完全走通的路,但也是中国模型从”并跑”到”超车”最可能的机会。

DeepSeek V4 则是另一条路:1.6T MoE、压缩注意力把 KV 缓存砍到前代 1/10,推理成本打到 GPT-5.5 的八分之一。当顶尖模型卖 50 美元 / 百万 token 输出时,DeepSeek 的成本结构可能会改写价格曲线。

五、接下来值得盯的七个方向

未来方向

热闹之后,有几个方向会真正决定 AGI 的落地节奏,而不是发布会 rhetoric。

1. Computer Use + MCP + 实时音视频

这是当前人机交互形态变化最快的区域。Astra 操作电脑,Claude 协调子 Agent,Gemini Spark 主打 7×24 小时跨应用执行,Grok Bot 进企业。MCP 协议让工具定义标准化,实时音视频则让 Agent 能”看”和”听”。三者叠加,会定义下一代个人助理和企业 Agent 的形态。

2. 递归式自我改进(RSI)

OpenAI 训练副总 Aidan Clark 透露,Astra 是首款由前代模型在训练监督中发挥重要作用的前沿模型。训练后期系统能自主运行大半天,AI 可以自己维护训练系统。这还只是雏形,但如果这条路跑通,模型迭代的瓶颈会从人类工程团队的工时,转向算力、实验设计和安全验证。那将是通往 ASI 的真正拐点。

3. 对齐与安全

Astra 达到 OpenAI 网络安全”Critical”阈值,能自己找未知漏洞并写利用代码。所以最强网络安全能力暂时不全部开放。能力越强,约束越紧,这个张力会长期存在。欧盟 AI Act 2026 年 8 月正式适用,美国 CAISI 预部署评估也在推进,监管会成为产品发布节奏的关键变量。

4. 算力与能源

10 万张 GPU 的训练已经不是新闻,数据中心的用电量正在成为 AGI 叙事本身。高盛预测全球数据中心用电到 2027 年增长 50%,到 2030 年增长 165%。电、芯片、散热、电网,这些过去看似基础设施的东西,现在直接决定模型迭代速度。

5. 具身智能与机器人

Altman 首次明确说 OpenAI”一定会做人形机器人”,世界模拟研究项目已经演变为 OpenAI Robotics。特斯拉 Optimus 年底量产,Figure 在宝马工厂完成半年验证。模型走出屏幕、进入物理世界,是 AGI 从”能思考”到”能行动”的下一步。

6. 长程记忆与连续工作

Altman 反复强调用户最想要的是记忆。Astra 在 Codex 里已经能跨上下文窗口保存笔记并搜索历史工具输出。下一步是千万级上下文、Agent 连续工作数天、记住你的偏好和项目状态。谁先把这个做到可用,谁就拿到个人助理的入口。

7. 评测方法论本身

ARC-AGI-3 99.9% 与 62.7% 的反差说明,比跑分更重要的,是我们怎么测。随着模型能力接近人类基线,现有 benchmark 会加速失效。新的评测需要考察真实任务完成度、成本、可靠性、安全边界,而不是一道道题的准确率。

六、AGI 时代不是开关,是一个过程

人机协作

我的看法是:GPT-6 Astra 是一次明显的代际提升,但”AGI 时代”更像是一个被精心选择的叙事时刻,而不是某个可以被单一测试认证的开关。

真正发生的,是 AI 的工作形态正在从”工具”变成”同事”。开发者从”写代码”变成”给目标 + 做审查”;企业从”按软件席位付费”变成”按 Agent 干的活付费”;个人助理从”帮你查天气”变成”记得住、知道何时该打扰你”。

这种转变会结构性改写几个行业:

领域正在发生的变化
编程开发模型分数已超过多数人类工程师;人的角色转向审查、目标拆解和质量把关
企业 AgentChatGPT 9 亿周活、5000 万付费用户,聊天不赚钱,能替人干活的 Agent 才是收费点
个人助理记忆和跨应用自主执行是胜负手,谷歌 Gemini Spark 已经在打这张牌
科学发现2025 年诺奖物理、化学双响给 AI;AlphaFold3、AI 辅助药物进临床
内容创作生成门槛崩塌,稀缺的不是技术,是品味和判断力
机器人Optimus 量产、Figure 进工厂,模型开始走出屏幕

模型能力溢出后,六个正在被改写的场景

做风控那些年我学到一点:工具越强大,把关的人越值钱。AI 能生成的东西越多,筛选、审核、背责的人就越稀缺。AGI 如果真来了,它不会取代所有人,而是会放大判断力的价值。

2026 年 9 月的这轮发布,像是一次行业级的”能力宣言”。但宣言不等于终点。接下来真正决定胜负的,不是谁能在某个 benchmark 上刷到更高分,而是谁能让 AI 在真实环境里连续、可靠、安全地把活干完,并且让别人愿意为这些结果买单。

AGI 时代也许还没有完整到来,但”Agent 替人干活”的时代,确实已经开了个头。

— 完 —

打开原图 ↗