GLM-5.3:国产模型跻身第一梯队,AA 智能指数 60 分、1M 上下文仅 $1.4/1M
原创 · 约 12 分钟阅读 · 阅读 --

GLM-5.3:国产模型跻身第一梯队,AA 智能指数 60 分、1M 上下文仅 $1.4/1M

作者: Alex Xiang


古董级程序员,从大厂到创业公司,现在还在一线做 AI 相关开发。微信公众号「字与码」会继续更新工程实践、新技术判断,以及这些年踩过的坑。文章若对你有用,欢迎顺手关注。

2026 年 8 月 14 日智谱发布 GLM-5.3,8 月 19 日 API 正式上线。同一天,独立评测机构 Artificial Analysis 给出最新结果:GLM-5.3 (max) 智能指数 60 分,在 181 个模型中排名第 8,与 Moonshot 的 Kimi K3 并列开源模型第一,仅次于 Claude Opus 5(63 分)。

更值得注意的是它的价格没变:输入 $1.40/1M tokens、输出 $4.40/1M tokens,缓存命中仅 $0.68/1M。对中文开发者来说,这是一个「顶配能力 + 本土价格」的新选项。

一、一句话总结

GLM-5.3 用 与 GLM-5.2 相同的基础模型(743B 参数),通过一个月的后训练(强化学习规模扩展)把 AA 智能指数从 53 拉到 60,价格不变、上下文拉到 1M。它证明了国产模型已经能在全球第一梯队站稳脚跟,但 「非常啰嗦」的输出风格会让实际账单比标价更厚

二、关键数据与排名

指标GLM-5.3 (max)备注
智能指数60 分(8/181)与 Kimi K3 并列开源第一
排名参考Claude Opus 5 63,GPT-5.6 Sol 61,Claude Fable 5 61第一梯队差距在 3 分以内
基础参数743B(与 GLM-5.2 相同)提升来自后训练,非预训练重跑
输入价格$1.40 / 1M tokens低于中位 $1.75
输出价格$4.40 / 1M tokens远低于中位 $10.00
缓存折扣81%($0.68 / 1M)长上下文、前缀稳定场景收益大
上下文1M tokens与 DeepSeek V4 Pro、GPT-5.6 Sol 对齐
评测 verbose170M tokens中位 72M 的 2.4 倍,被评为「非常啰嗦」

AA 智能指数 v4.1.1 覆盖 9 类任务:agentic 真实工作、agentic 工具使用、终端编码、科学推理、研究生级科学问题、物理推理、知识可靠性/幻觉、长上下文推理等。GLM-5.3 的 60 分是这套评测 battery 的综合结果,总评测成本 $1,238.50。

三、三个「超出预期」

1. 后训练带来的跃升

智谱官方博客披露,GLM-5.3 的后训练聚焦「长程任务环境上的强化学习规模扩展」。结果是:

  • Terminal-Bench 3.0:4.6 → 28.3
  • DeepSWE v1.1:46.2 → 66.9
  • GDPval-AA v2 Elo:+246 分,排名第二,仅次于 Claude Opus 5

这组数字说明:在基础模型不变的情况下,后训练仍能挤出大量能力。这也解释了为什么 GLM-5.3 能在参数没有跳升的情况下追上 Kimi K3。

2. 智能与价格的组合很能打

按 AA 的「单任务成本」测算,GLM-5.3 完成一次智能指数任务约 $0.68,Kimi K3 约 $0.84,Claude Opus 5 约 $2.34,GPT-5.6 Sol 约 $1.23。在同等智能水平下,GLM-5.3 的成本最低。

对中文团队来说,这意味着:以前要在「顶级能力」和「可负担价格」之间二选一,现在多了一个两者都占的选项。

3. 1M 上下文变成国产头部标配

DeepSeek V4 Pro、GPT-5.6 Sol 之后,GLM-5.3 也把上下文拉到 1M。百万级上下文已经从「旗舰溢价卖点」变成「入场券」。长文档处理、代码库级 agent、多轮记忆等场景的竞争将进一步白热化。

四、verbosity:被忽视的隐性成本

AA 评测中 GLM-5.3 生成了 170M tokens,是同类别中位 72M 的 2.4 倍,平均每项任务约 18,700 个输出 token,比 GLM-5.2 多 20%。

这对开发者意味着什么?

  • 输出价格才是大头:GLM-5.3 输入便宜,但它输出的 token 多,实际账单会向输出侧倾斜。
  • 端到端延迟增加:生成 18k tokens 即使速度再快,也需要更长的等待时间。
  • 下游处理负担:如果输出进入另一个 agent 循环或需要二次解析,verbose 会放大整个链路的成本。

智谱可能用「更多思考 token」换来了更高的推理准确率,但对工程团队来说,必须做一件事:按实际任务测平均输出长度,再重新计算每任务成本,而不是只看 $1.40/$4.40 的标价。

五、什么时候该用 GLM-5.3

基于现有数据,GLM-5.3 适合这些场景:

  • 复杂编码任务:后训练在 terminal/DeepSWE 上提升明显,适合长程代码生成与调试;
  • 长上下文应用:1M 窗口 + 81% 缓存折扣,RAG、长文档分析、多轮对话的成本可控;
  • 成本敏感的高智能需求:预算有限但需要接近 Claude/GPT 旗舰的能力;
  • 中文场景:智谱在中文理解和国内合规/接入上的优势仍在。

但要注意:

  • API 需要显式开启 thinking:低/高/max 三档,旧集成如果传 thinking=false 会直接失败,迁移时要改调用代码;
  • 输出长度敏感场景先实测:实时对话、高频工具调用、agent 循环要重点测 verbose 程度;
  • 权重尚未开源:智谱承诺发布两周后(约 8 月 28 日)开源权重,自部署团队可以等权重和许可明确后再决定。

六、国产模型格局变化

GLM-5.3 让国产头部模型的竞争格局更清晰:

  • 智谱 GLM-5.3Moonshot Kimi K3 在 AA 指数上并驾齐驱(60 分),但 GLM-5.3 价格只有 Kimi K3 的一半左右;
  • DeepSeek、Qwen 仍在性价比和开源生态上保持压力;
  • 闭源旗舰(Claude Opus 5、GPT-5.6 Sol)仍领先 1–3 分,但差距已经小到在很多真实任务中难以感知。

对开发者而言,2026 年的模型选型已经从「选一家押注」变成「按任务、按成本、按生态做多手准备」。

七、结语

GLM-5.3 标志着国产模型在「全球第一梯队」里又多了一个稳定席位。它用相同的基础模型、更激进的后训练、不变的定价,把智能指数抬到了 60 分,也把国产模型的性价比叙事往前推了一步。

但别被「$1.4/1M 输入」迷惑。verbose 的输出风格会让实际任务成本上浮 50% 以上。选型时,真正该看的不是标价,而是你的真实任务在真实输出长度下的每任务成本。智能、价格、verbosity 这三条曲线,GLM-5.3 占了前两条,第三条需要你用自己的 prompt 和采样参数去压。

信息来源

打开原图 ↗