GLM-5.3:国产模型跻身第一梯队,AA 智能指数 60 分、1M 上下文仅 $1.4/1M
古董级程序员,从大厂到创业公司,现在还在一线做 AI 相关开发。微信公众号「字与码」会继续更新工程实践、新技术判断,以及这些年踩过的坑。文章若对你有用,欢迎顺手关注。
2026 年 8 月 14 日智谱发布 GLM-5.3,8 月 19 日 API 正式上线。同一天,独立评测机构 Artificial Analysis 给出最新结果:GLM-5.3 (max) 智能指数 60 分,在 181 个模型中排名第 8,与 Moonshot 的 Kimi K3 并列开源模型第一,仅次于 Claude Opus 5(63 分)。
更值得注意的是它的价格没变:输入 $1.40/1M tokens、输出 $4.40/1M tokens,缓存命中仅 $0.68/1M。对中文开发者来说,这是一个「顶配能力 + 本土价格」的新选项。
一、一句话总结
GLM-5.3 用 与 GLM-5.2 相同的基础模型(743B 参数),通过一个月的后训练(强化学习规模扩展)把 AA 智能指数从 53 拉到 60,价格不变、上下文拉到 1M。它证明了国产模型已经能在全球第一梯队站稳脚跟,但 「非常啰嗦」的输出风格会让实际账单比标价更厚。
二、关键数据与排名
| 指标 | GLM-5.3 (max) | 备注 |
|---|---|---|
| 智能指数 | 60 分(8/181) | 与 Kimi K3 并列开源第一 |
| 排名参考 | Claude Opus 5 63,GPT-5.6 Sol 61,Claude Fable 5 61 | 第一梯队差距在 3 分以内 |
| 基础参数 | 743B(与 GLM-5.2 相同) | 提升来自后训练,非预训练重跑 |
| 输入价格 | $1.40 / 1M tokens | 低于中位 $1.75 |
| 输出价格 | $4.40 / 1M tokens | 远低于中位 $10.00 |
| 缓存折扣 | 81%($0.68 / 1M) | 长上下文、前缀稳定场景收益大 |
| 上下文 | 1M tokens | 与 DeepSeek V4 Pro、GPT-5.6 Sol 对齐 |
| 评测 verbose | 170M tokens | 中位 72M 的 2.4 倍,被评为「非常啰嗦」 |
AA 智能指数 v4.1.1 覆盖 9 类任务:agentic 真实工作、agentic 工具使用、终端编码、科学推理、研究生级科学问题、物理推理、知识可靠性/幻觉、长上下文推理等。GLM-5.3 的 60 分是这套评测 battery 的综合结果,总评测成本 $1,238.50。
三、三个「超出预期」
1. 后训练带来的跃升
智谱官方博客披露,GLM-5.3 的后训练聚焦「长程任务环境上的强化学习规模扩展」。结果是:
- Terminal-Bench 3.0:4.6 → 28.3
- DeepSWE v1.1:46.2 → 66.9
- GDPval-AA v2 Elo:+246 分,排名第二,仅次于 Claude Opus 5
这组数字说明:在基础模型不变的情况下,后训练仍能挤出大量能力。这也解释了为什么 GLM-5.3 能在参数没有跳升的情况下追上 Kimi K3。
2. 智能与价格的组合很能打
按 AA 的「单任务成本」测算,GLM-5.3 完成一次智能指数任务约 $0.68,Kimi K3 约 $0.84,Claude Opus 5 约 $2.34,GPT-5.6 Sol 约 $1.23。在同等智能水平下,GLM-5.3 的成本最低。
对中文团队来说,这意味着:以前要在「顶级能力」和「可负担价格」之间二选一,现在多了一个两者都占的选项。
3. 1M 上下文变成国产头部标配
DeepSeek V4 Pro、GPT-5.6 Sol 之后,GLM-5.3 也把上下文拉到 1M。百万级上下文已经从「旗舰溢价卖点」变成「入场券」。长文档处理、代码库级 agent、多轮记忆等场景的竞争将进一步白热化。
四、verbosity:被忽视的隐性成本
AA 评测中 GLM-5.3 生成了 170M tokens,是同类别中位 72M 的 2.4 倍,平均每项任务约 18,700 个输出 token,比 GLM-5.2 多 20%。
这对开发者意味着什么?
- 输出价格才是大头:GLM-5.3 输入便宜,但它输出的 token 多,实际账单会向输出侧倾斜。
- 端到端延迟增加:生成 18k tokens 即使速度再快,也需要更长的等待时间。
- 下游处理负担:如果输出进入另一个 agent 循环或需要二次解析,verbose 会放大整个链路的成本。
智谱可能用「更多思考 token」换来了更高的推理准确率,但对工程团队来说,必须做一件事:按实际任务测平均输出长度,再重新计算每任务成本,而不是只看 $1.40/$4.40 的标价。
五、什么时候该用 GLM-5.3
基于现有数据,GLM-5.3 适合这些场景:
- 复杂编码任务:后训练在 terminal/DeepSWE 上提升明显,适合长程代码生成与调试;
- 长上下文应用:1M 窗口 + 81% 缓存折扣,RAG、长文档分析、多轮对话的成本可控;
- 成本敏感的高智能需求:预算有限但需要接近 Claude/GPT 旗舰的能力;
- 中文场景:智谱在中文理解和国内合规/接入上的优势仍在。
但要注意:
- API 需要显式开启 thinking:低/高/max 三档,旧集成如果传
thinking=false会直接失败,迁移时要改调用代码; - 输出长度敏感场景先实测:实时对话、高频工具调用、agent 循环要重点测 verbose 程度;
- 权重尚未开源:智谱承诺发布两周后(约 8 月 28 日)开源权重,自部署团队可以等权重和许可明确后再决定。
六、国产模型格局变化
GLM-5.3 让国产头部模型的竞争格局更清晰:
- 智谱 GLM-5.3 与 Moonshot Kimi K3 在 AA 指数上并驾齐驱(60 分),但 GLM-5.3 价格只有 Kimi K3 的一半左右;
- DeepSeek、Qwen 仍在性价比和开源生态上保持压力;
- 闭源旗舰(Claude Opus 5、GPT-5.6 Sol)仍领先 1–3 分,但差距已经小到在很多真实任务中难以感知。
对开发者而言,2026 年的模型选型已经从「选一家押注」变成「按任务、按成本、按生态做多手准备」。
七、结语
GLM-5.3 标志着国产模型在「全球第一梯队」里又多了一个稳定席位。它用相同的基础模型、更激进的后训练、不变的定价,把智能指数抬到了 60 分,也把国产模型的性价比叙事往前推了一步。
但别被「$1.4/1M 输入」迷惑。verbose 的输出风格会让实际任务成本上浮 50% 以上。选型时,真正该看的不是标价,而是你的真实任务在真实输出长度下的每任务成本。智能、价格、verbosity 这三条曲线,GLM-5.3 占了前两条,第三条需要你用自己的 prompt 和采样参数去压。
信息来源
- Artificial Analysis:GLM-5.3 (max) — Intelligence, Performance & Price Analysis
- Unite.AI:GLM-5.3 Scores 60 on Artificial Analysis Intelligence Index, Matching Kimi K3(2026-08-19)
- OrcaRouter:GLM-5.3 Hits AA Index 60, Tying Kimi K3 for Top Open Weights
- KuCoin:GLM-5.3 AI Index Rises to 60, Matching Kimi K3
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。