Cerebras CS-4:号称推理比 GPU 快 30 倍的「最快 AI 加速器」
原创 · 约 12 分钟阅读 · 阅读 --

Cerebras CS-4:号称推理比 GPU 快 30 倍的「最快 AI 加速器」

作者: Alex Xiang


古董级程序员,从大厂到创业公司,现在还在一线做 AI 相关开发。微信公众号「字与码」会继续更新工程实践、新技术判断,以及这些年踩过的坑。文章若对你有用,欢迎顺手关注。

2026 年 8 月 18 日,Cerebras 在旧金山发布新一代机架级 AI 加速系统 CS-4。官方给出的数字非常抓眼:推理速度比 GPU 系统最多快 30 倍,每瓦吞吐是上一代 CS-3 的 10 倍,对超过 10 万亿参数的模型仍能保持每秒 1000+ token 的交互式解码,晶圆间互联延迟低至 2 微秒

但发布会同一天,Cerebras 股价收跌 12.69%。市场显然在问同一个问题:这些数字到底能不能在真实负载里兑现?

一、一句话总结

CS-4 不是简单的「下一代芯片」,而是 Cerebras 把「晶圆级计算」从实验室推向超大规模数据中心的一次完整重构:三颗 WSE-3 Turbo 晶圆、Wafer-Scale Backpack 3D 封装、0.5mm 极致供电、无交换机晶圆直连。它在单用户延迟敏感型推理上确实可能大幅领先 GPU,但 30 倍是一个高度依赖工作负载的厂商口径,不是普适结论。

二、规格速览:数字背后的硬件现实

项目数据意味着什么
每系统芯片3 × WSE-3 Turbo单片晶圆即处理器,三片组成一个机架系统
单晶圆晶体管4 万亿目前公开披露的最大单片 AI 芯片
AI 核心90 万大量小核并行,适合稀疏/高并行推理模式
片上 SRAM44 GB / 晶圆大模型权重可驻留片上,减少外部 DRAM 访问
单晶圆算力250 PFLOPS三片合计 750 PFLOPS,是 CS-3 的 6 倍
内存带宽129.6 PB/s片上 SRAM 聚合带宽,远高于 GPU HBM 量级
晶圆间延迟2 µs跨机架晶圆直连,无需交换机
部署时间数小时Wafer-Scale Backpack 组件减少 50%,制造自动化提升 60%

这些数字里最关键的不是 PFLOPS,而是片上 SRAM 与晶圆级互联。现代 LLM 推理的瓶颈早已不是原始算力,而是把权重和 KV cache 搬到计算单元旁边的内存带宽与通信延迟。Cerebras 的思路是:与其用大量 GPU 通过 NVLink/IB 网络搬运数据,不如把模型摊在一片足够大的晶圆上,让通信距离从「机架级」缩到「晶圆级」。

三、30 倍是怎么来的:架构拆解

Cerebras 的 30 倍对比基于 GPT-OSS-120B 的内部测试,报告单用户每秒超过 4400 token。要理解这个数字,得看 CS-4 三个层面的创新。

1. Wafer-Scale Backpack:把服务器折叠成 3D 封装

传统 GPU 服务器是「主板 + 芯片 + 散热器 + 电源」的平面堆叠。CS-4 的 Wafer-Scale Backpack 把晶圆、电源转换、直接液冷、高速 I/O 和控制电路折叠成一个紧凑的 3D 组件,组件数量减少 50%。结果是制造更简单、部署从数天缩短到数小时,也方便后续升级(换个 backpack 即可,不用拆整机)。

2. 供电密度:把电源怼到芯片旁边

电源转换电路距离处理器仅 0.5 毫米,而传统 GPU 板约 50 毫米——近了约 100 倍。板级功率损耗被大幅压缩,WSE-3T 能获得两倍于常规的供电功率,从而跑在更高频率上。对 token 生成这种 latency-bound 任务,频率直接对应响应速度。

3. 无交换机晶圆互联:把「机架网络」变成「片上总线」

新的 Wafer I/O Module 支持 RoCE v2 RDMA over Ethernet,同时提供 Direct Wafer Links:晶圆之间可以不经过交换机直接互联,跨机架延迟 2 µs。对需要多晶圆分布的数十万亿参数模型,这意味着参数片之间的通信从「数据中心网络」降级为「片内总线延迟」,交互式解码才成为可能。

四、为什么 wafer-scale 在推理场景有优势

LLM 推理分为两个阶段:

  • Prefill:一次性处理整个 prompt,计算密集,适合高并行。
  • Decode:逐个生成 token,受限于内存带宽和串行依赖,很难靠堆 GPU 线性加速。

在 decode 阶段,GPU 集群通常要把权重从 HBM 读到 SM,生成一个 token 后再更新 KV cache,数据搬运会吃掉大量时间和能耗。CS-4 的 44 GB 片上 SRAM 可以把足够大的模型权重直接驻留晶圆内,晶圆内通信带宽 160.5 PB/s,几乎消除了「去内存取权重」的环节。这正是它能在单用户场景下做到超高 token/s 的核心原因。

换句话说,CS-4 不是比 GPU「算得更快」,而是比 GPU「搬得更少」。

五、争议与真实约束

官方数字再漂亮,工程师也得问几个硬问题。

30 倍是单用户场景,不是总吞吐。 Cerebras 对比的是「tokens-per-second-per-user」,即整机资源全部供给一个用户时的文本生成速度。如果换成高并发、大 batch 的在线服务,GPU 集群的总吞吐未必输。

基准来自厂商自测,第三方验证稀缺。 MLPerf 等独立基准是更可靠的参照。Cerebras 产品页自己也用小字注明:「Performance comparisons are based on third-party benchmarking or internal testing. Observed inference speed improvements versus GPU-based systems may vary depending on workload, configuration, date and models being tested.」

SRAM 的代价。 SRAM 比 DRAM 更快,但成本更高、结构更复杂、单片容量受限。44 GB 能放下 120B 模型的权重,但更大的模型(比如 1T+)仍然需要多晶圆分布或权重/激活卸载,优势会随模型规模变化。

生态仍是护城河。 vLLM、TensorRT-LLM、SGLang 这些 GPU 推理框架已经深度优化。Cerebras 的 SDK 和模型支持面能否跟上,决定了它能不能从「技术惊艳」走到「规模采用」。

市场用脚投票。 发布当天股价跌 12.69%,背景是 Q2 营收 1.8 亿美元低于分析师预期的 1.94 亿。投资者关心的不是峰值性能,而是能否从英伟达手里持续抢到份额。

六、对基础设施团队的启示

如果你负责 AI 基础设施选型,CS-4 提供了一条值得认真评估的新路径,但不要把它当成 GPU 的「全面替代」。

  • 延迟敏感型交互式应用(如高价值 copilot、实时 agent)是 CS-4 最可能出彩的场景;
  • 高并发批处理服务 still 需要按你的真实 batch、模型大小、KV cache 行为做 TCO 测算;
  • 云 vs 自建:CS-4 是机架级系统,更适合有自有数据中心或托管机房的大客户;
  • 软件迁移成本:评估 Cerebras 对目标模型和推理框架的支持,不要只看硬件 spec。

七、结语

CS-4 是晶圆级计算路线迄今为止最完整的产品化答卷。它用架构层面的整体重构(芯片、供电、互联、部署形态)挑战 GPU 在推理市场的统治地位,方向非常清晰:把推理的帕累托前沿从「高吞吐但高延迟」推向「高吞吐且可交互」。

但「30 倍」不是结论,而是起点。真正的验证将在第一批客户上线、第三方基准出炉、生态逐步完善之后才会清晰。对工程师来说,最务实的态度是:关注它,测试它,但不要在一份厂商 PPT 上押注整个推理栈。

信息来源

打开原图 ↗