Cerebras CS-4:号称推理比 GPU 快 30 倍的「最快 AI 加速器」
古董级程序员,从大厂到创业公司,现在还在一线做 AI 相关开发。微信公众号「字与码」会继续更新工程实践、新技术判断,以及这些年踩过的坑。文章若对你有用,欢迎顺手关注。
2026 年 8 月 18 日,Cerebras 在旧金山发布新一代机架级 AI 加速系统 CS-4。官方给出的数字非常抓眼:推理速度比 GPU 系统最多快 30 倍,每瓦吞吐是上一代 CS-3 的 10 倍,对超过 10 万亿参数的模型仍能保持每秒 1000+ token 的交互式解码,晶圆间互联延迟低至 2 微秒。
但发布会同一天,Cerebras 股价收跌 12.69%。市场显然在问同一个问题:这些数字到底能不能在真实负载里兑现?
一、一句话总结
CS-4 不是简单的「下一代芯片」,而是 Cerebras 把「晶圆级计算」从实验室推向超大规模数据中心的一次完整重构:三颗 WSE-3 Turbo 晶圆、Wafer-Scale Backpack 3D 封装、0.5mm 极致供电、无交换机晶圆直连。它在单用户延迟敏感型推理上确实可能大幅领先 GPU,但 30 倍是一个高度依赖工作负载的厂商口径,不是普适结论。
二、规格速览:数字背后的硬件现实
| 项目 | 数据 | 意味着什么 |
|---|---|---|
| 每系统芯片 | 3 × WSE-3 Turbo | 单片晶圆即处理器,三片组成一个机架系统 |
| 单晶圆晶体管 | 4 万亿 | 目前公开披露的最大单片 AI 芯片 |
| AI 核心 | 90 万 | 大量小核并行,适合稀疏/高并行推理模式 |
| 片上 SRAM | 44 GB / 晶圆 | 大模型权重可驻留片上,减少外部 DRAM 访问 |
| 单晶圆算力 | 250 PFLOPS | 三片合计 750 PFLOPS,是 CS-3 的 6 倍 |
| 内存带宽 | 129.6 PB/s | 片上 SRAM 聚合带宽,远高于 GPU HBM 量级 |
| 晶圆间延迟 | 2 µs | 跨机架晶圆直连,无需交换机 |
| 部署时间 | 数小时 | Wafer-Scale Backpack 组件减少 50%,制造自动化提升 60% |
这些数字里最关键的不是 PFLOPS,而是片上 SRAM 与晶圆级互联。现代 LLM 推理的瓶颈早已不是原始算力,而是把权重和 KV cache 搬到计算单元旁边的内存带宽与通信延迟。Cerebras 的思路是:与其用大量 GPU 通过 NVLink/IB 网络搬运数据,不如把模型摊在一片足够大的晶圆上,让通信距离从「机架级」缩到「晶圆级」。
三、30 倍是怎么来的:架构拆解
Cerebras 的 30 倍对比基于 GPT-OSS-120B 的内部测试,报告单用户每秒超过 4400 token。要理解这个数字,得看 CS-4 三个层面的创新。
1. Wafer-Scale Backpack:把服务器折叠成 3D 封装
传统 GPU 服务器是「主板 + 芯片 + 散热器 + 电源」的平面堆叠。CS-4 的 Wafer-Scale Backpack 把晶圆、电源转换、直接液冷、高速 I/O 和控制电路折叠成一个紧凑的 3D 组件,组件数量减少 50%。结果是制造更简单、部署从数天缩短到数小时,也方便后续升级(换个 backpack 即可,不用拆整机)。
2. 供电密度:把电源怼到芯片旁边
电源转换电路距离处理器仅 0.5 毫米,而传统 GPU 板约 50 毫米——近了约 100 倍。板级功率损耗被大幅压缩,WSE-3T 能获得两倍于常规的供电功率,从而跑在更高频率上。对 token 生成这种 latency-bound 任务,频率直接对应响应速度。
3. 无交换机晶圆互联:把「机架网络」变成「片上总线」
新的 Wafer I/O Module 支持 RoCE v2 RDMA over Ethernet,同时提供 Direct Wafer Links:晶圆之间可以不经过交换机直接互联,跨机架延迟 2 µs。对需要多晶圆分布的数十万亿参数模型,这意味着参数片之间的通信从「数据中心网络」降级为「片内总线延迟」,交互式解码才成为可能。
四、为什么 wafer-scale 在推理场景有优势
LLM 推理分为两个阶段:
- Prefill:一次性处理整个 prompt,计算密集,适合高并行。
- Decode:逐个生成 token,受限于内存带宽和串行依赖,很难靠堆 GPU 线性加速。
在 decode 阶段,GPU 集群通常要把权重从 HBM 读到 SM,生成一个 token 后再更新 KV cache,数据搬运会吃掉大量时间和能耗。CS-4 的 44 GB 片上 SRAM 可以把足够大的模型权重直接驻留晶圆内,晶圆内通信带宽 160.5 PB/s,几乎消除了「去内存取权重」的环节。这正是它能在单用户场景下做到超高 token/s 的核心原因。
换句话说,CS-4 不是比 GPU「算得更快」,而是比 GPU「搬得更少」。
五、争议与真实约束
官方数字再漂亮,工程师也得问几个硬问题。
30 倍是单用户场景,不是总吞吐。 Cerebras 对比的是「tokens-per-second-per-user」,即整机资源全部供给一个用户时的文本生成速度。如果换成高并发、大 batch 的在线服务,GPU 集群的总吞吐未必输。
基准来自厂商自测,第三方验证稀缺。 MLPerf 等独立基准是更可靠的参照。Cerebras 产品页自己也用小字注明:「Performance comparisons are based on third-party benchmarking or internal testing. Observed inference speed improvements versus GPU-based systems may vary depending on workload, configuration, date and models being tested.」
SRAM 的代价。 SRAM 比 DRAM 更快,但成本更高、结构更复杂、单片容量受限。44 GB 能放下 120B 模型的权重,但更大的模型(比如 1T+)仍然需要多晶圆分布或权重/激活卸载,优势会随模型规模变化。
生态仍是护城河。 vLLM、TensorRT-LLM、SGLang 这些 GPU 推理框架已经深度优化。Cerebras 的 SDK 和模型支持面能否跟上,决定了它能不能从「技术惊艳」走到「规模采用」。
市场用脚投票。 发布当天股价跌 12.69%,背景是 Q2 营收 1.8 亿美元低于分析师预期的 1.94 亿。投资者关心的不是峰值性能,而是能否从英伟达手里持续抢到份额。
六、对基础设施团队的启示
如果你负责 AI 基础设施选型,CS-4 提供了一条值得认真评估的新路径,但不要把它当成 GPU 的「全面替代」。
- 延迟敏感型交互式应用(如高价值 copilot、实时 agent)是 CS-4 最可能出彩的场景;
- 高并发批处理服务 still 需要按你的真实 batch、模型大小、KV cache 行为做 TCO 测算;
- 云 vs 自建:CS-4 是机架级系统,更适合有自有数据中心或托管机房的大客户;
- 软件迁移成本:评估 Cerebras 对目标模型和推理框架的支持,不要只看硬件 spec。
七、结语
CS-4 是晶圆级计算路线迄今为止最完整的产品化答卷。它用架构层面的整体重构(芯片、供电、互联、部署形态)挑战 GPU 在推理市场的统治地位,方向非常清晰:把推理的帕累托前沿从「高吞吐但高延迟」推向「高吞吐且可交互」。
但「30 倍」不是结论,而是起点。真正的验证将在第一批客户上线、第三方基准出炉、生态逐步完善之后才会清晰。对工程师来说,最务实的态度是:关注它,测试它,但不要在一份厂商 PPT 上押注整个推理栈。
信息来源
- Cerebras 官方:Introducing CS-4: The Fastest AI Accelerator in the Industry(2026-08-19)
- Cerebras 博客:Introducing Cerebras CS-4: The Fastest AI Just Got Faster(2026-08-19)
- Hacker News 讨论:Cerebras CS-4
- 财联社:Cerebras 推出 CS-4 系统强势对标英伟达(2026-08-19)
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。