英伟达 DGX Station 深度评测:748GB 统一内存,带宽到底是多少?
原创 · 约 29 分钟阅读 · 阅读 --

英伟达 DGX Station 深度评测:748GB 统一内存,带宽到底是多少?

作者: Alex Xiang


古董级程序员,从大厂到创业公司,现在还在一线做 AI 相关开发。微信公众号「字与码」会继续更新工程实践、新技术判断,以及这些年踩过的坑。文章若对你有用,欢迎顺手关注。

8 月 24 日,NVIDIA 那台在 GTC 2025 上亮相的桌面 AI 工作站,终于通过 OEM 伙伴正式开售,起售价 94,930 美元(约 63.8 万人民币)。它最大的卖点是 748GB 统一内存——但「统一内存」的带宽根本不能用一个数字回答。本文把这块内存池的带宽彻底拆开讲清楚,并给出一份不算客气的评价。

一句话结论:DGX Station 的 748GB 统一内存不是一块同速内存:GPU 侧 252GB HBM3e @ 7.1 TB/s(极快)、CPU 侧 496GB LPDDR5X @ 396 GB/s(慢 18 倍)、两者间 NVLink-C2C 900 GB/s 互联(GPU 访问 LPDDR5X 时走这条)。「统一内存」= 单一地址空间 + cache 一致性,并不等于「同一带宽」。

一、产品是什么:从机箱到芯片

先说清楚这台机器到底是什么样。DGX Station 是 NVIDIA 把数据中心级的 Grace Blackwell 硬件塞进一台塔式机箱的尝试。核心是一颗叫 GB300 Grace Blackwell Ultra Desktop Superchip 的封装:

  • 一颗 72 核 Arm 架构 Grace CPU(Neoverse V2)
  • 一颗 Blackwell Ultra GPU(20,480 个 CUDA 核心)
  • 两者通过 NVLink-C2C 互联,组成一个 748GB 的相干(coherent)内存池

形态上是一台约 250×530×590mm 的塔机,电源 1600W,没有视频输出——GB300 是纯计算件,要接显示器必须额外加一张 RTX PRO 显卡。NVIDIA 不卖整机,只卖核心主板(CPU+GPU 已集成),由 ASUS、Dell、GIGABYTE、MSI、Supermicro、HP 等 OEM 各自做整机。

几个容易被忽略的细节:

关键时间点 / 决策说明
发布时间GTC 2025(2025 年 3 月)公布,2026 年 8 月通过 OEM 正式开售
首批可购渠道Exxact Valence VWS-158270643 起售 $94,930;MSI XpertStation WS300(CDW 上架)$96,996
顶配价格Exxact 满配约 $108,350(加 RTX PRO 6000 + 2×2TB PCIe 5.0 SSD)
操作系统DGX OS(基于 Ubuntu);另有「DGX Station for Windows」型号支持 WSL
保修与订购3 年保修;单次最多订 10 台,需走企业销售流程
电源1600W 80+ Titanium,演示中有人直接接了 240V/20A 插座避免掉压
散热液冷直触(Grace + Blackwell Ultra 直接液冷,顶部三把风扇辅助)

二、核心规格一览

模块规格
超级芯片GB300 Grace Blackwell Ultra Desktop Superchip
CPU72 核 NVIDIA Grace(Arm Neoverse V2)
GPUNVIDIA Blackwell Ultra,20,480 CUDA 核心,第五代 Tensor Core
GPU 内存252GB HBM3e,带宽 7.1 TB/s
CPU 内存496GB LPDDR5X,带宽 396 GB/s
统一内存748GB 相干内存(GPU + CPU 同地址空间)
互联NVLink-C2C,单向 900 GB/s(官方文档部分页亦写双向 1.8 TB/s)
AI 算力(FP4 稠密)约 20 PFLOPS
AI 算力(FP4 稀疏,规格表)最高 153 PFLOPS
FP8 / FP6 Tensor10 PFLOPS
FP16 / BF16 Tensor5 PFLOPS
INT8 Tensor330 TOPS
网络ConnectX-8 SuperNIC,2× QSFP112 400GbE,最高 800 Gbps;另含 10GbE + 1GbE BMC
存储4× M.2 Gen5 NVMe
PCIe1× Gen5 x16 + 2× Gen5 x16(x8 电气)
MIG最高 7 个实例
整机功耗1,600W
支持的可视化 GPURTX PRO 2000 / 4000 / 6000 Workstation / 6000 Max-Q Blackwell

⚠️ 注:官方部分页面把统一内存标成 784GB(= 252+532?),NVIDIA 开发文档和绝大多数第三方资料一致是 748GB(= 252+496)。以 748GB 为准。

三、重点:统一内存的带宽到底是多少

这是本文最关键的部分。如果只看 NVIDIA 营销页的「748GB 统一内存」,很容易以为这是一块 748GB 的同速大内存。但事实远不是这样。把它拆开看,是三档完全不同的带宽:

748GB 统一内存池 =
GPU 直访 HBM3e 252GB @ 7.1 TB/s    (快)
  | NVLink-C2C @ 900 GB/s          (桥)
CPU 侧 LPDDR5X 496GB @ 396 GB/s    (慢 18×)

拆开来解释:

  1. GPU 直接读自己的 HBM3e:7.1 TB/s。这是模型权重、KV cache、激活值应放的地方。7.1 TB/s 是什么概念?NVIDIA H200 是 4.8 TB/s,DGX Station 这 7.1 TB/s 比 H200 还快 48%,是消费级 RTX 5090(1.79 TB/s)的近 4 倍。
  2. GPU 读 CPU 那一侧的 LPDDR5X:经 NVLink-C2C,带宽 900 GB/s。注意——不是 7.1 TB/s,也不是 1.79+0.4 TB/s 简单相加。这 900 GB/s 是 C2C 单向带宽,NVIDIA 在某些官方文案里也写「双向 1.8 TB/s」,但同一个时钟周期里 GPU 一次只能走一边。
  3. CPU 自己读它的 LPDDR5X:396 GB/s。这是 Grace CPU 直连自己内存的带宽,是上面那两档里最慢的。

统一内存的两个池 + 一座桥

图 1 · 统一内存是两池一桥:HBM3e(快)+ LPDDR5X(慢)+ NVLink-C2C(桥)

关键认知:统一 ≠ 同速

「统一内存」(unified memory / coherent memory)的本意是单一地址空间 + cache 一致性,并不是「同一块同速内存」。Apple 的统一内存架构、AMD 的 APU、甚至老一点的 PS5,都是同一个套路:

  • GPU 可以直接访问 CPU 那一侧的内存,不需要 CPU 介入——这是和「显存溢出就回退到 CPU 跑」的本质区别。
  • 但访问速度取决于数据落在哪一档。落在 GPU 自家 HBM3e 里的数据,7.1 TB/s;落在 CPU 侧 LPDDR5X 里的数据,要先走过 C2C 桥,按 900 GB/s 计。
  • 最慢的一档(LPDDR5X 396 GB/s)和最快的一档(HBM3e 7.1 TB/s)差 ~18 倍。这个差距就是「分层统一内存」的核心代价。

和普通工作站的差距:不在容量,在那条桥

普通 RTX 工作站遇到显存不够时,数据溢出走的是 PCIe Gen5 x16,约 64 GB/s,且常常要回退到 CPU 上执行算子,速度崩得很厉害。DGX Station 的 NVLink-C2C 是 900 GB/s,比 PCIe Gen5 x16 快 14 倍,更关键的是 GPU 仍然由自己执行 LPDDR5X 上的算子,不是「掉了」回 CPU。

这意味着什么?一个形象的比喻:

普通工作站的统一内存 = 把硬盘当内存用,慢得不能跑。 DGX Station 的统一内存 = 把 SSD 当内存用,慢但能跑。

理解了这一点,就理解了这台机器的真正卖点:不是「748GB 内存」这个容量数字,而是「大到离谱的内存容量 + 仍然由 GPU 直接算的能力」。

工程师视角:怎么确认你拿到的是真·统一内存

买回来第一件事,别急着跑模型,先用命令行把内存拓扑钉死。Grace 的 LPDDR5X 在系统里是一个独立的 NUMA 节点,和 GPU 通过 NVLink-C2C 相干连接;如果 nvidia-smi topo -m 里看不到 CPU 与 GPU 之间的 NVLink 连接、或者 numactl -H 只看到一个节点,那多半是 OEM 把内存接成了普通 DDR,而不是 Grace 原生的统一内存——这时候 396 GB/s 的那一半带宽会直接蒸发。这一步的验证,比看任何营销页都重要。

对工程实操意味着什么:分层放置策略

把这套硬件用好,关键是把数据放对地方。类比 CPU 的 L1/L2/L3/主存分级:

数据应放位置原因
热点权重(频繁被算的层 / 活跃 MoE 专家)HBM3e(7.1 TB/s)前向 + 反向每一步都访问,吞吐决定时延
KV cacheHBM3e 优先每生成一个 token 都要读
长尾专家 / 冷权重 / 数据集LPDDR5X(经 C2C 900 GB/s)被激活时才访问,可接受较慢吞吐
预处理流水线 / 临时激活LPDDR5X 即可不直接进 GPU 热点循环
训练数据 / 嵌入表NVMe(PCIe Gen5 约 14 GB/s)+ CPU 内存缓存不需要每步都访问

硬件给到这一层,使用者就要在软件里做相应的「分层调度」——vLLM、SGLang、TensorRT-LLM、DeepSpeed 等推理/训练框架在 2026 年陆续加上的 expert placement、KV cache offload、weight prefetch 等优化,本质上都是冲着这个分层来设计的。

四、这台机器能跑多大的模型

有了上面的带宽分层,就能反推哪些模型真正「跑得动」。下面是几组参考数字(仅权重占用,KV cache 和长上下文还要再加):

在 252GB HBM3e 干净场景(全速)

模型规模精度权重占用
Qwen3.5-122B-A10B122BBF16~250 GB
Qwen3 235B235B6-bit~202 GB
Qwen3.5-397B-A17B397B4-bit~237 GB
MinMax-M1456B6-bit~194 GB
MinMax-M2.5230B8-bit~243 GB

这是 7.1 TB/s 全速档,能装下的模型上限基本就在 400B 量级 / 4–6 bit

打开 748GB 统一内存池(含 LPDDR5X 段)

模型规模精度权重占用
MinMax-M1456BBF16~457 GB
Qwen3.5-397B-A17B397B8-bit~428 GB
Qwen3-Coder-480B-A35B480B8-bit~548 GB
DeepSeek v3.1671B8-bit~574 GB
GLM5744B6-bit~645 GB
Kimi-K2.5~1Tnative int4~595 GB

这才是 DGX Station 真正的差异化:把单机能跑的模型规模从消费工作站的 ~70B / 服务器多卡的 ~400B 抬到了 671B–1T 量级。NVIDIA 官方宣称支持「最高 1 万亿参数模型」指的就是这一档。Llama 3.1 405B 严格 BF16 需 ~810GB 略超 748GB,下调到 NVFP4 就能装下。

横向对比一下,更直观:

方案可用显存/内存FP4 算力能跑的模型上限
单卡 RTX 509032 GB3.4 PFLOPS~32B 4-bit
4× RTX PRO 6000 工作站384 GB VRAM8 PFLOPS~70B BF16 / 405B 4-bit
DGX Spark(GB10)128 GB 统一1 PFLOPS~70B 4-bit
DGX Station(GB300)748 GB 统一20 PFLOPS~671B 8-bit / 1T int4
HGX H200 8×SXM(数据中心)1128 GB HBM3e32 PFLOPS数 T 参数

五、算力、价格与生态

「20 PFLOPS」要怎么看

20 PFLOPS 是 FP4 稠密 下的数字,NVIDIA 规格表里 FP4 稀疏一档写到 153 PFLOPS,但「稀疏」在主流推理里基本不用(要符合 2:4 结构性稀疏才能加速)。所以 现实算力期望应按 20 PFLOPS FP4 估,对应到 FP8 是 10 PFLOPS,FP16 / BF16 是 5 PFLOPS,TF32 是 2.5 PFLOPS,FP32 是 80 TFLOPS,FP64 仅 1.3 TFLOPS。

这台机器的主打精度是 NVIDIA 力推的 NVFP4——号称接近 FP8 精度但内存占用少 1.8×。FP4 这条线软件生态还在成熟(vLLM、TensorRT-LLM、TransformerEngine 都在快速补齐),买回去后第一年可能要做不少精度适配工作。

现场演示的性能

DGX Station 的官方 demo:64 并发 agent 约 3,500 token/s,整机功耗约 900W;推到 128 并发 agent,功耗 ~1000W,但每个 agent 的 token/s 显著下降。这台机器的本质是「多用户 / 多 agent 并发」,不是单请求极限时延。要拿它当「最猛单机单请求」来用是错位使用。

起售 $94,930(Exxact Valence 入门版),MSI XpertStation WS300 在 CDW 上架 $96,996,满配约 $108,350(含 RTX PRO 6000 + 2×2TB SSD)。约 63.8 万 – 78 万人民币,还没算 1600W 长期电费、机房散热、可能的 240V 专线改造。

六、评价:值不值得买

讲完规格和带宽,轮到给一个不算客气的评价。先说优点,再说坑,最后给一个我自己的判断。

✅ 这台机器真正厉害的地方

  1. 把「数据中心级」AI 算力塞进桌面——能本地跑 405B / 671B / 1T 级别模型,对不能上云、不能传数据出楼的场景(医疗、法律、金融、国防)是从 0 到 1 的突破。
  2. 架构连续性是真价值——在 DGX Station 上写的代码、做的小模型实验,迁到 GB300 NVL72 数据中心机架(72 GPU)不需要重写。这对「先本地原型、后上云」的团队是非常实在的工程优势,NVIDIA 把它定位为「迷你数据中心」是有道理的。
  3. 统一内存消除了 PCIe 瓶颈——GPU 直接算 748GB 池里的数据,对 MoE 模型的冷专家、长上下文 KV cache 是质变。这也是「DGX Spark(128GB)解决不了的事,DGX Station(748GB)能解决」的核心点。
  4. 数据主权 + 成本可预测——固定 capex + 电费替换云上的 per-token 计费,对持续高吞吐的内部 AI 服务,长期账是划算的。同时数据不出楼,合规审计直接做。

⚠️ 千万别忽略的坑

  1. 贵,且不是「越用越赚」。$95k 起步,63.8 万人民币起,1600W 长期电费。只有「7×24 高吞吐跑大模型」才回得了本;偶发调用远不如按 token 走云。Nvidia 自己的工作人员在 demo 时也说:「你得先买盒子,盒子不便宜。」
  2. 「20 PFLOPS」是 FP4 稀疏峰值,别当 FP16 算力看。FP16 / BF16 实际算力只有 5 PFLOPS,跟数据中心 H200/MI300 不是一个量级。这台机器是为 NVFP4 / FP8 推理和细粒度量化优化设计的,跑传统 FP16 训练速度不会让你惊艳。
  3. 「统一内存」不等于「同速内存」。LPDDR5X 那一半是 396 GB/s,HBM3e 是 7.1 TB/s,差 18 倍;GPU 走 C2C 访问 LPDDR5X 是 900 GB/s,比 HBM 又慢一个数量级。不会做「分层放置」的团队,会发现「把整个 405B 丢进 748GB」跑出来比想象的慢——这是这台机器最反直觉的地方。
  4. 是 headless 计算节点,不是工作站。没有视频输出,要加 RTX PRO 显卡才接显示器;1600W、液冷直触、有人得接 240V/20A 插座——它不会安静地待在你桌子下面,是塞在机房/实验室角落的一台「迷你机柜」。
  5. 软件生态还在追。FP4 推理、MoE 分层放置、KV cache offload、长上下文管理——这些 2026 年才陆续补齐。买回去第一年大概率要做工程优化,这不是开箱即用的高消费级体验。

我的判断

把这台机器放到 2026 年这个时间点看,DGX Station 标志着一类新产品的成立:个人超算。NVIDIA 的野心很清楚——把 AI 算力从云上拉回桌面和办公室,让 100B–1T 级别模型成为本地可执行的资产,而不是只有云厂商能跑的奢侈品。方向是对的。

但第一批买它的人,本质是**「买门票」:为架构连续性、为数据主权、为跑大模型的合规性付溢价。不是一个开发者的玩具,而是给有敏感数据 + 持续高吞吐 + 千亿级模型需求**的企业/实验室的「本地云」方案。

我特别想强调两件事:

  1. 真正决定你能榨出多少性能的是「分层放置策略」,不是硬件本身。硬件给到 7.1 TB/s / 900 GB/s / 396 GB/s 的三档,框架(vLLM、TensorRT-LLM、SGLang)需要在 2026–2027 年把这三档用对位置、用对缓存策略、用对预取。框架成熟度决定你买回去是「每天有回报的资产」还是「昂贵的展示品」。
  2. FP4 生态成熟度是隐藏门槛。今天真正能高效跑 NVFP4 的路径还窄,大部分现成 LLM 还是 FP16 / FP8 checkpoint。第一年的工程投入不小。买这台机器的团队,最好同时配备「愿意做精度适配」的工程师。

如果你是个人开发者、研究生、初创公司,这台机器不适合你——你需要的是云按需 + 4×RTX PRO 6000 工作站或者干脆租 GPU。如果你是金融/医疗/法律/政企的 AI 平台团队,且内部已有持续的大模型推理或细调负载,DGX Station 是 2026 年能买到的、唯一一台能让千亿级模型在你自己的机柜里跑起来的桌面级设备——63.8 万买这张门票,贵,但值不值看你账上那笔云推理费能不能在 12–18 个月内回本。

至于「桌面 AI 超算」这个品类能不能在 2027 年起变成主流硬件,软件生态的追赶速度比硬件迭代速度更重要。硬件 NVIDIA 已经把路铺到了 748GB + 20 PFLOPS,剩下的是 vLLM / SGLang / TensorRT-LLM / Hugging Face 这些框架,谁先把「分层统一内存 + FP4 推理 + 长上下文」三件事整合到一键启动里,谁就拿下了下一个周期。

信息来源

  • NVIDIA 官方页面 DGX Station for WindowsDGX Station Development Guide(2026 年 8 月)
  • 新浪科技 / 快科技《NVIDIA 最强台式机开卖!起售价 64 万元:光内存就有 748GB》,2026-08-24(来源:Exxact Valence VWS-158270643 报价)
  • Exxact What Workloads Get the Most from NVIDIA DGX Station(2026)
  • NVNexus / pi3g / aihola / PCMasterInsider 等多份 OEM 渠道规格汇总(2026-08)
  • BuzzRAG: Nvidia’s DGX Station GB300: Desktop AI Agent Testing,2026-08(64/128 并发 agent 功耗与 token/s 数据)
  • Guru3D: NVIDIA DGX Station GB300 Superchip Specifications and 748GB Unified Memory,2026
打开原图 ↗