英伟达 DGX Station 深度评测:748GB 统一内存,带宽到底是多少?
古董级程序员,从大厂到创业公司,现在还在一线做 AI 相关开发。微信公众号「字与码」会继续更新工程实践、新技术判断,以及这些年踩过的坑。文章若对你有用,欢迎顺手关注。
8 月 24 日,NVIDIA 那台在 GTC 2025 上亮相的桌面 AI 工作站,终于通过 OEM 伙伴正式开售,起售价 94,930 美元(约 63.8 万人民币)。它最大的卖点是 748GB 统一内存——但「统一内存」的带宽根本不能用一个数字回答。本文把这块内存池的带宽彻底拆开讲清楚,并给出一份不算客气的评价。
一句话结论:DGX Station 的 748GB 统一内存不是一块同速内存:GPU 侧 252GB HBM3e @ 7.1 TB/s(极快)、CPU 侧 496GB LPDDR5X @ 396 GB/s(慢 18 倍)、两者间 NVLink-C2C 900 GB/s 互联(GPU 访问 LPDDR5X 时走这条)。「统一内存」= 单一地址空间 + cache 一致性,并不等于「同一带宽」。
一、产品是什么:从机箱到芯片
先说清楚这台机器到底是什么样。DGX Station 是 NVIDIA 把数据中心级的 Grace Blackwell 硬件塞进一台塔式机箱的尝试。核心是一颗叫 GB300 Grace Blackwell Ultra Desktop Superchip 的封装:
- 一颗 72 核 Arm 架构 Grace CPU(Neoverse V2)
- 一颗 Blackwell Ultra GPU(20,480 个 CUDA 核心)
- 两者通过 NVLink-C2C 互联,组成一个 748GB 的相干(coherent)内存池
形态上是一台约 250×530×590mm 的塔机,电源 1600W,没有视频输出——GB300 是纯计算件,要接显示器必须额外加一张 RTX PRO 显卡。NVIDIA 不卖整机,只卖核心主板(CPU+GPU 已集成),由 ASUS、Dell、GIGABYTE、MSI、Supermicro、HP 等 OEM 各自做整机。
几个容易被忽略的细节:
| 关键时间点 / 决策 | 说明 |
|---|---|
| 发布时间 | GTC 2025(2025 年 3 月)公布,2026 年 8 月通过 OEM 正式开售 |
| 首批可购渠道 | Exxact Valence VWS-158270643 起售 $94,930;MSI XpertStation WS300(CDW 上架)$96,996 |
| 顶配价格 | Exxact 满配约 $108,350(加 RTX PRO 6000 + 2×2TB PCIe 5.0 SSD) |
| 操作系统 | DGX OS(基于 Ubuntu);另有「DGX Station for Windows」型号支持 WSL |
| 保修与订购 | 3 年保修;单次最多订 10 台,需走企业销售流程 |
| 电源 | 1600W 80+ Titanium,演示中有人直接接了 240V/20A 插座避免掉压 |
| 散热 | 液冷直触(Grace + Blackwell Ultra 直接液冷,顶部三把风扇辅助) |
二、核心规格一览
| 模块 | 规格 |
|---|---|
| 超级芯片 | GB300 Grace Blackwell Ultra Desktop Superchip |
| CPU | 72 核 NVIDIA Grace(Arm Neoverse V2) |
| GPU | NVIDIA Blackwell Ultra,20,480 CUDA 核心,第五代 Tensor Core |
| GPU 内存 | 252GB HBM3e,带宽 7.1 TB/s |
| CPU 内存 | 496GB LPDDR5X,带宽 396 GB/s |
| 统一内存 | 748GB 相干内存(GPU + CPU 同地址空间) |
| 互联 | NVLink-C2C,单向 900 GB/s(官方文档部分页亦写双向 1.8 TB/s) |
| AI 算力(FP4 稠密) | 约 20 PFLOPS |
| AI 算力(FP4 稀疏,规格表) | 最高 153 PFLOPS |
| FP8 / FP6 Tensor | 10 PFLOPS |
| FP16 / BF16 Tensor | 5 PFLOPS |
| INT8 Tensor | 330 TOPS |
| 网络 | ConnectX-8 SuperNIC,2× QSFP112 400GbE,最高 800 Gbps;另含 10GbE + 1GbE BMC |
| 存储 | 4× M.2 Gen5 NVMe |
| PCIe | 1× Gen5 x16 + 2× Gen5 x16(x8 电气) |
| MIG | 最高 7 个实例 |
| 整机功耗 | 1,600W |
| 支持的可视化 GPU | RTX PRO 2000 / 4000 / 6000 Workstation / 6000 Max-Q Blackwell |
⚠️ 注:官方部分页面把统一内存标成 784GB(= 252+532?),NVIDIA 开发文档和绝大多数第三方资料一致是 748GB(= 252+496)。以 748GB 为准。
三、重点:统一内存的带宽到底是多少
这是本文最关键的部分。如果只看 NVIDIA 营销页的「748GB 统一内存」,很容易以为这是一块 748GB 的同速大内存。但事实远不是这样。把它拆开看,是三档完全不同的带宽:
748GB 统一内存池 =
GPU 直访 HBM3e 252GB @ 7.1 TB/s (快)
| NVLink-C2C @ 900 GB/s (桥)
CPU 侧 LPDDR5X 496GB @ 396 GB/s (慢 18×)
拆开来解释:
- GPU 直接读自己的 HBM3e:7.1 TB/s。这是模型权重、KV cache、激活值应放的地方。7.1 TB/s 是什么概念?NVIDIA H200 是 4.8 TB/s,DGX Station 这 7.1 TB/s 比 H200 还快 48%,是消费级 RTX 5090(1.79 TB/s)的近 4 倍。
- GPU 读 CPU 那一侧的 LPDDR5X:经 NVLink-C2C,带宽 900 GB/s。注意——不是 7.1 TB/s,也不是 1.79+0.4 TB/s 简单相加。这 900 GB/s 是 C2C 单向带宽,NVIDIA 在某些官方文案里也写「双向 1.8 TB/s」,但同一个时钟周期里 GPU 一次只能走一边。
- CPU 自己读它的 LPDDR5X:396 GB/s。这是 Grace CPU 直连自己内存的带宽,是上面那两档里最慢的。

图 1 · 统一内存是两池一桥:HBM3e(快)+ LPDDR5X(慢)+ NVLink-C2C(桥)
关键认知:统一 ≠ 同速
「统一内存」(unified memory / coherent memory)的本意是单一地址空间 + cache 一致性,并不是「同一块同速内存」。Apple 的统一内存架构、AMD 的 APU、甚至老一点的 PS5,都是同一个套路:
- GPU 可以直接访问 CPU 那一侧的内存,不需要 CPU 介入——这是和「显存溢出就回退到 CPU 跑」的本质区别。
- 但访问速度取决于数据落在哪一档。落在 GPU 自家 HBM3e 里的数据,7.1 TB/s;落在 CPU 侧 LPDDR5X 里的数据,要先走过 C2C 桥,按 900 GB/s 计。
- 最慢的一档(LPDDR5X 396 GB/s)和最快的一档(HBM3e 7.1 TB/s)差 ~18 倍。这个差距就是「分层统一内存」的核心代价。
和普通工作站的差距:不在容量,在那条桥
普通 RTX 工作站遇到显存不够时,数据溢出走的是 PCIe Gen5 x16,约 64 GB/s,且常常要回退到 CPU 上执行算子,速度崩得很厉害。DGX Station 的 NVLink-C2C 是 900 GB/s,比 PCIe Gen5 x16 快 14 倍,更关键的是 GPU 仍然由自己执行 LPDDR5X 上的算子,不是「掉了」回 CPU。
这意味着什么?一个形象的比喻:
普通工作站的统一内存 = 把硬盘当内存用,慢得不能跑。 DGX Station 的统一内存 = 把 SSD 当内存用,慢但能跑。
理解了这一点,就理解了这台机器的真正卖点:不是「748GB 内存」这个容量数字,而是「大到离谱的内存容量 + 仍然由 GPU 直接算的能力」。
工程师视角:怎么确认你拿到的是真·统一内存
买回来第一件事,别急着跑模型,先用命令行把内存拓扑钉死。Grace 的 LPDDR5X 在系统里是一个独立的 NUMA 节点,和 GPU 通过 NVLink-C2C 相干连接;如果
nvidia-smi topo -m里看不到 CPU 与 GPU 之间的 NVLink 连接、或者numactl -H只看到一个节点,那多半是 OEM 把内存接成了普通 DDR,而不是 Grace 原生的统一内存——这时候 396 GB/s 的那一半带宽会直接蒸发。这一步的验证,比看任何营销页都重要。
对工程实操意味着什么:分层放置策略
把这套硬件用好,关键是把数据放对地方。类比 CPU 的 L1/L2/L3/主存分级:
| 数据 | 应放位置 | 原因 |
|---|---|---|
| 热点权重(频繁被算的层 / 活跃 MoE 专家) | HBM3e(7.1 TB/s) | 前向 + 反向每一步都访问,吞吐决定时延 |
| KV cache | HBM3e 优先 | 每生成一个 token 都要读 |
| 长尾专家 / 冷权重 / 数据集 | LPDDR5X(经 C2C 900 GB/s) | 被激活时才访问,可接受较慢吞吐 |
| 预处理流水线 / 临时激活 | LPDDR5X 即可 | 不直接进 GPU 热点循环 |
| 训练数据 / 嵌入表 | NVMe(PCIe Gen5 约 14 GB/s)+ CPU 内存缓存 | 不需要每步都访问 |
硬件给到这一层,使用者就要在软件里做相应的「分层调度」——vLLM、SGLang、TensorRT-LLM、DeepSpeed 等推理/训练框架在 2026 年陆续加上的 expert placement、KV cache offload、weight prefetch 等优化,本质上都是冲着这个分层来设计的。
四、这台机器能跑多大的模型
有了上面的带宽分层,就能反推哪些模型真正「跑得动」。下面是几组参考数字(仅权重占用,KV cache 和长上下文还要再加):
在 252GB HBM3e 干净场景(全速)
| 模型 | 规模 | 精度 | 权重占用 |
|---|---|---|---|
| Qwen3.5-122B-A10B | 122B | BF16 | ~250 GB |
| Qwen3 235B | 235B | 6-bit | ~202 GB |
| Qwen3.5-397B-A17B | 397B | 4-bit | ~237 GB |
| MinMax-M1 | 456B | 6-bit | ~194 GB |
| MinMax-M2.5 | 230B | 8-bit | ~243 GB |
这是 7.1 TB/s 全速档,能装下的模型上限基本就在 400B 量级 / 4–6 bit。
打开 748GB 统一内存池(含 LPDDR5X 段)
| 模型 | 规模 | 精度 | 权重占用 |
|---|---|---|---|
| MinMax-M1 | 456B | BF16 | ~457 GB |
| Qwen3.5-397B-A17B | 397B | 8-bit | ~428 GB |
| Qwen3-Coder-480B-A35B | 480B | 8-bit | ~548 GB |
| DeepSeek v3.1 | 671B | 8-bit | ~574 GB |
| GLM5 | 744B | 6-bit | ~645 GB |
| Kimi-K2.5 | ~1T | native int4 | ~595 GB |
这才是 DGX Station 真正的差异化:把单机能跑的模型规模从消费工作站的 ~70B / 服务器多卡的 ~400B 抬到了 671B–1T 量级。NVIDIA 官方宣称支持「最高 1 万亿参数模型」指的就是这一档。Llama 3.1 405B 严格 BF16 需 ~810GB 略超 748GB,下调到 NVFP4 就能装下。
横向对比一下,更直观:
| 方案 | 可用显存/内存 | FP4 算力 | 能跑的模型上限 |
|---|---|---|---|
| 单卡 RTX 5090 | 32 GB | 3.4 PFLOPS | ~32B 4-bit |
| 4× RTX PRO 6000 工作站 | 384 GB VRAM | 8 PFLOPS | ~70B BF16 / 405B 4-bit |
| DGX Spark(GB10) | 128 GB 统一 | 1 PFLOPS | ~70B 4-bit |
| DGX Station(GB300) | 748 GB 统一 | 20 PFLOPS | ~671B 8-bit / 1T int4 |
| HGX H200 8×SXM(数据中心) | 1128 GB HBM3e | 32 PFLOPS | 数 T 参数 |
五、算力、价格与生态
「20 PFLOPS」要怎么看
20 PFLOPS 是 FP4 稠密 下的数字,NVIDIA 规格表里 FP4 稀疏一档写到 153 PFLOPS,但「稀疏」在主流推理里基本不用(要符合 2:4 结构性稀疏才能加速)。所以 现实算力期望应按 20 PFLOPS FP4 估,对应到 FP8 是 10 PFLOPS,FP16 / BF16 是 5 PFLOPS,TF32 是 2.5 PFLOPS,FP32 是 80 TFLOPS,FP64 仅 1.3 TFLOPS。
这台机器的主打精度是 NVIDIA 力推的 NVFP4——号称接近 FP8 精度但内存占用少 1.8×。FP4 这条线软件生态还在成熟(vLLM、TensorRT-LLM、TransformerEngine 都在快速补齐),买回去后第一年可能要做不少精度适配工作。
现场演示的性能
DGX Station 的官方 demo:64 并发 agent 约 3,500 token/s,整机功耗约 900W;推到 128 并发 agent,功耗 ~1000W,但每个 agent 的 token/s 显著下降。这台机器的本质是「多用户 / 多 agent 并发」,不是单请求极限时延。要拿它当「最猛单机单请求」来用是错位使用。
钱
起售 $94,930(Exxact Valence 入门版),MSI XpertStation WS300 在 CDW 上架 $96,996,满配约 $108,350(含 RTX PRO 6000 + 2×2TB SSD)。约 63.8 万 – 78 万人民币,还没算 1600W 长期电费、机房散热、可能的 240V 专线改造。
六、评价:值不值得买
讲完规格和带宽,轮到给一个不算客气的评价。先说优点,再说坑,最后给一个我自己的判断。
✅ 这台机器真正厉害的地方
- 把「数据中心级」AI 算力塞进桌面——能本地跑 405B / 671B / 1T 级别模型,对不能上云、不能传数据出楼的场景(医疗、法律、金融、国防)是从 0 到 1 的突破。
- 架构连续性是真价值——在 DGX Station 上写的代码、做的小模型实验,迁到 GB300 NVL72 数据中心机架(72 GPU)不需要重写。这对「先本地原型、后上云」的团队是非常实在的工程优势,NVIDIA 把它定位为「迷你数据中心」是有道理的。
- 统一内存消除了 PCIe 瓶颈——GPU 直接算 748GB 池里的数据,对 MoE 模型的冷专家、长上下文 KV cache 是质变。这也是「DGX Spark(128GB)解决不了的事,DGX Station(748GB)能解决」的核心点。
- 数据主权 + 成本可预测——固定 capex + 电费替换云上的 per-token 计费,对持续高吞吐的内部 AI 服务,长期账是划算的。同时数据不出楼,合规审计直接做。
⚠️ 千万别忽略的坑
- 贵,且不是「越用越赚」。$95k 起步,63.8 万人民币起,1600W 长期电费。只有「7×24 高吞吐跑大模型」才回得了本;偶发调用远不如按 token 走云。Nvidia 自己的工作人员在 demo 时也说:「你得先买盒子,盒子不便宜。」
- 「20 PFLOPS」是 FP4 稀疏峰值,别当 FP16 算力看。FP16 / BF16 实际算力只有 5 PFLOPS,跟数据中心 H200/MI300 不是一个量级。这台机器是为 NVFP4 / FP8 推理和细粒度量化优化设计的,跑传统 FP16 训练速度不会让你惊艳。
- 「统一内存」不等于「同速内存」。LPDDR5X 那一半是 396 GB/s,HBM3e 是 7.1 TB/s,差 18 倍;GPU 走 C2C 访问 LPDDR5X 是 900 GB/s,比 HBM 又慢一个数量级。不会做「分层放置」的团队,会发现「把整个 405B 丢进 748GB」跑出来比想象的慢——这是这台机器最反直觉的地方。
- 是 headless 计算节点,不是工作站。没有视频输出,要加 RTX PRO 显卡才接显示器;1600W、液冷直触、有人得接 240V/20A 插座——它不会安静地待在你桌子下面,是塞在机房/实验室角落的一台「迷你机柜」。
- 软件生态还在追。FP4 推理、MoE 分层放置、KV cache offload、长上下文管理——这些 2026 年才陆续补齐。买回去第一年大概率要做工程优化,这不是开箱即用的高消费级体验。
我的判断
把这台机器放到 2026 年这个时间点看,DGX Station 标志着一类新产品的成立:个人超算。NVIDIA 的野心很清楚——把 AI 算力从云上拉回桌面和办公室,让 100B–1T 级别模型成为本地可执行的资产,而不是只有云厂商能跑的奢侈品。方向是对的。
但第一批买它的人,本质是**「买门票」:为架构连续性、为数据主权、为跑大模型的合规性付溢价。不是一个开发者的玩具,而是给有敏感数据 + 持续高吞吐 + 千亿级模型需求**的企业/实验室的「本地云」方案。
我特别想强调两件事:
- 真正决定你能榨出多少性能的是「分层放置策略」,不是硬件本身。硬件给到 7.1 TB/s / 900 GB/s / 396 GB/s 的三档,框架(vLLM、TensorRT-LLM、SGLang)需要在 2026–2027 年把这三档用对位置、用对缓存策略、用对预取。框架成熟度决定你买回去是「每天有回报的资产」还是「昂贵的展示品」。
- FP4 生态成熟度是隐藏门槛。今天真正能高效跑 NVFP4 的路径还窄,大部分现成 LLM 还是 FP16 / FP8 checkpoint。第一年的工程投入不小。买这台机器的团队,最好同时配备「愿意做精度适配」的工程师。
如果你是个人开发者、研究生、初创公司,这台机器不适合你——你需要的是云按需 + 4×RTX PRO 6000 工作站或者干脆租 GPU。如果你是金融/医疗/法律/政企的 AI 平台团队,且内部已有持续的大模型推理或细调负载,DGX Station 是 2026 年能买到的、唯一一台能让千亿级模型在你自己的机柜里跑起来的桌面级设备——63.8 万买这张门票,贵,但值不值看你账上那笔云推理费能不能在 12–18 个月内回本。
至于「桌面 AI 超算」这个品类能不能在 2027 年起变成主流硬件,软件生态的追赶速度比硬件迭代速度更重要。硬件 NVIDIA 已经把路铺到了 748GB + 20 PFLOPS,剩下的是 vLLM / SGLang / TensorRT-LLM / Hugging Face 这些框架,谁先把「分层统一内存 + FP4 推理 + 长上下文」三件事整合到一键启动里,谁就拿下了下一个周期。
信息来源
- NVIDIA 官方页面 DGX Station for Windows 与 DGX Station Development Guide(2026 年 8 月)
- 新浪科技 / 快科技《NVIDIA 最强台式机开卖!起售价 64 万元:光内存就有 748GB》,2026-08-24(来源:Exxact Valence VWS-158270643 报价)
- Exxact What Workloads Get the Most from NVIDIA DGX Station(2026)
- NVNexus / pi3g / aihola / PCMasterInsider 等多份 OEM 渠道规格汇总(2026-08)
- BuzzRAG: Nvidia’s DGX Station GB300: Desktop AI Agent Testing,2026-08(64/128 并发 agent 功耗与 token/s 数据)
- Guru3D: NVIDIA DGX Station GB300 Superchip Specifications and 748GB Unified Memory,2026
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。