H100的显存和带宽是多少?为什么适合大模型训练?

H100 SXM5 配备 80GB HBM3 显存,带宽 3.35 TB/s,L2 缓存 50MB,每 SM 共享内存最高 228KB。相比 A100 的 HBM2e(2,039 GB/s),H100 的显存带宽提升约 1.64 倍,能更高效地搬运模型权重、激活值和梯度,适合显存访问密集的大模型训练任务。H100 的算力规格可参考[《H100单卡算力是多少?8卡集群算力怎么算》]。

一、H100的显存和带宽规格

H100 SXM5 基于 NVIDIA Hopper 架构(GH100 芯片),其显存系统规格如下:

规格项 H100 SXM5 说明
显存类型 HBM3 第三代高带宽显存
显存容量 80GB 适合加载大模型
显存带宽 3.35 TB/s 数据搬运速率
HBM3 堆叠数 5 个 每个堆叠提供高带宽通道
内存控制器 10 × 512-bit 共 5,120-bit 接口宽度
L2 缓存 50MB A100 为 40MB
每 SM 共享内存 最高 228KB A100 为 164KB
每 SM L1+共享内存总量 256KB A100 为 192KB

以上数据来自 NVIDIA H100 官方产品页和 Hopper 架构技术博客。不同 NVIDIA 官方页面的标注口径可能存在差异(如部分中文资料中显存带宽标注为 3,000 GB/s);本文采用英文产品页数值,实际采购或租赁时,应以对应 SKU 和供应商规格为准。

二、HBM3是什么?和HBM2e有什么区别

HBM(High Bandwidth Memory) 是一种通过 3D 堆叠技术实现的显存,将多层 DRAM 芯片垂直堆叠并通过硅通孔(TSV)连接,在更小的物理面积上实现远高于传统 GDDR 显存的带宽。

HBM3 是 H100 采用的第三代 HBM 技术,相比 A100 使用的 HBM2e:

对比项 HBM2e(A100) HBM3(H100)
每引脚数据速率 约 3.2 Gbps/pin 约 6.4 Gbps/pin
堆叠数 5 个 5 个
总带宽 2,039 GB/s 3,350 GB/s(3.35 TB/s)
单堆叠容量 约 16GB 约 16GB
接口宽度 5,120-bit 5,120-bit
工艺 第二代 第三代

HBM3 的主要提升在单 pin 数据速率:JEDEC 标称上限为 6.4 Gbps(HBM2e 为 3.2 Gbps),H100 实际运行约 5.2 Gbps。两者均为 5 个堆叠,H100 的总带宽提升来自 HBM3 更高的数据速率,而非堆叠数差异。

NVIDIA 在 Hopper 架构博客中将 H100 的显存带宽描述为"超过 3 TB/s",并称其相对 A100 的带宽提升接近 2 倍。从峰值规格看,H100 SXM5 的 3,350 GB/s 与 A100 80GB SXM 的 2,039 GB/s 的比值约为 1.64 倍。NVIDIA 在 Hopper 架构文章中概括为"近 2 倍",两种说法的参照 SKU 与标注口径不同,比较时应以具体规格表为准。

三、H100的显存层级结构

H100 的显存系统不是单一的"HBM3",而是一个多层级存储体系,从远到近依次为:

层级 容量 相对延迟(需实测) 作用
HBM3 显存 80GB 约 400-600 周期* 存储模型权重、激活值、梯度、优化器状态
L2 缓存 50MB 约 200 周期* 缓存频繁访问的数据,减少 HBM3 访问
L1/共享内存 256KB/SM 约 30 周期* SM 内部数据复用,kernel 层面缓存
寄存器 65,536 个 32-bit 寄存器/SM 约 1 周期* 最快,SM 直接访问

*延迟为行业经验值,具体以实际 microbenchmark 为准。

训练过程中,数据从 HBM3 经 L2 缓存加载到共享内存和寄存器供 SM 计算使用。层级越近,访问越快但容量越小。H100 相比 A100 在 L2 缓存(50MB vs 40MB)和共享内存(228KB vs 164KB)上都有提升,有助于减少数据从 HBM3 到 SM 的搬运次数。

四、为什么H100的显存系统适合大模型训练

大模型训练中,显存系统的性能往往和计算性能同等重要。H100 的显存系统在以下方面有利于训练:

1. 80GB 显存容量

训练一个大模型需要在显存中存储以下内容:

数据类型 占用空间(混合精度训练) 说明
模型权重 参数量 × 2 字节 FP16/BF16 权重,如 70B 模型约 140GB
梯度 参数量 × 2 字节 FP16/BF16 梯度,与权重大小相同
FP32 主权重副本 参数量 × 4 字节 混合精度训练中的 FP32 权重副本
优化器状态(Adam) 参数量 × 8 字节 FP32 的 momentum 和 variance
激活值 取决于 batch 和序列长度 正向传播中间结果

以 70B 参数模型为例,完整训练状态(权重 2 + 梯度 2 + 主权重 4 + Adam 8 = 16 字节/参数)约需 1,120GB,远超单卡 80GB。但 80GB 显存可以通过模型并行(tensor parallel、pipeline parallel)和 ZeRO 等技术分摊到多卡上。相比 A100 的 80GB,H100 的显存容量相同,但更高的带宽使数据搬运更高效。

2. 3.35 TB/s 显存带宽

大模型训练的很多操作是显存带宽密集型的:

  • 权重加载。前向和反向传播会产生大量权重访问;当访问无法由缓存充分复用时,更高的 HBM3 带宽有助于缩短数据搬运时间。
  • 激活值读写。前向传播写入激活值,反向传播读取激活值计算梯度。大模型的激活值通常很大,带宽直接影响这一步骤的效率。
  • 梯度更新。反向传播计算出的梯度需要写回 HBM3,优化器读取梯度更新权重,这一过程涉及大量显存读写。
  • 显存访问密集型算子。LayerNorm、Softmax 等算子常具有较强访存特征;Attention 的瓶颈则取决于序列长度、batch 和实现方式。在受显存带宽限制的场景中,更高带宽有助于提升性能。

H100 的 3.35 TB/s 带宽相对 A100 的 2,039 GB/s 提升约 1.64 倍,在显存带宽成为瓶颈的训练阶段可能带来明显收益。但实际收益取决于模型架构、精度、batch size、并行策略和框架实现,不能简单按带宽比例推算训练加速比。

3. 50MB L2 缓存

L2 缓存位于 HBM3 和 SM 之间,缓存频繁访问的数据。H100 的 L2 缓存为 50MB,比 A100 的 40MB 增加 25%。更大的 L2 缓存可以:

  • 减少对 HBM3 的重复访问,降低延迟和功耗
  • 提高矩阵乘法中 tile 数据的复用效率
  • 在多 SM 并行时减少 L2 缓存未命中率

4. 228KB 共享内存

H100 每 SM 的共享内存最高可配置为 228KB(A100 为 164KB),提升约 39%。共享内存是 SM 内部的高速缓存,对 kernel 性能有直接影响:

  • 矩阵乘法(GEMM)的 tile 数据可以存储在共享内存中复用
  • Attention 计算中的 Q、K、V 矩阵分块可以在共享内存中操作
  • 更大的共享内存允许使用更大的 tile,减少全局显存访问次数

五、H100与A100的显存对比

对比项 H100 SXM5 A100 80GB SXM 变化
显存类型 HBM3 HBM2e 代际升级
显存容量 80GB 80GB 相同
显存带宽 3,350 GB/s 2,039 GB/s 约 1.64 倍
L2 缓存 50MB 40MB 1.25 倍
每 SM 共享内存 228KB 164KB 约 1.39 倍
每 SM L1+共享总量 256KB 192KB 约 1.33 倍
TDP 700W 400W 更高功耗

H100 和 A100 80GB 的显存容量相同(均为 80GB),H100 的优势在带宽和缓存层级。对于能装入 80GB 显存的模型,H100 的更高带宽和更大缓存通常能加速显存访问密集型训练操作;但如果训练任务主要受计算限制(如大规模矩阵乘法占主导),显存带宽的提升对整体训练速度的影响可能有限。

六、SXM与PCIe版本的显存差异

H100 有 SXM 和 PCIe 两种形态,显存配置存在差异:

对比项 H100 SXM5 H100 PCIe
显存容量 80GB HBM3 80GB HBM2e
显存带宽 3.35 TB/s 2 TB/s
TDP 700W 350W
NVLink 900 GB/s(SXM 的 NVLink 互连规格;多卡互联能力取决于服务器/NVSwitch 拓扑) 支持 NVLink 桥接(600 GB/s,最高 2 卡;桥接配置以板卡厂商资料为准)

H100 PCIe 采用 80GB HBM2e,架构文章列出的显存带宽为 2 TB/s(约 SXM5 的 60%)。PCIe 版本支持 NVLink 桥接互联(600 GB/s,最高 2 卡),具体桥接配置以板卡和服务器厂商资料为准;SXM5 的 NVLink 互连规格为 900 GB/s,HGX/DGX 等配备 NVSwitch 的系统可实现多卡互联。对于显存带宽敏感的训练任务,SXM5 版本更适合;PCIe 版本适合推理部署或对带宽不敏感的场景。SXM 与 PCIe 的详细差异可参考后续文章。

七、在立方云上怎么选

立方云当前页面列出 H100 80G SXM5 的 8 卡按月方案,页面标注显存带宽为 3.0 TB/s。实例形态、具体规格、计费方式和可用库存以控制台展示为准。


本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 GPU 规格与计费方式,可前往 lifangyun.com 查看。

八、常见问题

1. H100的显存带宽比A100快多少?

从官方峰值口径看,H100 SXM5 的显存带宽为 3,350 GB/s,A100 80GB SXM 为 2,039 GB/s,比值约为 1.64 倍。NVIDIA 在架构博客中描述为"接近 2 倍"。实际训练中的有效带宽提升取决于模型、精度、batch size、并行策略和框架实现,不能简单按理论峰值比例推算。

2. H100的80GB显存能装多大的模型?

以 FP16 精度为例,70B 参数模型权重约需 140GB,单卡 80GB 放不下,需要多卡并行或量化。30B 参数模型的 FP16 权重约需 60GB,单卡 80GB 理论上可加载;实际可用性还需结合上下文长度、并发、KV Cache、框架开销和任务类型评估。更多信息可参考《A100 40G和80G版本有什么区别?显存怎么选》中的显存估算方法。

3. HBM3和HBM2e有什么区别?

HBM3 是第三代高带宽显存,相比 A100 使用的 HBM2e,主要提升在单 pin 数据速率:JEDEC 标称 6.4 Gbps vs 3.2 Gbps,H100 实际运行约 5.2 Gbps。H100 和 A100 均使用 5 个堆叠,H100 的总带宽提升来自 HBM3 更高的数据速率。

4. H100的L2缓存有多大?

H100 的 L2 缓存为 50MB,比 A100 的 40MB 增加 25%。更大的 L2 缓存可以减少对 HBM3 的重复访问,提高数据复用效率,尤其在矩阵乘法和 attention 计算中。

5. H100 SXM和PCIe的显存一样吗?

容量相同(均为 80GB),但显存类型和带宽不同。SXM5 为 HBM3、3.35 TB/s,PCIe 为 HBM2e、2 TB/s。NVLink 方面,SXM5 的 NVLink 互连规格为 900 GB/s,HGX/DGX 等配备 NVSwitch 的系统可实现多卡互联;PCIe 支持 NVLink 桥接互联(600 GB/s,最高 2 卡),具体配置以板卡厂商资料为准。对于显存带宽敏感的训练任务,SXM5 版本更适合;PCIe 版本适合推理部署或对带宽不敏感的场景。