H100和H200性能差多少?训练和推理该怎么选?
H200 SXM 与 H100 SXM 的计算核心完全相同(同为 GH100 满规),Tensor Core 算力一致;H200 的主要优势在显存系统,包括更大的显存容量和更高的显存带宽——容量从 80GB 提升到 141GB(约 1.76 倍),带宽从 3.35 TB/s 提升到 4.8 TB/s(约 1.43 倍)。训练和推理是否选 H200,取决于任务是计算受限还是显存受限。关于 H20、H100、H200 三款 GPU 的定位差异,可参考《H20、H100、H200有什么区别?一张表看懂定位》。
一、H100和H200的核心差异
H100 和 H200 均基于 NVIDIA Hopper 架构(GH100 芯片),共享相同的计算核心设计。三款 GPU(含 H20)的整体定位差异已在上一篇文章中介绍,本文聚焦 H100 与 H200 在训练和推理场景下的选型。
核心差异一句话:H200 SXM 与 H100 SXM 计算性能相同,H200 的提升纯粹在显存。
| 规格项 | H100 SXM5 | H200 SXM | H200 NVL |
|---|---|---|---|
| 显存容量 | 80GB HBM3 | 141GB HBM3e | 141GB HBM3e |
| 显存带宽 | 3.35 TB/s | 4.8 TB/s | 4.8 TB/s |
| FP32 算力 | 67 TFLOPS | 67 TFLOPS | 60 TFLOPS |
| FP16/BF16 Tensor Core | 1,979* TFLOPS | 1,979* TFLOPS | 1,671* TFLOPS |
| FP8 Tensor Core | 3,958* TFLOPS | 3,958* TFLOPS | 3,341* TFLOPS |
| INT8 Tensor Core | 3,958* TOPS | 3,958* TOPS | 3,341* TOPS |
| TDP | 700W | 700W | 600W |
| NVLink 带宽 | 900 GB/s | 900 GB/s | 900 GB/s |
| 互联形态 | SXM 板载 NVLink | SXM 板载 NVLink | PCIe 双槽,NVLink 桥接(2路或4路) |
| MIG | 最多 7 实例(最小常见 profile 1g.10gb) | 最多 7 实例(官方标注 @18GB/实例) | 最多 7 实例(官方标注 @16.5GB/实例) |
*标注为稀疏模式(sparsity)下的峰值。NVIDIA 官方数据表仅公布稀疏模式的 Tensor Core 峰值(脚注原文为"采用稀疏技术显示,不采用稀疏降低一半"),非稀疏值按结构化稀疏的理论 2:1 关系推算;实际任务能否获得稀疏加速,取决于模型、框架与软件实现。
以上数据来自 NVIDIA H100 和 H200 官方产品页。不同 NVIDIA 官方页面的标注口径可能存在差异(如部分中文资料中 H100 FP32 标注为 60 TFLOPS、显存带宽标注为 3,000 GB/s);本文采用英文产品页数值,实际采购或租赁时,应以对应 SKU 和供应商规格为准。
从表中可以看出两个关键差异:
H200 SXM 与 H100 SXM 计算性能相同。两者的 FP32、FP16/BF16 Tensor Core、FP8 Tensor Core 和 INT8 Tensor Core 峰值完全一致,因为它们使用相同的 GH100 满规核心。H200 SXM 相对 H100 SXM 的提升纯粹在显存:容量约 1.76 倍,带宽约 1.43 倍。
H200 NVL 计算性能低于 H200 SXM。H200 NVL 的 FP32 为 60 TFLOPS(SXM 为 67),FP16/BF16 Tensor Core 为 1,671* TFLOPS(SXM 为 1,979*),TDP 也从 700W 降至 600W。H200 NVL 采用 PCIe 双槽风冷形态,NVLink 通过桥接实现(2路或4路),而非 SXM 的板载全互联。H200 NVL 保留了与 H200 SXM 相同的 141GB 显存和 4.8 TB/s 带宽。
二、H200 NVL 是什么
H200 有 SXM 和 NVL 两种形态,本文重点补充 NVL 版本。
H200 NVL 采用 PCIe 双槽风冷设计,TDP 600W,适合传统风冷机房部署,不需要 SXM 专用的主板和液冷基础设施。NVLink 通过桥接实现 2 路或 4 路互联(非 SXM 的板载全互联拓扑),单 GPU 双向带宽仍为 900 GB/s。
H200 NVL 的计算性能低于 H200 SXM:
| 对比项 | H200 SXM | H200 NVL |
|---|---|---|
| FP32 | 67 TFLOPS | 60 TFLOPS |
| FP16/BF16 TC | 1,979* TFLOPS | 1,671* TFLOPS |
| FP8 TC | 3,958* TFLOPS | 3,341* TFLOPS |
| TDP | 700W | 600W |
| 互联 | SXM 板载全互联 | PCIe,NVLink 桥接(2路/4路) |
| 显存 | 141GB HBM3e | 141GB HBM3e(相同) |
| 带宽 | 4.8 TB/s | 4.8 TB/s(相同) |
H200 NVL 牺牲了部分计算性能和互联规模,换取了部署灵活性和更低的功耗要求,但保留了 H200 的核心卖点——141GB 大显存和 4.8 TB/s 高带宽。
三、训练场景怎么选
H200 对训练的帮助主要在显存,不在算力
由于 H200 SXM 与 H100 SXM 的 Tensor Core 算力完全相同,对于计算密集型训练任务(矩阵乘法占主导、显存未成为瓶颈),两者的训练速度差异不大。
H200 的训练优势体现在显存密集型场景:
- 更大的模型装入单卡。141GB 显存可以装入更大的模型参数和激活值,减少模型并行(tensor parallel、pipeline parallel)的切分需求。当模型大到 H100 的 80GB 放不下时,H200 可以减少跨 GPU 通信量。
- 更大的 batch size。更大的显存允许使用更大的 batch size,提高单卡计算强度和 GPU 利用率。
- 更长的上下文窗口。LLM 训练中,更长的上下文序列通常需要更多显存存储激活值及 attention 相关中间状态,H200 的大显存更有利于承载这类训练配置。
- 更快的显存访问。4.8 TB/s 带宽对显存访问密集型算子(如 attention、layernorm)可能有益;但实际收益取决于算子的访存模式。
什么情况下 H100 就够了
如果模型在 FP16/BF16 下的参数量和激活值可以装入 80GB 显存,且 batch size 已满足训练效率需求,H200 的显存优势对训练吞吐的提升可能有限。此时 H100 和 H200 SXM 的训练速度接近,因为计算核心相同。
训练选型应根据模型参数量、上下文长度、batch size、精度格式、并行策略和 GPU 数量综合判断,不能仅看显存容量一个维度。
四、推理场景怎么选
H200 的推理优势更明显
推理场景中,特别是大模型 LLM 推理,显存容量和带宽往往是主要瓶颈:
- 单卡加载更大模型。70B 参数模型在 FP16 下约需 140GB,H100 的 80GB 放不下,需要多卡或量化;H200 的 141GB 理论上有机会单卡加载 FP16 的 70B 模型,但实际推理仍需考虑 KV Cache、运行时开销和上下文长度。
- 更大的 batch size 提高吞吐。推理服务中,更大的显存可以容纳更多并发请求的 KV Cache,提高单卡吞吐量。
- 更高带宽加速 token 生成。LLM 推理的 token 生成阶段是显存带宽密集型操作,4.8 TB/s 带宽通常更有利于解码阶段的吞吐表现,但实际收益仍取决于模型、batch、并发和框架实现。
NVIDIA 官方推理基准
NVIDIA 在 H200 产品页给出了 H200 相对 H100 的推理性能对比数据:
- Llama2 70B:H200 单卡(batch 32)对比 H100 单卡(batch 8),标注为"1.9 倍更快"
- GPT-3 175B:8 卡 H200 对比 8 卡 H100,标注为"1.6 倍更快"
这些数据来自 NVIDIA 在特定模型、特定 batch size、特定配置下的测试结果,不能直接泛化为所有推理任务的加速比。实际推理性能取决于模型架构、精度、batch size、上下文长度、框架优化和部署配置。H200 并不是所有推理任务都比 H100 快 1.43 倍;只有显存容量或带宽构成瓶颈时,实际吞吐才可能明显提升。
H200 NVL 在推理中的定位
H200 NVL 虽然计算性能低于 H200 SXM,但保留了 141GB 显存和 4.8 TB/s 带宽——这对推理场景往往比峰值算力更重要。600W TDP 和 PCIe 双槽风冷形态使其可以在不改造机房的前提下部署,适合需要大显存但无法部署 SXM 液冷机的推理场景。NVLink 桥接更适合较小规模的多卡互联场景,整体扩展能力和拓扑与 SXM 平台不同。
五、选型建议总结
| 场景 | 推荐 | 理由 |
|---|---|---|
| 计算密集型训练,模型可装入 80GB | H100 | 计算核心相同,H200 无算力优势 |
| 大模型训练,80GB 显存不足 | H200 SXM | 141GB 显存减少模型切分,支持更大 batch |
| 高吞吐或长上下文 LLM 推理 | H200 SXM | 当显存容量或显存带宽成为瓶颈时,更容易体现优势 |
| 风冷机房推理部署 | H200 NVL | 141GB 显存,600W 功耗,PCIe 灵活部署 |
| 预算敏感的通用推理 | H100 | 80GB 仍可服务多数中模型推理需求 |
选型时应根据模型大小、精度需求、batch size、并发量、机房条件和预算综合判断,不能仅看某一维度。
六、在立方云上怎么选
立方云当前提供 H100 相关裸金属资源,用户可在对应实例上进行大规模训练和高吞吐推理。H200 的上架状态请以控制台展示为准。具体规格、计费方式和可用库存以控制台展示为准。
本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 GPU 规格与计费方式,可前往 lifangyun.com 查看。
七、常见问题
1. H200比H100快多少?
在计算性能上,H200 SXM 和 H100 SXM 基本一致(同为 GH100 满规核心,Tensor Core 峰值相同)。H200 的优势在显存:容量从 80GB 提升到 141GB(约 1.76 倍),带宽从 3.35 TB/s 提升到 4.8 TB/s(约 1.43 倍)。对于显存密集型任务,H200 可以减少显存溢出和数据交换;对于计算密集型任务,两者差异不大。H200 并不是所有推理任务都比 H100 快 1.43 倍;只有显存容量或带宽构成瓶颈时,实际吞吐才可能明显提升。
2. H200 NVL和H200 SXM有什么区别?
H200 NVL 采用 PCIe 双槽风冷形态,TDP 600W,计算性能低于 H200 SXM(FP32 60 vs 67 TFLOPS,FP16 TC 1,671* vs 1,979* TFLOPS)。H200 NVL 通过 NVLink 桥接支持 2 路或 4 路互联,而非 SXM 的板载全互联。两者的显存容量和带宽相同(141GB HBM3e,4.8 TB/s)。H200 NVL 适合风冷机房和灵活部署场景。
3. H200训练比H100快吗?
计算核心相同时,训练速度取决于任务瓶颈。如果任务受计算限制(计算密集型),H200 SXM 和 H100 SXM 的训练速度接近。如果任务受显存限制(大模型、大 batch、长上下文),H200 的大显存和高带宽可能减少模型切分和跨卡通信,从而提升训练效率。实际提升取决于模型、精度、并行策略和框架实现。
4. 70B模型推理选H100还是H200?
70B 参数模型在 FP16 下权重约需 140GB。H100 的 80GB 显存放不下,需要多卡或量化;H200 的 141GB 理论上有机会单卡加载,但实际推理仍需考虑 KV Cache、运行时开销和上下文长度。在 INT8 量化下,70B 模型权重约需 70GB,H100 的 80GB 有机会加载。选型应根据精度需求、并发量、上下文长度和预算综合评估。
5. H200的MIG和H100有什么不同?
两者都支持最多 7 个 MIG 实例,但单实例显存因总显存不同而差异显著。H100 SXM 最小常见 profile 为 1g.10gb(10GB/实例),H200 SXM 官方标注每实例约 18GB,H200 NVL 官方标注每实例约 16.5GB。MIG 不是简单平均切分,实际显存取决于具体 profile 配置。更多 MIG 技术细节可参考《A100的MIG多实例技术是什么?》。