H100和H200性能差多少?训练和推理该怎么选?

H200 SXM 与 H100 SXM 的计算核心完全相同(同为 GH100 满规),Tensor Core 算力一致;H200 的主要优势在显存系统,包括更大的显存容量和更高的显存带宽——容量从 80GB 提升到 141GB(约 1.76 倍),带宽从 3.35 TB/s 提升到 4.8 TB/s(约 1.43 倍)。训练和推理是否选 H200,取决于任务是计算受限还是显存受限。关于 H20、H100、H200 三款 GPU 的定位差异,可参考《H20、H100、H200有什么区别?一张表看懂定位》

一、H100和H200的核心差异

H100 和 H200 均基于 NVIDIA Hopper 架构(GH100 芯片),共享相同的计算核心设计。三款 GPU(含 H20)的整体定位差异已在上一篇文章中介绍,本文聚焦 H100 与 H200 在训练和推理场景下的选型。

核心差异一句话:H200 SXM 与 H100 SXM 计算性能相同,H200 的提升纯粹在显存。

规格项 H100 SXM5 H200 SXM H200 NVL
显存容量 80GB HBM3 141GB HBM3e 141GB HBM3e
显存带宽 3.35 TB/s 4.8 TB/s 4.8 TB/s
FP32 算力 67 TFLOPS 67 TFLOPS 60 TFLOPS
FP16/BF16 Tensor Core 1,979* TFLOPS 1,979* TFLOPS 1,671* TFLOPS
FP8 Tensor Core 3,958* TFLOPS 3,958* TFLOPS 3,341* TFLOPS
INT8 Tensor Core 3,958* TOPS 3,958* TOPS 3,341* TOPS
TDP 700W 700W 600W
NVLink 带宽 900 GB/s 900 GB/s 900 GB/s
互联形态 SXM 板载 NVLink SXM 板载 NVLink PCIe 双槽,NVLink 桥接(2路或4路)
MIG 最多 7 实例(最小常见 profile 1g.10gb) 最多 7 实例(官方标注 @18GB/实例) 最多 7 实例(官方标注 @16.5GB/实例)

*标注为稀疏模式(sparsity)下的峰值。NVIDIA 官方数据表仅公布稀疏模式的 Tensor Core 峰值(脚注原文为"采用稀疏技术显示,不采用稀疏降低一半"),非稀疏值按结构化稀疏的理论 2:1 关系推算;实际任务能否获得稀疏加速,取决于模型、框架与软件实现。

以上数据来自 NVIDIA H100 和 H200 官方产品页。不同 NVIDIA 官方页面的标注口径可能存在差异(如部分中文资料中 H100 FP32 标注为 60 TFLOPS、显存带宽标注为 3,000 GB/s);本文采用英文产品页数值,实际采购或租赁时,应以对应 SKU 和供应商规格为准。

从表中可以看出两个关键差异:

H200 SXM 与 H100 SXM 计算性能相同。两者的 FP32、FP16/BF16 Tensor Core、FP8 Tensor Core 和 INT8 Tensor Core 峰值完全一致,因为它们使用相同的 GH100 满规核心。H200 SXM 相对 H100 SXM 的提升纯粹在显存:容量约 1.76 倍,带宽约 1.43 倍。

H200 NVL 计算性能低于 H200 SXM。H200 NVL 的 FP32 为 60 TFLOPS(SXM 为 67),FP16/BF16 Tensor Core 为 1,671* TFLOPS(SXM 为 1,979*),TDP 也从 700W 降至 600W。H200 NVL 采用 PCIe 双槽风冷形态,NVLink 通过桥接实现(2路或4路),而非 SXM 的板载全互联。H200 NVL 保留了与 H200 SXM 相同的 141GB 显存和 4.8 TB/s 带宽。

二、H200 NVL 是什么

H200 有 SXM 和 NVL 两种形态,本文重点补充 NVL 版本。

H200 NVL 采用 PCIe 双槽风冷设计,TDP 600W,适合传统风冷机房部署,不需要 SXM 专用的主板和液冷基础设施。NVLink 通过桥接实现 2 路或 4 路互联(非 SXM 的板载全互联拓扑),单 GPU 双向带宽仍为 900 GB/s。

H200 NVL 的计算性能低于 H200 SXM:

对比项 H200 SXM H200 NVL
FP32 67 TFLOPS 60 TFLOPS
FP16/BF16 TC 1,979* TFLOPS 1,671* TFLOPS
FP8 TC 3,958* TFLOPS 3,341* TFLOPS
TDP 700W 600W
互联 SXM 板载全互联 PCIe,NVLink 桥接(2路/4路)
显存 141GB HBM3e 141GB HBM3e(相同)
带宽 4.8 TB/s 4.8 TB/s(相同)

H200 NVL 牺牲了部分计算性能和互联规模,换取了部署灵活性和更低的功耗要求,但保留了 H200 的核心卖点——141GB 大显存和 4.8 TB/s 高带宽。

三、训练场景怎么选

H200 对训练的帮助主要在显存,不在算力

由于 H200 SXM 与 H100 SXM 的 Tensor Core 算力完全相同,对于计算密集型训练任务(矩阵乘法占主导、显存未成为瓶颈),两者的训练速度差异不大。

H200 的训练优势体现在显存密集型场景:

  • 更大的模型装入单卡。141GB 显存可以装入更大的模型参数和激活值,减少模型并行(tensor parallel、pipeline parallel)的切分需求。当模型大到 H100 的 80GB 放不下时,H200 可以减少跨 GPU 通信量。
  • 更大的 batch size。更大的显存允许使用更大的 batch size,提高单卡计算强度和 GPU 利用率。
  • 更长的上下文窗口。LLM 训练中,更长的上下文序列通常需要更多显存存储激活值及 attention 相关中间状态,H200 的大显存更有利于承载这类训练配置。
  • 更快的显存访问。4.8 TB/s 带宽对显存访问密集型算子(如 attention、layernorm)可能有益;但实际收益取决于算子的访存模式。

什么情况下 H100 就够了

如果模型在 FP16/BF16 下的参数量和激活值可以装入 80GB 显存,且 batch size 已满足训练效率需求,H200 的显存优势对训练吞吐的提升可能有限。此时 H100 和 H200 SXM 的训练速度接近,因为计算核心相同。

训练选型应根据模型参数量、上下文长度、batch size、精度格式、并行策略和 GPU 数量综合判断,不能仅看显存容量一个维度。

四、推理场景怎么选

H200 的推理优势更明显

推理场景中,特别是大模型 LLM 推理,显存容量和带宽往往是主要瓶颈:

  • 单卡加载更大模型。70B 参数模型在 FP16 下约需 140GB,H100 的 80GB 放不下,需要多卡或量化;H200 的 141GB 理论上有机会单卡加载 FP16 的 70B 模型,但实际推理仍需考虑 KV Cache、运行时开销和上下文长度。
  • 更大的 batch size 提高吞吐。推理服务中,更大的显存可以容纳更多并发请求的 KV Cache,提高单卡吞吐量。
  • 更高带宽加速 token 生成。LLM 推理的 token 生成阶段是显存带宽密集型操作,4.8 TB/s 带宽通常更有利于解码阶段的吞吐表现,但实际收益仍取决于模型、batch、并发和框架实现。

NVIDIA 官方推理基准

NVIDIA 在 H200 产品页给出了 H200 相对 H100 的推理性能对比数据:

  • Llama2 70B:H200 单卡(batch 32)对比 H100 单卡(batch 8),标注为"1.9 倍更快"
  • GPT-3 175B:8 卡 H200 对比 8 卡 H100,标注为"1.6 倍更快"

这些数据来自 NVIDIA 在特定模型、特定 batch size、特定配置下的测试结果,不能直接泛化为所有推理任务的加速比。实际推理性能取决于模型架构、精度、batch size、上下文长度、框架优化和部署配置。H200 并不是所有推理任务都比 H100 快 1.43 倍;只有显存容量或带宽构成瓶颈时,实际吞吐才可能明显提升。

H200 NVL 在推理中的定位

H200 NVL 虽然计算性能低于 H200 SXM,但保留了 141GB 显存和 4.8 TB/s 带宽——这对推理场景往往比峰值算力更重要。600W TDP 和 PCIe 双槽风冷形态使其可以在不改造机房的前提下部署,适合需要大显存但无法部署 SXM 液冷机的推理场景。NVLink 桥接更适合较小规模的多卡互联场景,整体扩展能力和拓扑与 SXM 平台不同。

五、选型建议总结

场景 推荐 理由
计算密集型训练,模型可装入 80GB H100 计算核心相同,H200 无算力优势
大模型训练,80GB 显存不足 H200 SXM 141GB 显存减少模型切分,支持更大 batch
高吞吐或长上下文 LLM 推理 H200 SXM 当显存容量或显存带宽成为瓶颈时,更容易体现优势
风冷机房推理部署 H200 NVL 141GB 显存,600W 功耗,PCIe 灵活部署
预算敏感的通用推理 H100 80GB 仍可服务多数中模型推理需求

选型时应根据模型大小、精度需求、batch size、并发量、机房条件和预算综合判断,不能仅看某一维度。

六、在立方云上怎么选

立方云当前提供 H100 相关裸金属资源,用户可在对应实例上进行大规模训练和高吞吐推理。H200 的上架状态请以控制台展示为准。具体规格、计费方式和可用库存以控制台展示为准。


本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 GPU 规格与计费方式,可前往 lifangyun.com 查看。

七、常见问题

1. H200比H100快多少?

在计算性能上,H200 SXM 和 H100 SXM 基本一致(同为 GH100 满规核心,Tensor Core 峰值相同)。H200 的优势在显存:容量从 80GB 提升到 141GB(约 1.76 倍),带宽从 3.35 TB/s 提升到 4.8 TB/s(约 1.43 倍)。对于显存密集型任务,H200 可以减少显存溢出和数据交换;对于计算密集型任务,两者差异不大。H200 并不是所有推理任务都比 H100 快 1.43 倍;只有显存容量或带宽构成瓶颈时,实际吞吐才可能明显提升。

2. H200 NVL和H200 SXM有什么区别?

H200 NVL 采用 PCIe 双槽风冷形态,TDP 600W,计算性能低于 H200 SXM(FP32 60 vs 67 TFLOPS,FP16 TC 1,671* vs 1,979* TFLOPS)。H200 NVL 通过 NVLink 桥接支持 2 路或 4 路互联,而非 SXM 的板载全互联。两者的显存容量和带宽相同(141GB HBM3e,4.8 TB/s)。H200 NVL 适合风冷机房和灵活部署场景。

3. H200训练比H100快吗?

计算核心相同时,训练速度取决于任务瓶颈。如果任务受计算限制(计算密集型),H200 SXM 和 H100 SXM 的训练速度接近。如果任务受显存限制(大模型、大 batch、长上下文),H200 的大显存和高带宽可能减少模型切分和跨卡通信,从而提升训练效率。实际提升取决于模型、精度、并行策略和框架实现。

4. 70B模型推理选H100还是H200?

70B 参数模型在 FP16 下权重约需 140GB。H100 的 80GB 显存放不下,需要多卡或量化;H200 的 141GB 理论上有机会单卡加载,但实际推理仍需考虑 KV Cache、运行时开销和上下文长度。在 INT8 量化下,70B 模型权重约需 70GB,H100 的 80GB 有机会加载。选型应根据精度需求、并发量、上下文长度和预算综合评估。

5. H200的MIG和H100有什么不同?

两者都支持最多 7 个 MIG 实例,但单实例显存因总显存不同而差异显著。H100 SXM 最小常见 profile 为 1g.10gb(10GB/实例),H200 SXM 官方标注每实例约 18GB,H200 NVL 官方标注每实例约 16.5GB。MIG 不是简单平均切分,实际显存取决于具体 profile 配置。更多 MIG 技术细节可参考《A100的MIG多实例技术是什么?》