H20、H100、H200有什么区别?一张表看懂定位

H100 和 H200 共享 Hopper 架构和相同的计算核心,H200 的优势在显存更大更快;H20 是同架构的降算力版本,算力大幅削减但保留大显存和高带宽,定位推理优先。

一、H20、H100、H200分别是什么

三款产品均归入 NVIDIA Hopper 架构(GH100 芯片)产品体系,但 H20 的公开规格信息主要来自第三方资料,NVIDIA 未公开 H20 官方产品页或数据表。

H100 是 2022 年发布的 Hopper 架构旗舰,采用 TSMC 4N 工艺,搭载第四代 Tensor Core 和 Transformer Engine,80GB HBM3 显存,是当前数据中心 AI 训练和推理的主力卡。

H200 是 2024 年发布的 Hopper 升级版,计算核心与 H100 相同(同为 GH100 满规),但显存升级为 141GB HBM3e,带宽从 3.35 TB/s 提升到 4.8 TB/s。H200 面向显存密集型工作负载,如超大模型推理和长上下文训练。

H20 是 NVIDIA 面向中国市场的合规芯片,同样基于 Hopper 架构,但大幅削减了计算单元的启用数量。H20 保留 96GB HBM3 显存和 4.0 TB/s 带宽,公开第三方资料对 TDP 标注存在差异,常见说法为约 400~500W,具体以对应 SKU 和供应商规格为准。

三者的核心差异不在架构,而在"同一架构下的不同配置":H100 是基准,H200 是显存增强版,H20 是算力精简版。

二、核心规格差多少

以下对比以 H20、H100 SXM5 和 H200 SXM 为基准。H100 和 H200 数据来自 NVIDIA 官方产品页,H20 数据来自第三方规格整理(NVIDIA 未公开 H20 官方产品页或数据表)。

规格项 H20 H100 SXM5 H200 SXM
架构 Hopper (GH100) Hopper (GH100) Hopper (GH100)
计算核心 降规启用 满规 满规
显存容量 96GB HBM3 80GB HBM3 141GB HBM3e
显存带宽 4.0 TB/s 3.35 TB/s 4.8 TB/s
FP32 算力 ~44 TFLOPS 67 TFLOPS 67 TFLOPS
FP16 Tensor Core ~148 TFLOPS ~990 TFLOPS ~990 TFLOPS
FP8 Tensor Core ~296 TFLOPS ~1,979 TFLOPS ~1,979 TFLOPS
INT8 Tensor Core ~296 TOPS ~1,979 TOPS ~1,979 TOPS
TDP 约 400~500W(非官方统一口径) 700W 700W
NVLink 带宽 900 GB/s 900 GB/s 900 GB/s
Transformer Engine 支持 支持 支持
MIG 最多 7 实例 最多 7 实例 最多 7 实例

MIG 每实例可用显存因总显存和 profile 配置不同而差异显著:H100 最小常见分片约 10GB,H200 SXM 官方标注最多 7 个 18GB 实例(H200 NVL 则为最多 7 个 16.5GB 实例);H20 虽支持最多 7 个 MIG 实例,但具体显存需按官方 MIG profile 或平台配置确认,不建议按 96GB/7 简单推算。

表中 Tensor Core 性能为非稀疏值。H100 和 H200 支持结构化稀疏,稀疏模式下性能约为非稀疏的 2 倍;H20 的稀疏性能数据未在官方来源中公布。H20 所有性能数据均来自第三方整理,非 NVIDIA 官方确认,实际以对应 SKU 规格为准。

从表中可以看出三个关键差异:

算力差距悬殊。按第三方规格估算,H20 的 FP16/FP8 Tensor Core 性能约为 H100 的 15%;由于 NVIDIA 未公开对应官方数据表,具体比例应以实际 SKU 和实测结果为准。这意味着在计算密集型训练任务中,H20 与 H100/H200 的差距非常大。但 H20 的 FP32 算力约为 H100 的 66%,非 Tensor Core 计算的下降幅度小得多。

显存各有优势。H200 以 141GB HBM3e 领先,适合存放超大模型;H20 的显存容量和带宽高于 H100,在模型能够装入显存且推理主要受显存访问限制时可能具有优势;实际吞吐仍取决于精度、batch、并发、框架和算子优化。H200 的 4.8 TB/s 带宽在三者中最高。

功耗差异明显。H20 的 TDP(约 400~500W)低于 H100/H200 的 700W,对机房供电和散热要求更低。

三、定位差异与选型建议

三款 GPU 的定位可以用一句话概括:H100 是通用基准,H200 是显存增强版,H20 是面向特定市场、在显存容量和带宽与计算性能之间重新取舍的 Hopper 产品

H100 适合:需要平衡训练和推理的场景。如果任务同时涉及模型训练和高吞吐推理,H100 的算力和显存配置最为均衡。

H200 适合:显存密集型工作负载。当模型参数量大到 80GB 显存放不下,或者需要更长的上下文窗口和更大的 batch size 时,H200 的 141GB HBM3e 可为更大模型、更长上下文或更大 batch 提供余量,并可能减少部分 offload 或模型切分;实际收益仍取决于模型和运行配置。H200 与 H100 计算能力相同,优势纯粹在显存。

H20 适合:显存容量和带宽较敏感、但峰值计算吞吐要求不高的推理任务。H20 可评估用于此类场景,具体能力需结合模型和压测确认。H20 也支持 FP8 和 Transformer Engine,可以在推理中获得低精度加速。

选型时应根据模型大小、精度需求、batch size、并发量和预算综合判断,不能仅看某一维度。

四、在立方云上怎么选

立方云提供 H20 96GB 容器实例(按小时计费)和 H100 80GB SXM5 8 卡整机(按月计费)。H20 容器适合推理验证及对显存容量较敏感、但峰值计算吞吐要求不高的部署场景,按小时灵活计费;H100 整机适合大规模训练和高吞吐推理。

如果任务是推理为主、预算敏感,H20 容器是性价比更高的选择;如果需要大规模训练或更高吞吐,H100 整机更适合。具体价格和可用库存以控制台展示为准。


本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 GPU 规格与计费方式,可前往 lifangyun.com 查看。

五、常见问题

1. H20和H100架构一样吗?

是的,H20 和 H100 都基于 NVIDIA Hopper 架构(GH100 芯片),都支持第四代 Tensor Core、Transformer Engine 和 FP8 精度。区别在于 H20 大幅削减了启用的计算单元数量,导致 Tensor Core 性能远低于 H100,但显存容量和带宽保留较多。

2. H200比H100快多少?

在计算性能上,H200 和 H100 基本一致(同为 GH100 满规核心)。H200 的优势在显存:容量从 80GB 提升到 141GB(约 1.76 倍),带宽从 3.35 TB/s 提升到 4.8 TB/s(约 1.43 倍)。对于显存密集型任务,H200 可以减少显存溢出和数据交换;对于计算密集型任务,两者差异不大。因此,H200 并不是所有任务都比 H100 快 1.43 倍;只有显存容量或带宽构成瓶颈时,实际吞吐才可能明显提升。

3. H20能跑大模型训练吗?

理论上可以,但不推荐。按第三方规格估算,H20 的 Tensor Core 算力约为 H100 的 15%(具体以实际 SKU 和实测为准),训练速度会明显受限。H20 更适合推理部署,其 96GB 显存和 4.0 TB/s 带宽可加载大模型进行推理,但训练效率不理想。

4. H20为什么算力这么低?

H20 是面向中国市场的合规芯片,受出口管制限制,NVIDIA 大幅削减了 H20 的计算单元启用数量,但保留了大容量 HBM3 显存和高带宽。这种设计使 H20 在推理场景(显存和带宽敏感)仍有竞争力,但在训练场景(算力敏感)表现受限。

5. 三款GPU的NVLink带宽一样吗?

是的,H20、H100 SXM5 和 H200 SXM 均支持第四代 NVLink,单 GPU 双向带宽均为 900 GB/s。多卡通信效率还取决于 NVSwitch 拓扑和框架通信模式。