H20、H100、H200有什么区别?一张表看懂定位
H100 和 H200 共享 Hopper 架构和相同的计算核心,H200 的优势在显存更大更快;H20 是同架构的降算力版本,算力大幅削减但保留大显存和高带宽,定位推理优先。
一、H20、H100、H200分别是什么
三款产品均归入 NVIDIA Hopper 架构(GH100 芯片)产品体系,但 H20 的公开规格信息主要来自第三方资料,NVIDIA 未公开 H20 官方产品页或数据表。
H100 是 2022 年发布的 Hopper 架构旗舰,采用 TSMC 4N 工艺,搭载第四代 Tensor Core 和 Transformer Engine,80GB HBM3 显存,是当前数据中心 AI 训练和推理的主力卡。
H200 是 2024 年发布的 Hopper 升级版,计算核心与 H100 相同(同为 GH100 满规),但显存升级为 141GB HBM3e,带宽从 3.35 TB/s 提升到 4.8 TB/s。H200 面向显存密集型工作负载,如超大模型推理和长上下文训练。
H20 是 NVIDIA 面向中国市场的合规芯片,同样基于 Hopper 架构,但大幅削减了计算单元的启用数量。H20 保留 96GB HBM3 显存和 4.0 TB/s 带宽,公开第三方资料对 TDP 标注存在差异,常见说法为约 400~500W,具体以对应 SKU 和供应商规格为准。
三者的核心差异不在架构,而在"同一架构下的不同配置":H100 是基准,H200 是显存增强版,H20 是算力精简版。
二、核心规格差多少
以下对比以 H20、H100 SXM5 和 H200 SXM 为基准。H100 和 H200 数据来自 NVIDIA 官方产品页,H20 数据来自第三方规格整理(NVIDIA 未公开 H20 官方产品页或数据表)。
| 规格项 | H20 | H100 SXM5 | H200 SXM |
|---|---|---|---|
| 架构 | Hopper (GH100) | Hopper (GH100) | Hopper (GH100) |
| 计算核心 | 降规启用 | 满规 | 满规 |
| 显存容量 | 96GB HBM3 | 80GB HBM3 | 141GB HBM3e |
| 显存带宽 | 4.0 TB/s | 3.35 TB/s | 4.8 TB/s |
| FP32 算力 | ~44 TFLOPS | 67 TFLOPS | 67 TFLOPS |
| FP16 Tensor Core | ~148 TFLOPS | ~990 TFLOPS | ~990 TFLOPS |
| FP8 Tensor Core | ~296 TFLOPS | ~1,979 TFLOPS | ~1,979 TFLOPS |
| INT8 Tensor Core | ~296 TOPS | ~1,979 TOPS | ~1,979 TOPS |
| TDP | 约 400~500W(非官方统一口径) | 700W | 700W |
| NVLink 带宽 | 900 GB/s | 900 GB/s | 900 GB/s |
| Transformer Engine | 支持 | 支持 | 支持 |
| MIG | 最多 7 实例 | 最多 7 实例 | 最多 7 实例 |
MIG 每实例可用显存因总显存和 profile 配置不同而差异显著:H100 最小常见分片约 10GB,H200 SXM 官方标注最多 7 个 18GB 实例(H200 NVL 则为最多 7 个 16.5GB 实例);H20 虽支持最多 7 个 MIG 实例,但具体显存需按官方 MIG profile 或平台配置确认,不建议按 96GB/7 简单推算。
表中 Tensor Core 性能为非稀疏值。H100 和 H200 支持结构化稀疏,稀疏模式下性能约为非稀疏的 2 倍;H20 的稀疏性能数据未在官方来源中公布。H20 所有性能数据均来自第三方整理,非 NVIDIA 官方确认,实际以对应 SKU 规格为准。
从表中可以看出三个关键差异:
算力差距悬殊。按第三方规格估算,H20 的 FP16/FP8 Tensor Core 性能约为 H100 的 15%;由于 NVIDIA 未公开对应官方数据表,具体比例应以实际 SKU 和实测结果为准。这意味着在计算密集型训练任务中,H20 与 H100/H200 的差距非常大。但 H20 的 FP32 算力约为 H100 的 66%,非 Tensor Core 计算的下降幅度小得多。
显存各有优势。H200 以 141GB HBM3e 领先,适合存放超大模型;H20 的显存容量和带宽高于 H100,在模型能够装入显存且推理主要受显存访问限制时可能具有优势;实际吞吐仍取决于精度、batch、并发、框架和算子优化。H200 的 4.8 TB/s 带宽在三者中最高。
功耗差异明显。H20 的 TDP(约 400~500W)低于 H100/H200 的 700W,对机房供电和散热要求更低。
三、定位差异与选型建议
三款 GPU 的定位可以用一句话概括:H100 是通用基准,H200 是显存增强版,H20 是面向特定市场、在显存容量和带宽与计算性能之间重新取舍的 Hopper 产品。
H100 适合:需要平衡训练和推理的场景。如果任务同时涉及模型训练和高吞吐推理,H100 的算力和显存配置最为均衡。
H200 适合:显存密集型工作负载。当模型参数量大到 80GB 显存放不下,或者需要更长的上下文窗口和更大的 batch size 时,H200 的 141GB HBM3e 可为更大模型、更长上下文或更大 batch 提供余量,并可能减少部分 offload 或模型切分;实际收益仍取决于模型和运行配置。H200 与 H100 计算能力相同,优势纯粹在显存。
H20 适合:显存容量和带宽较敏感、但峰值计算吞吐要求不高的推理任务。H20 可评估用于此类场景,具体能力需结合模型和压测确认。H20 也支持 FP8 和 Transformer Engine,可以在推理中获得低精度加速。
选型时应根据模型大小、精度需求、batch size、并发量和预算综合判断,不能仅看某一维度。
四、在立方云上怎么选
立方云提供 H20 96GB 容器实例(按小时计费)和 H100 80GB SXM5 8 卡整机(按月计费)。H20 容器适合推理验证及对显存容量较敏感、但峰值计算吞吐要求不高的部署场景,按小时灵活计费;H100 整机适合大规模训练和高吞吐推理。
如果任务是推理为主、预算敏感,H20 容器是性价比更高的选择;如果需要大规模训练或更高吞吐,H100 整机更适合。具体价格和可用库存以控制台展示为准。
本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 GPU 规格与计费方式,可前往 lifangyun.com 查看。
五、常见问题
1. H20和H100架构一样吗?
是的,H20 和 H100 都基于 NVIDIA Hopper 架构(GH100 芯片),都支持第四代 Tensor Core、Transformer Engine 和 FP8 精度。区别在于 H20 大幅削减了启用的计算单元数量,导致 Tensor Core 性能远低于 H100,但显存容量和带宽保留较多。
2. H200比H100快多少?
在计算性能上,H200 和 H100 基本一致(同为 GH100 满规核心)。H200 的优势在显存:容量从 80GB 提升到 141GB(约 1.76 倍),带宽从 3.35 TB/s 提升到 4.8 TB/s(约 1.43 倍)。对于显存密集型任务,H200 可以减少显存溢出和数据交换;对于计算密集型任务,两者差异不大。因此,H200 并不是所有任务都比 H100 快 1.43 倍;只有显存容量或带宽构成瓶颈时,实际吞吐才可能明显提升。
3. H20能跑大模型训练吗?
理论上可以,但不推荐。按第三方规格估算,H20 的 Tensor Core 算力约为 H100 的 15%(具体以实际 SKU 和实测为准),训练速度会明显受限。H20 更适合推理部署,其 96GB 显存和 4.0 TB/s 带宽可加载大模型进行推理,但训练效率不理想。
4. H20为什么算力这么低?
H20 是面向中国市场的合规芯片,受出口管制限制,NVIDIA 大幅削减了 H20 的计算单元启用数量,但保留了大容量 HBM3 显存和高带宽。这种设计使 H20 在推理场景(显存和带宽敏感)仍有竞争力,但在训练场景(算力敏感)表现受限。
5. 三款GPU的NVLink带宽一样吗?
是的,H20、H100 SXM5 和 H200 SXM 均支持第四代 NVLink,单 GPU 双向带宽均为 900 GB/s。多卡通信效率还取决于 NVSwitch 拓扑和框架通信模式。