A100和H100有什么区别?训练和推理分别怎么选?

A100 是 NVIDIA Ampere 架构的数据中心 GPU,H100 是 Hopper 架构的继任者;H100 在算力、显存带宽、FP8 支持和 Transformer Engine 上全面领先 A100,适合大模型训练和高吞吐推理,A100 在成本敏感场景下仍有竞争力。

一、A100H100分别是什么

A100H100都是 NVIDIA 面向数据中心的 GPU,但属于不同架构代际。A100 于 2020 年发布,基于 Ampere 架构(GA100 芯片),采用 TSMC 7nm 工艺,搭载第三代 Tensor Core。H100 于 2022 年发布,基于 Hopper 架构(GH100 芯片),采用 TSMC 4N 工艺,搭载第四代 Tensor Core 和 Transformer Engine。

两者都有 SXM 和 PCIe 等封装形式,H100 还有 NVL 形态。SXM 版本功耗更高、带宽更大,适合大规模集群部署;PCIe 版本功耗较低,适合现有服务器插槽。数据中心和算力租赁平台会提供 SXM、PCIe、NVL 等不同形态;本文以 SXM 版本为主进行对比,实际租用时应以实例规格和硬件拓扑为准。

二、核心规格差多少

以下对比以 A100 80GB SXM 和 H100 80GB SXM5 为基准,数据来自 NVIDIA 官方数据表。

规格项 A100 80GB SXM H100 80GB SXM5 倍数关系
架构 Ampere (GA100) Hopper (GH100)
制造工艺 TSMC 7nm TSMC 4N
CUDA 核心 6,912 16,896 约 2.4x
Tensor 核心 432(第三代) 528(第四代) 约 1.2x
显存容量 80GB HBM2e 80GB HBM3 同容量,不同代
显存带宽 2,039 GB/s 3,000 GB/s 约 1.47x
FP32 算力 19.5 TFLOPS 60 TFLOPS 约 3.1x
FP16 Tensor Core 312 / 624* TFLOPS 1,000 / 2,000* TFLOPS 约 3.2x
INT8 Tensor Core 624 / 1,248* TOPS 2,000 / 4,000* TOPS 约 3.2x
FP8 Tensor Core 不支持 2,000 / 4,000* TFLOPS A100 无此精度
TDP 400W 700W 1.75x
NVLink 带宽 600 GB/s 900 GB/s 1.5x
PCIe Gen 4 Gen 5 2x

*标注为稀疏模式(sparsity)下的性能。H100 的非稀疏峰值可按结构化稀疏的理论 2:1 关系估算;实际任务能否获得稀疏加速,还取决于模型、框架与软件实现。

注:不同 NVIDIA 官方页面的标注口径存在差异(如 FP32 算力和显存带宽)。本文表格采用所引中文数据表的数值;实际采购或租赁时,应以对应 SKU、订单规格及供应商书面配置为准。

从算力看,H100 的 FP32 是 A100 的约 3 倍,FP16 Tensor Core 是约 3.2 倍。显存容量同为 80GB,但 H100 使用 HBM3,带宽比 A100 的 HBM2e 高约 47%。功耗方面,H100 SXM5 的 700W 显著高于 A100 SXM 的 400W,对机房供电和散热要求更高。

三、H100比A100多了什么

Transformer Engine 是 H100 相对 A100 最重要的架构升级。它能在 FP8 和 FP16 混合精度之间自动切换,针对 Transformer 架构模型优化。根据 NVIDIA 官方数据,在特定基准测试中 H100 相比 A100 有显著加速(如 GPT-3 175B 训练场景最高约 4 倍、Megatron 530B 推理场景最高约 30 倍);实际提升取决于模型结构、精度设置、批处理、框架、GPU 数量和互联配置,不能直接套用峰值倍数。

FP8 支持 是另一个关键差异。A100 不支持 FP8 精度,H100 的第四代 Tensor Core 支持 FP8,在稀疏模式下提供 4,000 TFLOPS 的峰值算力,约为 A100 FP16 Tensor Core(稀疏模式 624 TFLOPS)的 6.4 倍。FP8 在保证可接受精度的前提下大幅提升吞吐量,对推理和训练都有价值。

此外,H100 还引入了 DPX 指令(加速动态规划)、TMA(Tensor Memory Accelerator,异步内存传输)、分布式共享内存和机密计算(TEE)等特性。NVLink 升级到第四代(对应第三代 NVSwitch),带宽从 600 GB/s 提升到 900 GB/s,并通过 NVLink Switch System 支持最多 256 个 GPU 的全互联集群。A100 支持第三代 NVLink 和第二代 NVSwitch,HGX A100 标准配置为 8 卡全互联,但不支持 NVLink Switch System 的 256 GPU 规模扩展。

四、训练和推理分别怎么选

大模型训练优先评估 H100。原因有三:Transformer Engine 对 LLM 训练有专门优化;FP8 精度可以在不显著影响模型质量的前提下提升训练吞吐;HBM3 的更高显存带宽可改善部分显存访问密集型计算,训练中的数据加载效率还取决于存储、CPU、数据预处理及 PCIe 或网络链路。对于千亿参数级别的模型训练,8 卡 H100 集群的计算能力和互联带宽优势明显。

推理场景可优先评估 H100,尤其是高吞吐 LLM 推理。当框架支持 FP8、或压测确认 H100 的性能提升能覆盖价差时,H100 的吞吐和延迟优势明显——FP8 精度配合 Transformer Engine 可以提升推理吞吐、降低单请求延迟。需要注意的是,H100 不仅支持 FP8,其 FP16/BF16 性能也高于 A100;"精度要求高"并非选 A100 的充分理由,是否选择 H100 应结合实际吞吐需求和成本评估。

A100 仍然适合的场景:预算有限且对 H100 的 FP8/Transformer Engine 优势利用有限的任务、A100 性能已满足目标的中等规模训练和推理、现有环境以 A100 为主且其 FP64 性能已满足需求的科学计算任务。A100 的 MIG 可将一张卡分为最多 7 个独立实例,适合多租户推理部署。功耗方面,A100 SXM 的 400W 远低于 H100 SXM5 的 700W,对机房条件更友好。

选型时应根据模型精度、上下文长度、并发或 batch、训练方式、所需 GPU 数量、互联拓扑和实际压测结果,在 A100 与 H100 间选择。

五、在立方云上怎么选

我们同时提供A100H100 的 SXM 版本,均为 8 卡整机配置。A100 80GB SXM 提供 8 卡、112 核 CPU、1TB 内存;H100 80GB SXM5 提供 8 卡、96 核 CPU、2TB 内存。两者均按月计费,H100 整机月租通常高于 A100;是否值得支付价差,应结合目标模型的实际吞吐、训练时长、互联需求和整机配置评估。具体价格和可用库存以控制台展示为准。

选型应根据模型精度、上下文长度、并发、训练方式、所需 GPU 数量、互联拓扑和实际压测结果决定。如果任务能充分利用 H100 的 FP8 或 Transformer Engine 优势,H100 的投入更有回报;如果 A100 的性能已满足目标,A100 的成本效率更高。不确定时可以先从 A100 起步验证流程,再按需升级到 H100。


本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 A100/H100 规格与计费方式,可前往 lifangyun.com 查看。

六、常见问题

1. A100和H100能混用吗?

一般不建议在同一训练任务中混用。不同架构的 GPU 在算力、精度支持和通信带宽上差异较大,混用可能导致负载不均衡和性能瓶颈。多卡训练建议使用同型号 GPU,多节点训练更需保证节点间规格一致。

2. H100的FP8精度会影响模型质量吗?

FP8 是 NVIDIA Hopper 架构引入的低精度格式。在许多训练和推理场景下,FP8 可以在几乎不影响模型质量的前提下提升吞吐。但具体效果取决于模型结构、精度敏感度和框架支持情况,建议先在小规模数据上验证。

3. A100的MIG是什么?有什么用?

MIG(Multi-Instance GPU)是 A100 支持的硬件级分区技术,可以将一张 A100 分为最多 7 个独立实例,每个实例有独立的计算、显存和带宽。适合多租户推理、资源隔离和小任务并行的场景。H100 也支持第二代 MIG,并增加了机密计算能力。

4. 选A100还是H100跑推理?

如果推理框架支持 FP8 且模型是 Transformer 架构,H100 的吞吐优势明显。如果推理规模不大、FP8 软件栈尚未验证,或 A100 的 FP16/BF16 性能已满足延迟与吞吐目标,A100 可能具有更好的成本效率。A100 还可通过 MIG 实现多实例推理,适合需要隔离的多租户场景。

5. 8卡A100和8卡H100的NVLink带宽差多少?

A100 SXM 单 GPU 的双向 NVLink 带宽为 600 GB/s,H100 SXM 为 900 GB/s,后者约为前者的 1.5 倍。8 卡整机的实际通信效率还取决于 NVSwitch 拓扑、通信模式和训练框架,不能仅按该数字直接推算。模型越大、卡间通信越多,带宽差异的影响越明显。