H100单卡算力是多少?8卡集群算力怎么算?

H100 SXM5 单卡 FP32 算力为 67 TFLOPS,FP16 Tensor Core 稀疏峰值约 1,979 TFLOPS;8 卡集群理论峰值约为单卡的 8 倍,但实际吞吐受通信开销、显存带宽、框架效率和模型规模等因素影响,通常低于理论峰值。

一、H100单卡算力规格表

H100 SXM5 基于 NVIDIA Hopper 架构(GH100 芯片),搭载 132 个 SM、528 个第四代 Tensor Core 和 16,896 个 FP32 CUDA 核心。以下是各精度格式的官方算力数据:

精度格式 算力 说明
FP64 34 TFLOPS CUDA 核心,科学计算
FP64 Tensor Core 67 TFLOPS Tensor Core 双精度
FP32 67 TFLOPS CUDA 核心,通用计算基准
TF32 Tensor Core 989* TFLOPS 稀疏模式;非稀疏约 495 TFLOPS
BF16 Tensor Core 1,979* TFLOPS 稀疏模式;非稀疏约 990 TFLOPS
FP16 Tensor Core 1,979* TFLOPS 稀疏模式;非稀疏约 990 TFLOPS
FP8 Tensor Core 3,958* TFLOPS 稀疏模式;非稀疏约 1,979 TFLOPS
INT8 Tensor Core 3,958* TOPS 稀疏模式;非稀疏约 1,979 TOPS

*标注为稀疏模式(sparsity)下的峰值。NVIDIA H100 官方数据表仅公布稀疏模式的 Tensor Core 峰值(脚注原文为"采用稀疏技术显示,不采用稀疏降低一半"),非稀疏值按结构化稀疏的理论 2:1 关系推算;实际任务能否获得稀疏加速,取决于模型、框架与软件实现。

以上数据来自 NVIDIA H100 Tensor Core GPU 数据表(英文版)。不同 NVIDIA 官方页面的标注口径可能存在差异(如部分中文资料中 FP32 标注为 60 TFLOPS、显存带宽标注为 3,000 GB/s);本文采用英文数据表数值,实际采购或租赁时,应以对应 SKU 和供应商规格为准。

二、不同精度算力怎么看

H100 的算力不是一个数字,而是按精度格式分为 CUDA 核心算力Tensor Core 算力两条路径,两者差距可达数十倍。

FP32(67 TFLOPS) 是 CUDA 核心的通用计算基准,适合不能降低精度的科学计算、数值模拟和传统图形任务。FP32 不经过 Tensor Core,是衡量"非 AI 计算能力"的基准线。

TF32 Tensor Core(989* TFLOPS) 是 Hopper 平台在支持的框架与算子上常用的默认矩阵计算加速模式,可在保持 FP32 输入接口的前提下加速部分 FP32 训练。从官方峰值口径看,TF32 Tensor Core 吞吐低于 FP16/BF16;实际效果取决于算子类型、框架和任务。

FP16/BF16 Tensor Core(1,979* TFLOPS) 是 AI 训练的主力精度。BF16 和 FP16 的 Tensor Core 峰值相同,但 BF16 拥有与 FP32 相同的指数位(8 位),数值范围更大,训练稳定性更好。从非稀疏口径看,FP16/BF16 Tensor Core 约为 FP32 CUDA 核心的 15 倍——这是理论峰值口径,不代表实际任务会按该倍数加速。

FP8 Tensor Core(3,958* TFLOPS) 是 H100 相对 A100 的关键新增精度。FP8 在保证可接受精度的前提下大幅提升吞吐量,配合 Transformer Engine 可在训练和推理中获得低精度加速。FP8 的稀疏峰值约为 FP16 的 2 倍,是 H100 所有精度中最高的 TFLOPS 值。

INT8 Tensor Core(3,958* TOPS) 主要用于推理量化场景。需要注意的是,TOPS(每秒万亿次整数运算)与 TFLOPS(每秒万亿次浮点运算)衡量的是不同类型运算,不能直接按数值比较 INT8 和 FP8 的实际性能。若模型和框架对 INT8 支持良好,INT8 量化通常值得优先评估,常能带来更高吞吐;但实际表现仍取决于模型、软件栈和压测结果。

三、8卡集群算力怎么算

理论峰值计算

8 卡集群的理论峰值最简单的计算方式是单卡峰值 × 8

精度格式 单卡(稀疏) 8 卡理论峰值
FP32 67 TFLOPS 536 TFLOPS
FP16/BF16 TC 1,979* TFLOPS 15,832* TFLOPS
FP8 TC 3,958* TFLOPS 31,664* TFLOPS
INT8 TC 3,958* TOPS 31,664* TOPS

以上为理论峰值,实际集群吞吐通常低于该值。

NVIDIA HGX H100 平台级数据

NVIDIA 在 HGX H100 8-GPU 平台介绍中给出了平台级算力数据:FP8 约 32,000 TFLOPS、FP16 约 16,000 TFLOPS、FP64 约 480 TFLOPS。其中 FP8 和 FP16 的数值与稀疏模式单卡 × 8 的计算结果接近(平台级数据做了取整)。FP64 的情况需区分口径:单卡 FP64 CUDA 核心为 34 TFLOPS(34 × 8 = 272),单卡 FP64 Tensor Core 为 67 TFLOPS(67 × 8 = 536),而平台级 FP64 数值(480 TFLOPS)介于两者之间。这也说明平台级宣传数据与单卡规格表的口径不一定一一对应,解读时需要区分具体精度、是否稀疏以及页面采用的统计口径。

为什么实际吞吐低于理论峰值

通信开销。分布式训练需要在 GPU 之间同步梯度、参数和中间结果,即使有 NVLink 和 NVSwitch 加速,通信延迟和带宽仍会占用时间。通信密集型任务(如大模型 AllReduce)的实际效率通常明显低于计算峰值。

显存带宽限制。H100 SXM5 的显存带宽为 3.35 TB/s,当计算任务受显存访问限制时(memory-bound),Tensor Core 的计算峰值无法被充分利用。

框架效率。NCCL 通信、数据加载、检查点保存、日志记录和算子启动开销都会降低实际效率。框架版本、编译优化和算子实现质量也直接影响吞吐。

模型规模和 batch size。batch size 决定了计算强度与通信的比例。小 batch 下通信占比更高,效率更低;大 batch 下计算占比更高,更接近峰值。模型参数量和上下文长度也会影响显存占用和通信量。

四、NVLink和NVSwitch在8卡集群中的作用

H100SXM5 支持第四代 NVLink,单 GPU 双向带宽为 900 GB/s,通过 18 条 NVLink 连接实现。8 卡 H100 集群通过第三代 NVSwitch 实现全互联拓扑。

HGX H100 8-GPU 板载 4 个第三代 NVSwitch,每个 NVSwitch 是全无阻塞交换芯片,将 8 张 H100 全部互联。这一拓扑使每张 H100 都能通过 NVSwitch 接入 900 GB/s 的双向聚合 NVLink 交换带宽,适合多 GPU 并发通信。NVSwitch 还支持 SHARP(Scalable Hierarchical Aggregation and Reduction Protocol) 网络内计算,可加速 AllReduce 等集合通信操作,降低 GPU 通信负载。

需要注意的是,900 GB/s 是单 GPU 的 NVLink 双向带宽规格,不是整台 8 卡服务器的总带宽。8 卡整机的实际通信效率还取决于 NVSwitch 拓扑、通信模式和训练框架,不能仅按该数字直接推算集群总带宽。

通过 NVLink Switch System,H100 还可扩展到更大规模的多 GPU 系统;具体拓扑与部署形态以 NVIDIA 官方系统方案为准。

五、在立方云上怎么用

立方云当前提供 H100 相关裸金属资源,用户可在对应实例上进行大规模训练和高吞吐推理。8 卡 H100 集群通过 NVLink/NVSwitch 实现高速互联,适合需要多卡协同的分布式训练任务。具体规格、计费方式和可用库存以控制台展示为准。


本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 GPU 规格与计费方式,可前往 lifangyun.com 查看。

六、常见问题

1. H100单卡FP16算力是多少?

H100 SXM5 的 FP16 Tensor Core 稀疏模式峰值约 1,979 TFLOPS,非稀疏约 990 TFLOPS。NVIDIA 官方数据表仅公布稀疏模式峰值,非稀疏值按 2:1 稀疏比推算;实际吞吐取决于模型、框架和软件实现。

2. 8卡H100算力是单卡的8倍吗?

理论峰值约为单卡的 8 倍(单卡 × 8),但实际吞吐通常低于该值。通信开销、显存带宽、框架效率、模型规模和 batch size 都会影响实际效率。NVIDIA HGX H100 平台级数据(如 FP8 约 32,000 TFLOPS)与稀疏模式单卡 × 8 的计算结果接近,但平台级宣传数据与单卡规格表的口径不一定一一对应,解读时需要区分具体精度、是否稀疏以及页面采用的统计口径。

3. H100的稀疏模式是什么意思?

稀疏模式(Structured Sparsity)是 NVIDIA Tensor Core 的硬件加速特性。当矩阵中 50% 的元素为零且零元素分布满足 2:4 结构化稀疏模式时,Tensor Core 可以跳过零元素计算,理论上将吞吐提升至非稀疏的 2 倍。实际任务能否获得稀疏加速,取决于模型结构和软件栈是否支持稀疏化。

4. H100支持FP8吗?FP8算力是多少?

支持。H100 的第四代 Tensor Core 支持 FP8 精度,稀疏模式峰值约 3,958 TFLOPS,非稀疏约 1,979 TFLOPS。FP8 是 H100 相对 A100 的关键新增精度,配合 Transformer Engine 可在训练和推理中获得低精度加速。实际加速效果取决于模型对 FP8 精度的适配和框架支持。

5. 8卡H100的NVLink总带宽是多少?

H100 SXM5 单 GPU 的 NVLink 双向带宽为 900 GB/s。8 卡整机通过 4 个第三代 NVSwitch 实现全互联拓扑,任意两张 H100 之间可并发通信。900 GB/s 是单 GPU 规格,8 卡整机的实际通信效率还取决于 NVSwitch 拓扑、通信模式和框架实现,不能仅按该数字直接推算总带宽。