H100单卡算力是多少?8卡集群算力怎么算?
H100 SXM5 单卡 FP32 算力为 67 TFLOPS,FP16 Tensor Core 稀疏峰值约 1,979 TFLOPS;8 卡集群理论峰值约为单卡的 8 倍,但实际吞吐受通信开销、显存带宽、框架效率和模型规模等因素影响,通常低于理论峰值。
一、H100单卡算力规格表
H100 SXM5 基于 NVIDIA Hopper 架构(GH100 芯片),搭载 132 个 SM、528 个第四代 Tensor Core 和 16,896 个 FP32 CUDA 核心。以下是各精度格式的官方算力数据:
| 精度格式 | 算力 | 说明 |
|---|---|---|
| FP64 | 34 TFLOPS | CUDA 核心,科学计算 |
| FP64 Tensor Core | 67 TFLOPS | Tensor Core 双精度 |
| FP32 | 67 TFLOPS | CUDA 核心,通用计算基准 |
| TF32 Tensor Core | 989* TFLOPS | 稀疏模式;非稀疏约 495 TFLOPS |
| BF16 Tensor Core | 1,979* TFLOPS | 稀疏模式;非稀疏约 990 TFLOPS |
| FP16 Tensor Core | 1,979* TFLOPS | 稀疏模式;非稀疏约 990 TFLOPS |
| FP8 Tensor Core | 3,958* TFLOPS | 稀疏模式;非稀疏约 1,979 TFLOPS |
| INT8 Tensor Core | 3,958* TOPS | 稀疏模式;非稀疏约 1,979 TOPS |
*标注为稀疏模式(sparsity)下的峰值。NVIDIA H100 官方数据表仅公布稀疏模式的 Tensor Core 峰值(脚注原文为"采用稀疏技术显示,不采用稀疏降低一半"),非稀疏值按结构化稀疏的理论 2:1 关系推算;实际任务能否获得稀疏加速,取决于模型、框架与软件实现。
以上数据来自 NVIDIA H100 Tensor Core GPU 数据表(英文版)。不同 NVIDIA 官方页面的标注口径可能存在差异(如部分中文资料中 FP32 标注为 60 TFLOPS、显存带宽标注为 3,000 GB/s);本文采用英文数据表数值,实际采购或租赁时,应以对应 SKU 和供应商规格为准。
二、不同精度算力怎么看
H100 的算力不是一个数字,而是按精度格式分为 CUDA 核心算力和 Tensor Core 算力两条路径,两者差距可达数十倍。
FP32(67 TFLOPS) 是 CUDA 核心的通用计算基准,适合不能降低精度的科学计算、数值模拟和传统图形任务。FP32 不经过 Tensor Core,是衡量"非 AI 计算能力"的基准线。
TF32 Tensor Core(989* TFLOPS) 是 Hopper 平台在支持的框架与算子上常用的默认矩阵计算加速模式,可在保持 FP32 输入接口的前提下加速部分 FP32 训练。从官方峰值口径看,TF32 Tensor Core 吞吐低于 FP16/BF16;实际效果取决于算子类型、框架和任务。
FP16/BF16 Tensor Core(1,979* TFLOPS) 是 AI 训练的主力精度。BF16 和 FP16 的 Tensor Core 峰值相同,但 BF16 拥有与 FP32 相同的指数位(8 位),数值范围更大,训练稳定性更好。从非稀疏口径看,FP16/BF16 Tensor Core 约为 FP32 CUDA 核心的 15 倍——这是理论峰值口径,不代表实际任务会按该倍数加速。
FP8 Tensor Core(3,958* TFLOPS) 是 H100 相对 A100 的关键新增精度。FP8 在保证可接受精度的前提下大幅提升吞吐量,配合 Transformer Engine 可在训练和推理中获得低精度加速。FP8 的稀疏峰值约为 FP16 的 2 倍,是 H100 所有精度中最高的 TFLOPS 值。
INT8 Tensor Core(3,958* TOPS) 主要用于推理量化场景。需要注意的是,TOPS(每秒万亿次整数运算)与 TFLOPS(每秒万亿次浮点运算)衡量的是不同类型运算,不能直接按数值比较 INT8 和 FP8 的实际性能。若模型和框架对 INT8 支持良好,INT8 量化通常值得优先评估,常能带来更高吞吐;但实际表现仍取决于模型、软件栈和压测结果。
三、8卡集群算力怎么算
理论峰值计算
8 卡集群的理论峰值最简单的计算方式是单卡峰值 × 8:
| 精度格式 | 单卡(稀疏) | 8 卡理论峰值 |
|---|---|---|
| FP32 | 67 TFLOPS | 536 TFLOPS |
| FP16/BF16 TC | 1,979* TFLOPS | 15,832* TFLOPS |
| FP8 TC | 3,958* TFLOPS | 31,664* TFLOPS |
| INT8 TC | 3,958* TOPS | 31,664* TOPS |
以上为理论峰值,实际集群吞吐通常低于该值。
NVIDIA HGX H100 平台级数据
NVIDIA 在 HGX H100 8-GPU 平台介绍中给出了平台级算力数据:FP8 约 32,000 TFLOPS、FP16 约 16,000 TFLOPS、FP64 约 480 TFLOPS。其中 FP8 和 FP16 的数值与稀疏模式单卡 × 8 的计算结果接近(平台级数据做了取整)。FP64 的情况需区分口径:单卡 FP64 CUDA 核心为 34 TFLOPS(34 × 8 = 272),单卡 FP64 Tensor Core 为 67 TFLOPS(67 × 8 = 536),而平台级 FP64 数值(480 TFLOPS)介于两者之间。这也说明平台级宣传数据与单卡规格表的口径不一定一一对应,解读时需要区分具体精度、是否稀疏以及页面采用的统计口径。
为什么实际吞吐低于理论峰值
通信开销。分布式训练需要在 GPU 之间同步梯度、参数和中间结果,即使有 NVLink 和 NVSwitch 加速,通信延迟和带宽仍会占用时间。通信密集型任务(如大模型 AllReduce)的实际效率通常明显低于计算峰值。
显存带宽限制。H100 SXM5 的显存带宽为 3.35 TB/s,当计算任务受显存访问限制时(memory-bound),Tensor Core 的计算峰值无法被充分利用。
框架效率。NCCL 通信、数据加载、检查点保存、日志记录和算子启动开销都会降低实际效率。框架版本、编译优化和算子实现质量也直接影响吞吐。
模型规模和 batch size。batch size 决定了计算强度与通信的比例。小 batch 下通信占比更高,效率更低;大 batch 下计算占比更高,更接近峰值。模型参数量和上下文长度也会影响显存占用和通信量。
四、NVLink和NVSwitch在8卡集群中的作用
H100SXM5 支持第四代 NVLink,单 GPU 双向带宽为 900 GB/s,通过 18 条 NVLink 连接实现。8 卡 H100 集群通过第三代 NVSwitch 实现全互联拓扑。
HGX H100 8-GPU 板载 4 个第三代 NVSwitch,每个 NVSwitch 是全无阻塞交换芯片,将 8 张 H100 全部互联。这一拓扑使每张 H100 都能通过 NVSwitch 接入 900 GB/s 的双向聚合 NVLink 交换带宽,适合多 GPU 并发通信。NVSwitch 还支持 SHARP(Scalable Hierarchical Aggregation and Reduction Protocol) 网络内计算,可加速 AllReduce 等集合通信操作,降低 GPU 通信负载。
需要注意的是,900 GB/s 是单 GPU 的 NVLink 双向带宽规格,不是整台 8 卡服务器的总带宽。8 卡整机的实际通信效率还取决于 NVSwitch 拓扑、通信模式和训练框架,不能仅按该数字直接推算集群总带宽。
通过 NVLink Switch System,H100 还可扩展到更大规模的多 GPU 系统;具体拓扑与部署形态以 NVIDIA 官方系统方案为准。
五、在立方云上怎么用
立方云当前提供 H100 相关裸金属资源,用户可在对应实例上进行大规模训练和高吞吐推理。8 卡 H100 集群通过 NVLink/NVSwitch 实现高速互联,适合需要多卡协同的分布式训练任务。具体规格、计费方式和可用库存以控制台展示为准。
本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 GPU 规格与计费方式,可前往 lifangyun.com 查看。
六、常见问题
1. H100单卡FP16算力是多少?
H100 SXM5 的 FP16 Tensor Core 稀疏模式峰值约 1,979 TFLOPS,非稀疏约 990 TFLOPS。NVIDIA 官方数据表仅公布稀疏模式峰值,非稀疏值按 2:1 稀疏比推算;实际吞吐取决于模型、框架和软件实现。
2. 8卡H100算力是单卡的8倍吗?
理论峰值约为单卡的 8 倍(单卡 × 8),但实际吞吐通常低于该值。通信开销、显存带宽、框架效率、模型规模和 batch size 都会影响实际效率。NVIDIA HGX H100 平台级数据(如 FP8 约 32,000 TFLOPS)与稀疏模式单卡 × 8 的计算结果接近,但平台级宣传数据与单卡规格表的口径不一定一一对应,解读时需要区分具体精度、是否稀疏以及页面采用的统计口径。
3. H100的稀疏模式是什么意思?
稀疏模式(Structured Sparsity)是 NVIDIA Tensor Core 的硬件加速特性。当矩阵中 50% 的元素为零且零元素分布满足 2:4 结构化稀疏模式时,Tensor Core 可以跳过零元素计算,理论上将吞吐提升至非稀疏的 2 倍。实际任务能否获得稀疏加速,取决于模型结构和软件栈是否支持稀疏化。
4. H100支持FP8吗?FP8算力是多少?
支持。H100 的第四代 Tensor Core 支持 FP8 精度,稀疏模式峰值约 3,958 TFLOPS,非稀疏约 1,979 TFLOPS。FP8 是 H100 相对 A100 的关键新增精度,配合 Transformer Engine 可在训练和推理中获得低精度加速。实际加速效果取决于模型对 FP8 精度的适配和框架支持。
5. 8卡H100的NVLink总带宽是多少?
H100 SXM5 单 GPU 的 NVLink 双向带宽为 900 GB/s。8 卡整机通过 4 个第三代 NVSwitch 实现全互联拓扑,任意两张 H100 之间可并发通信。900 GB/s 是单 GPU 规格,8 卡整机的实际通信效率还取决于 NVSwitch 拓扑、通信模式和框架实现,不能仅按该数字直接推算总带宽。