H100的SXM和PCIe版本有什么区别?

H100 SXM和 PCIe 基于同一颗 GH100 芯片,区别在封装形态和规格取舍:SXM(常写作 SXM5)是贴装在服务器基板上的高功耗模组,132 个 SM、80GB HBM3、3.35 TB/s 显存带宽、900 GB/s NVLink、最高 700W;PCIe 是标准双槽风冷显卡,114 个 SM、80GB HBM2e、2 TB/s 带宽、600 GB/s NVLink、300-350W,算力约为 SXM 版的 76%、显存带宽约 60%。大规模训练优先 SXM,推理和灵活部署可考虑 PCIe。算力口径可参考《H100单卡算力是多少?8卡集群算力怎么算》

一、SXM和PCIe核心区别总览

对比项 H100 SXM H100 PCIe
芯片 GH100(Hopper) GH100(Hopper)
SM 数量 132 114
FP32 CUDA 核心 16,896 14,592
第四代 Tensor Core 528 456
显存 80GB HBM3 80GB HBM2e
显存带宽 3.35 TB/s 2 TB/s
FP16 Tensor Core(稀疏) 1,979 TFLOPS 1,513 TFLOPS
FP8 Tensor Core(稀疏) 3,958 TFLOPS 3,026 TFLOPS
L2 缓存 50MB 50MB
NVLink 900 GB/s 600 GB/s
PCIe 接口 无(板贴模组) Gen5 x16,128 GB/s
最大 TDP 最高 700W(可配置) 300-350W(可配置)
MIG 最多 7 实例(每个 10GB) 最多 7 实例(每个 10GB)
形态 板贴模组,随 HGX/DGX 整机交付 标准双槽风冷 PCIe 卡

两者最核心的差异可以概括为三点:形态不同(板贴模组 vs 标准显卡)、规模不同(132 SM vs 114 SM)、配套规格不同(HBM3/900 GB/s NVLink/700W vs HBM2e/600 GB/s NVLink/350W 级)。

二、形态与部署方式

SXM 是 NVIDIA 的板贴模组形态:GPU 不做成独立显卡,而是通过专用插座直接安装在服务器基板(如 HGX H100 基板)上,供电、散热和卡间互联都由整机设计承载。NVIDIA 数据表列出的 SXM 服务器选项为 HGX H100 合作伙伴系统和 DGX H100,配置 4 或 8 张 GPU。这意味着 SXM 版本一般随整机采购,不能像显卡一样插入普通服务器。

H100 PCIe 是标准双槽风冷显卡,走 PCIe Gen5 x16 插槽,可装入通用机架服务器。NVIDIA 数据表列出的服务器选项为合作伙伴和 NVIDIA 认证系统,配置 1-8 张 GPU。PCIe 版本可以按需加装,前提是确认服务器供电、散热和物理空间满足 350W 级显卡的要求。

从采购角度:SXM 适合整体规划的高密度算力集群;PCIe 适合在现有服务器上按需扩容、或从低卡数起步的团队。

三、芯片配置差异:114 SM vs 132 SM

两个版本使用同一颗 GH100 芯片(完整芯片为 144 个 SM),差异在于启用的规模:

配置项 H100 SXM H100 PCIe 完整 GH100
SM 数量 132 114 144
FP32 CUDA 核心 16,896 14,592 18,432
第四代 Tensor Core 528 456 576
L2 缓存 50MB 50MB 60MB

PCIe 版启用的 SM 数量约为 SXM 版的 86%。需要注意的是,削减的只是 SM 数量:两个版本的单个 SM 结构相同,均含 128 个 FP32 CUDA 核心和 4 个第四代 Tensor Core;整卡 L2 缓存容量也均为 50MB。因此两者的架构特性一致,差别主要在总规模和配套的显存、功耗、互联规格。

四、显存差异:HBM3 vs HBM2e

两个版本的显存容量相同(均为 80GB),但类型和带宽不同:

显存配置 H100 SXM H100 PCIe
显存类型 HBM3 HBM2e
显存容量 80GB 80GB
显存带宽 3.35 TB/s 2 TB/s(约为 SXM 的 60%)
堆叠数 5 个 5 个
内存控制器 10 × 512-bit 10 × 512-bit

带宽差距约 40%,主要来自 HBM3 相对 HBM2e 更高的数据速率(详见《H100的显存和带宽是多少?为什么适合大模型训练?》)。对能装入 80GB 显存的模型,两个版本都能加载;差距体现在访存效率上——训练中的权重/梯度/优化器状态读写、推理中高并发下的 KV Cache 读取等带宽密集环节,SXM 版更有优势。

五、算力差异

两个版本在各精度下的官方算力数据(NVIDIA H100 数据表口径):

精度格式 H100 SXM H100 PCIe PCIe/SXM 口径
FP64 34 TFLOPS 26 TFLOPS 约 76% 非稀疏峰值
FP64 Tensor Core 67 TFLOPS 51 TFLOPS 约 76% 非稀疏峰值
FP32 67 TFLOPS 51 TFLOPS 约 76% 非稀疏峰值
TF32 Tensor Core 989 TFLOPS 756 TFLOPS 约 76% 稀疏峰值*
BFLOAT16 Tensor Core 1,979 TFLOPS 1,513 TFLOPS 约 76% 稀疏峰值*
FP16 Tensor Core 1,979 TFLOPS 1,513 TFLOPS 约 76% 稀疏峰值*
FP8 Tensor Core 3,958 TFLOPS 3,026 TFLOPS 约 76% 稀疏峰值*
INT8 Tensor Core 3,958 TOPS 3,026 TOPS 约 76% 稀疏峰值*

*仅标 * 的行(Tensor Core 各精度)为稀疏模式(sparsity)下的峰值,其非稀疏值未在数据表中列出,按结构化稀疏的理论 2:1 关系推算约为表中值的一半。FP64 与 FP32 行为非稀疏的真实峰值,不需要减半。实际任务能否获得稀疏加速,取决于模型、框架与软件实现。

表中列出的各精度峰值比例均约为 76%,低于 SM 数量比例约 86%,该差异与两个 SKU 的时钟、功耗及整体规格配置有关。实际任务的性能差距还受显存带宽和互联影响:访存密集或通信密集的任务中,PCIe 版与 SXM 版的差距可能大于 24% 的峰值算力差;计算密集且单卡可容纳的任务中,差距会更接近峰值比例。SXM 版各精度口径的详细解读可参考《H100单卡算力是多少?8卡集群算力怎么算》

六、互联能力差异

互联是两个版本在多卡场景下差距最大的环节:

互联项 H100 SXM H100 PCIe
NVLink 规格 900 GB/s 600 GB/s
多卡互联 HGX/DGX 等配备 NVSwitch 的系统可实现 4 或 8 卡互联 需 NVLink 桥接,最高 2 卡;桥接配置以板卡和服务器厂商资料为准
无 NVLink 时 PCIe Gen5 x16,128 GB/s

SXM 版的 900 GB/s 是单 GPU 的 NVLink 互连规格,多卡全互联能力取决于服务器中的 NVSwitch 拓扑。PCIe 版通过 NVLink 桥接可实现最高 2 卡互联(600 GB/s);不使用桥接时,卡间通信走 PCIe Gen5(128 GB/s),与 NVLink 差距明显。

对训练的影响:大模型训练常用的张量并行(tensor parallelism)对卡间带宽和延迟高度敏感,2 卡上限意味着 PCIe 版基本无法承担需要大规模张量并行的训练任务;SXM 版配 NVSwitch 的 8 卡系统是这类任务的主流配置。对推理的影响:多卡推理若采用张量并行切分,同样受互联制约;流水线并行对带宽相对不敏感,PCIe 双卡也可承担。

七、功耗与散热

项目 H100 SXM H100 PCIe
最大 TDP 最高 700W(可配置) 300-350W(可配置)
散热 整机方案承载(HGX/DGX) 标准风冷,双槽
供电 由服务器基板供电 PCIe 插槽 + 外接供电

SXM 版功耗约为 PCIe 版的两倍,其供电和散热由 HGX/DGX 整机设计统一承载,8 卡整机对机房供电和散热的要求显著更高。PCIe 版 350W 级双槽风冷设计对通用服务器和普通机房更友好,部署门槛更低。

八、训练和推理怎么选

大规模训练:选 SXM。 多卡分布式训练、张量并行、需要 NVSwitch 全互联的场景,SXM 版在算力(约 +31%)、显存带宽(约 +68%)和互联(900 GB/s + NVSwitch 多卡)三个维度全面领先。

小规模训练/微调:PCIe 可满足。 模型可以装入单卡或双卡显存、且不依赖大规模张量并行的微调任务,PCIe 版 80GB 显存可承载与 SXM 相同规模的模型,性价比更高。

推理:按并发和规模选。 中低并发、单卡或双卡部署的推理服务,PCIe 版够用;高并发、KV Cache 带宽敏感或需要 4 卡以上切分的大模型推理,SXM 版更合适。两个版本都支持 MIG(最多 7 个 10GB 实例),适合多租户小模型推理。

补充:H100 NVL。 NVIDIA 当前产品页还列出 H100 NVL:基于 PCIe 的双卡形态,通过 NVLink 桥接配对交付,面向大模型推理场景。产品页规格表标注单卡 94GB HBM3 显存、3.9 TB/s 带宽;同一页面正文及 2023 版数据表按配对总量记为 188GB,两种口径并存,选购时应注意区分单卡与配对数值。它与单卡 H100 PCIe 是不同 SKU。H100 在产品线中的定位可参考《H20、H100、H200有什么区别?一张表看懂定位》

九、在立方云上怎么选

立方云当前页面列出 H100 80G SXM5 的 8 卡按月方案,页面标注显存带宽为 3.0 TB/s(该标注为平台页面口径,NVIDIA 官方 H100 SXM 峰值为 3.35 TB/s),暂未列出 H100 PCIe 版本。对大模型训练和高吞吐推理需求,可优先评估该 SXM5 方案;实例形态、具体规格、计费方式和可用库存以平台控制台实时展示为准。


本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 GPU 规格与计费方式,可前往 lifangyun.com 查看。

常见问题

1. H100 PCIe 能用于大模型训练吗?

可以,但适合中小规模。PCIe 版有 80GB 显存,能加载与 SXM 版相同规模的模型,单卡或双卡微调、LoRA 等任务可以胜任。限制在多卡扩展:NVLink 桥接最高 2 卡(600 GB/s),无法像 SXM 版那样通过 NVSwitch 组 8 卡全互联,大规模张量并行训练不适合。

2. SXM 和 PCIe 的性能差距有多大?

峰值口径下,表中列出的各精度峰值比例均约为 76%(其中 Tensor Core 各精度为稀疏口径,FP64/FP32 为非稀疏真实峰值),显存带宽约为 60%。实际差距取决于任务类型:访存密集或通信密集的任务差距可能更大,计算密集且单卡可容纳的任务差距更接近 24% 的算力峰值差。不能简单按单一比例推算。

3. H100 PCIe 可以插在普通服务器上吗?

可以。H100 PCIe 是标准双槽风冷 PCIe Gen5 x16 显卡,可装入通用机架服务器,NVIDIA 数据表列出的服务器配置为 1-8 卡。部署前需确认服务器的供电(350W 级)、散热和物理空间(双槽)满足要求。

4. H100 NVL 是什么?和 SXM/PCIe 什么关系?

H100 NVL 是 NVIDIA 当前产品页列出的第三种形态:基于 PCIe 的双卡通过 NVLink 桥接配对交付,面向大模型推理。产品页规格表标注单卡 94GB HBM3 显存、3.9 TB/s 带宽;配对总量约 188GB(产品页正文与 2023 版数据表采用该口径),两种口径并存。它与单卡 H100 PCIe 是不同 SKU,采购时应注意区分。

5. SXM 和 PCIe 都支持 MIG 吗?

支持。两个版本均支持第二代 MIG(多实例 GPU),单卡最多可切分为 7 个 10GB 实例,适合多租户推理和中小任务隔离,可用于在一张卡上并行服务多个模型或用户。