H100的SXM和PCIe版本有什么区别?
H100 SXM和 PCIe 基于同一颗 GH100 芯片,区别在封装形态和规格取舍:SXM(常写作 SXM5)是贴装在服务器基板上的高功耗模组,132 个 SM、80GB HBM3、3.35 TB/s 显存带宽、900 GB/s NVLink、最高 700W;PCIe 是标准双槽风冷显卡,114 个 SM、80GB HBM2e、2 TB/s 带宽、600 GB/s NVLink、300-350W,算力约为 SXM 版的 76%、显存带宽约 60%。大规模训练优先 SXM,推理和灵活部署可考虑 PCIe。算力口径可参考《H100单卡算力是多少?8卡集群算力怎么算》。
一、SXM和PCIe核心区别总览
| 对比项 | H100 SXM | H100 PCIe |
|---|---|---|
| 芯片 | GH100(Hopper) | GH100(Hopper) |
| SM 数量 | 132 | 114 |
| FP32 CUDA 核心 | 16,896 | 14,592 |
| 第四代 Tensor Core | 528 | 456 |
| 显存 | 80GB HBM3 | 80GB HBM2e |
| 显存带宽 | 3.35 TB/s | 2 TB/s |
| FP16 Tensor Core(稀疏) | 1,979 TFLOPS | 1,513 TFLOPS |
| FP8 Tensor Core(稀疏) | 3,958 TFLOPS | 3,026 TFLOPS |
| L2 缓存 | 50MB | 50MB |
| NVLink | 900 GB/s | 600 GB/s |
| PCIe 接口 | 无(板贴模组) | Gen5 x16,128 GB/s |
| 最大 TDP | 最高 700W(可配置) | 300-350W(可配置) |
| MIG | 最多 7 实例(每个 10GB) | 最多 7 实例(每个 10GB) |
| 形态 | 板贴模组,随 HGX/DGX 整机交付 | 标准双槽风冷 PCIe 卡 |
两者最核心的差异可以概括为三点:形态不同(板贴模组 vs 标准显卡)、规模不同(132 SM vs 114 SM)、配套规格不同(HBM3/900 GB/s NVLink/700W vs HBM2e/600 GB/s NVLink/350W 级)。
二、形态与部署方式
SXM 是 NVIDIA 的板贴模组形态:GPU 不做成独立显卡,而是通过专用插座直接安装在服务器基板(如 HGX H100 基板)上,供电、散热和卡间互联都由整机设计承载。NVIDIA 数据表列出的 SXM 服务器选项为 HGX H100 合作伙伴系统和 DGX H100,配置 4 或 8 张 GPU。这意味着 SXM 版本一般随整机采购,不能像显卡一样插入普通服务器。
H100 PCIe 是标准双槽风冷显卡,走 PCIe Gen5 x16 插槽,可装入通用机架服务器。NVIDIA 数据表列出的服务器选项为合作伙伴和 NVIDIA 认证系统,配置 1-8 张 GPU。PCIe 版本可以按需加装,前提是确认服务器供电、散热和物理空间满足 350W 级显卡的要求。
从采购角度:SXM 适合整体规划的高密度算力集群;PCIe 适合在现有服务器上按需扩容、或从低卡数起步的团队。
三、芯片配置差异:114 SM vs 132 SM
两个版本使用同一颗 GH100 芯片(完整芯片为 144 个 SM),差异在于启用的规模:
| 配置项 | H100 SXM | H100 PCIe | 完整 GH100 |
|---|---|---|---|
| SM 数量 | 132 | 114 | 144 |
| FP32 CUDA 核心 | 16,896 | 14,592 | 18,432 |
| 第四代 Tensor Core | 528 | 456 | 576 |
| L2 缓存 | 50MB | 50MB | 60MB |
PCIe 版启用的 SM 数量约为 SXM 版的 86%。需要注意的是,削减的只是 SM 数量:两个版本的单个 SM 结构相同,均含 128 个 FP32 CUDA 核心和 4 个第四代 Tensor Core;整卡 L2 缓存容量也均为 50MB。因此两者的架构特性一致,差别主要在总规模和配套的显存、功耗、互联规格。
四、显存差异:HBM3 vs HBM2e
两个版本的显存容量相同(均为 80GB),但类型和带宽不同:
| 显存配置 | H100 SXM | H100 PCIe |
|---|---|---|
| 显存类型 | HBM3 | HBM2e |
| 显存容量 | 80GB | 80GB |
| 显存带宽 | 3.35 TB/s | 2 TB/s(约为 SXM 的 60%) |
| 堆叠数 | 5 个 | 5 个 |
| 内存控制器 | 10 × 512-bit | 10 × 512-bit |
带宽差距约 40%,主要来自 HBM3 相对 HBM2e 更高的数据速率(详见《H100的显存和带宽是多少?为什么适合大模型训练?》)。对能装入 80GB 显存的模型,两个版本都能加载;差距体现在访存效率上——训练中的权重/梯度/优化器状态读写、推理中高并发下的 KV Cache 读取等带宽密集环节,SXM 版更有优势。
五、算力差异
两个版本在各精度下的官方算力数据(NVIDIA H100 数据表口径):
| 精度格式 | H100 SXM | H100 PCIe | PCIe/SXM | 口径 |
|---|---|---|---|---|
| FP64 | 34 TFLOPS | 26 TFLOPS | 约 76% | 非稀疏峰值 |
| FP64 Tensor Core | 67 TFLOPS | 51 TFLOPS | 约 76% | 非稀疏峰值 |
| FP32 | 67 TFLOPS | 51 TFLOPS | 约 76% | 非稀疏峰值 |
| TF32 Tensor Core | 989 TFLOPS | 756 TFLOPS | 约 76% | 稀疏峰值* |
| BFLOAT16 Tensor Core | 1,979 TFLOPS | 1,513 TFLOPS | 约 76% | 稀疏峰值* |
| FP16 Tensor Core | 1,979 TFLOPS | 1,513 TFLOPS | 约 76% | 稀疏峰值* |
| FP8 Tensor Core | 3,958 TFLOPS | 3,026 TFLOPS | 约 76% | 稀疏峰值* |
| INT8 Tensor Core | 3,958 TOPS | 3,026 TOPS | 约 76% | 稀疏峰值* |
*仅标 * 的行(Tensor Core 各精度)为稀疏模式(sparsity)下的峰值,其非稀疏值未在数据表中列出,按结构化稀疏的理论 2:1 关系推算约为表中值的一半。FP64 与 FP32 行为非稀疏的真实峰值,不需要减半。实际任务能否获得稀疏加速,取决于模型、框架与软件实现。
表中列出的各精度峰值比例均约为 76%,低于 SM 数量比例约 86%,该差异与两个 SKU 的时钟、功耗及整体规格配置有关。实际任务的性能差距还受显存带宽和互联影响:访存密集或通信密集的任务中,PCIe 版与 SXM 版的差距可能大于 24% 的峰值算力差;计算密集且单卡可容纳的任务中,差距会更接近峰值比例。SXM 版各精度口径的详细解读可参考《H100单卡算力是多少?8卡集群算力怎么算》。
六、互联能力差异
互联是两个版本在多卡场景下差距最大的环节:
| 互联项 | H100 SXM | H100 PCIe |
|---|---|---|
| NVLink 规格 | 900 GB/s | 600 GB/s |
| 多卡互联 | HGX/DGX 等配备 NVSwitch 的系统可实现 4 或 8 卡互联 | 需 NVLink 桥接,最高 2 卡;桥接配置以板卡和服务器厂商资料为准 |
| 无 NVLink 时 | — | PCIe Gen5 x16,128 GB/s |
SXM 版的 900 GB/s 是单 GPU 的 NVLink 互连规格,多卡全互联能力取决于服务器中的 NVSwitch 拓扑。PCIe 版通过 NVLink 桥接可实现最高 2 卡互联(600 GB/s);不使用桥接时,卡间通信走 PCIe Gen5(128 GB/s),与 NVLink 差距明显。
对训练的影响:大模型训练常用的张量并行(tensor parallelism)对卡间带宽和延迟高度敏感,2 卡上限意味着 PCIe 版基本无法承担需要大规模张量并行的训练任务;SXM 版配 NVSwitch 的 8 卡系统是这类任务的主流配置。对推理的影响:多卡推理若采用张量并行切分,同样受互联制约;流水线并行对带宽相对不敏感,PCIe 双卡也可承担。
七、功耗与散热
| 项目 | H100 SXM | H100 PCIe |
|---|---|---|
| 最大 TDP | 最高 700W(可配置) | 300-350W(可配置) |
| 散热 | 整机方案承载(HGX/DGX) | 标准风冷,双槽 |
| 供电 | 由服务器基板供电 | PCIe 插槽 + 外接供电 |
SXM 版功耗约为 PCIe 版的两倍,其供电和散热由 HGX/DGX 整机设计统一承载,8 卡整机对机房供电和散热的要求显著更高。PCIe 版 350W 级双槽风冷设计对通用服务器和普通机房更友好,部署门槛更低。
八、训练和推理怎么选
大规模训练:选 SXM。 多卡分布式训练、张量并行、需要 NVSwitch 全互联的场景,SXM 版在算力(约 +31%)、显存带宽(约 +68%)和互联(900 GB/s + NVSwitch 多卡)三个维度全面领先。
小规模训练/微调:PCIe 可满足。 模型可以装入单卡或双卡显存、且不依赖大规模张量并行的微调任务,PCIe 版 80GB 显存可承载与 SXM 相同规模的模型,性价比更高。
推理:按并发和规模选。 中低并发、单卡或双卡部署的推理服务,PCIe 版够用;高并发、KV Cache 带宽敏感或需要 4 卡以上切分的大模型推理,SXM 版更合适。两个版本都支持 MIG(最多 7 个 10GB 实例),适合多租户小模型推理。
补充:H100 NVL。 NVIDIA 当前产品页还列出 H100 NVL:基于 PCIe 的双卡形态,通过 NVLink 桥接配对交付,面向大模型推理场景。产品页规格表标注单卡 94GB HBM3 显存、3.9 TB/s 带宽;同一页面正文及 2023 版数据表按配对总量记为 188GB,两种口径并存,选购时应注意区分单卡与配对数值。它与单卡 H100 PCIe 是不同 SKU。H100 在产品线中的定位可参考《H20、H100、H200有什么区别?一张表看懂定位》。
九、在立方云上怎么选
立方云当前页面列出 H100 80G SXM5 的 8 卡按月方案,页面标注显存带宽为 3.0 TB/s(该标注为平台页面口径,NVIDIA 官方 H100 SXM 峰值为 3.35 TB/s),暂未列出 H100 PCIe 版本。对大模型训练和高吞吐推理需求,可优先评估该 SXM5 方案;实例形态、具体规格、计费方式和可用库存以平台控制台实时展示为准。
本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 GPU 规格与计费方式,可前往 lifangyun.com 查看。
常见问题
1. H100 PCIe 能用于大模型训练吗?
可以,但适合中小规模。PCIe 版有 80GB 显存,能加载与 SXM 版相同规模的模型,单卡或双卡微调、LoRA 等任务可以胜任。限制在多卡扩展:NVLink 桥接最高 2 卡(600 GB/s),无法像 SXM 版那样通过 NVSwitch 组 8 卡全互联,大规模张量并行训练不适合。
2. SXM 和 PCIe 的性能差距有多大?
峰值口径下,表中列出的各精度峰值比例均约为 76%(其中 Tensor Core 各精度为稀疏口径,FP64/FP32 为非稀疏真实峰值),显存带宽约为 60%。实际差距取决于任务类型:访存密集或通信密集的任务差距可能更大,计算密集且单卡可容纳的任务差距更接近 24% 的算力峰值差。不能简单按单一比例推算。
3. H100 PCIe 可以插在普通服务器上吗?
可以。H100 PCIe 是标准双槽风冷 PCIe Gen5 x16 显卡,可装入通用机架服务器,NVIDIA 数据表列出的服务器配置为 1-8 卡。部署前需确认服务器的供电(350W 级)、散热和物理空间(双槽)满足要求。
4. H100 NVL 是什么?和 SXM/PCIe 什么关系?
H100 NVL 是 NVIDIA 当前产品页列出的第三种形态:基于 PCIe 的双卡通过 NVLink 桥接配对交付,面向大模型推理。产品页规格表标注单卡 94GB HBM3 显存、3.9 TB/s 带宽;配对总量约 188GB(产品页正文与 2023 版数据表采用该口径),两种口径并存。它与单卡 H100 PCIe 是不同 SKU,采购时应注意区分。
5. SXM 和 PCIe 都支持 MIG 吗?
支持。两个版本均支持第二代 MIG(多实例 GPU),单卡最多可切分为 7 个 10GB 实例,适合多租户推理和中小任务隔离,可用于在一张卡上并行服务多个模型或用户。