H20和L20有什么区别?推理任务怎么选?

H20 和 L20 是两条完全不同的产品线。H20 基于 Hopper 架构,走数据中心路线:96GB HBM3、4.0 TB/s 带宽,Tensor Core 算力(FP16/BF16 稠密约 148 TFLOPS)和 FP8 路径更适合大模型推理;L20 基于 Ada Lovelace 架构,走工作站/图形虚拟化路线:48GB GDDR6、864 GB/s 带宽,FP32(59.8 TFLOPS)和第四代 Tensor Core 更均衡,功耗仅 275W,且有显示输出与 vGPU 支持。推理选型关键看模型是否装得下:48GB 装不下的模型只能选 H20;两者都能装的小模型,H20 的带宽和显存余量占优,L20 的功耗和规格透明度更优。

一、两张卡分别是什么

H20 是 NVIDIA Hopper 架构(GH100 芯片家族,仅启用部分 SM)的合规特供数据中心 GPU,面向大模型推理场景设计。它没有 NVIDIA 官方产品页或数据表,公开规格均来自第三方整理。核心特点是“算力削减、显存保留”:Tensor Core 算力约为 H100 的 15%,但保留 96GB HBM3 和 4.0 TB/s 带宽,并支持 FP8 与 Transformer Engine。

L20 是 NVIDIA Ada Lovelace 架构的数据中心/工作站 GPU,有官方数据表(Part Number 900-2G133-00A0-000)。它基于与 L40/L40S 相同的架构,但进一步精简 CUDA 核心与功耗,定位在图形渲染、AI 推理和虚拟化等场景。核心特点是“规格透明、功耗低、显存适中”:48GB GDDR6 with ECC、864 GB/s 带宽、TDP 275W,保留 4×DisplayPort 1.4a 和 vGPU 支持。

规格口径说明:本文 H20 数据沿用多来源交叉的第三方口径(与《H20单卡算力多少?显存和计算能力该怎么看》一致),L20 基础规格来自 NVIDIA 官方数据表,Tensor Core 峰值由 HPE QuickSpecs、第三方数据库与 OEM 资料交叉补充。两者来源层级不同,对比时应以对应 SKU 和供应商规格为准。

二、核心规格对比

规格项 H20(第三方口径) L20(NVIDIA 数据表 / OEM 口径) 对比
架构 Hopper(第四代 Tensor Core) Ada Lovelace(第四代 Tensor Core) 差一代
显存容量 96GB HBM3 48GB GDDR6 with ECC H20 2 倍
显存带宽 4.0 TB/s 864 GB/s H20 约 4.6 倍
FP32 ~44 TFLOPS 59.8 TFLOPS L20 约 1.4 倍
FP16/BF16 Tensor Core ~148 TFLOPS(稠密) ~119.5 / 239* TFLOPS H20 约 1.24 倍(稠密口径)
FP8 Tensor Core ~296 TFLOPS(稠密) ~239 / 478* TFLOPS H20 约 1.24 倍(稠密口径)
INT8 Tensor Core ~296 TOPS(稠密) ~239 / 478* TOPS H20 约 1.24 倍(稠密口径)
FP64 ~1 TFLOPS 数据表未列出,Ada 架构该维度通常较低 均不适合双精度任务
NVLink 公开资料信息冲突,正文不采用具体数值 不支持 L20 明确
显示输出 4×DisplayPort 1.4a L20 有
vGPU 未见可靠公开资料 支持 L20 有
TDP 约 400W(flopper:Max Power 约 460W) 275W L20 更低
散热形态 被动散热,双槽全高全长 被动散热,双槽全高全长 相同

*L20 Tensor Core 带结构化稀疏(sparsity)数值来自 HPE QuickSpecs 与第三方数据库整理,稠密值按 2:1 去稀疏处理;H20 一列为第三方稠密口径。两个口径的数值不能直接相除比较。

注:H20 的封装形态与服务器 SKU 以供应商为准;L20 的 Tensor Core 峰值在 NVIDIA 官方数据表中未逐行列出,由 OEM/第三方资料补充,实际以对应 SKU 规格为准。

三、算力对比:H20 Tensor 更高,L20 FP32 更高

Tensor Core 维度 H20 小幅占优。按稠密口径,H20 的 FP16/BF16(~148 TFLOPS)、FP8(~296 TFLOPS)、INT8(~296 TOPS)均约为 L20 对应值的 1.24 倍。这个差距不算悬殊,但对高并发、prefill 密集的推理服务会产生可感知影响。

FP32 维度 L20 反超。L20 的 FP32 为 59.8 TFLOPS,H20 约为 44 TFLOPS——L20 的通用 CUDA 算力更高。这意味着在以 FP32 为主的通用计算、图形渲染或部分传统 AI 工作负载中,L20 反而可能更快。但对当前主流的 Tensor Core 推理(FP16/BF16/FP8/INT8)而言,H20 的峰值更高。

FP8 路径 H20 更成熟。Hopper 架构原生支持 FP8 和 Transformer Engine,H20 保留了这一路径;Ada Lovelace 也支持 FP8(第四代 Tensor Core),但 L20 在该精度下的实际推理生态和框架优化验证相对少于 H20/H100 系列。不过 Ada 的 FP8 硬件能力存在,具体效果取决于模型、框架版本和量化后端。

FP64 两者都不适合。H20 的 FP64 被削减到约 1 TFLOPS,L20 数据表未列出 FP64,Ada 架构该维度通常也不高;科学计算、数值模拟等双精度任务不应优先考虑二者。

四、显存对比:H20 容量与带宽都占优

容量 96GB 对 48GB。按 FP16/BF16 裸权重估算(每参数约 2 字节),96GB 对应约 48B 参数、48GB 对应约 24B 参数;实际部署必须为 KV Cache、激活值、框架与运行时开销留出空间,单卡可部署上限低于该估算。48GB 单卡无法容纳 30B–40B 级 FP16 裸权重;96GB H20 可为约 30B FP16 模型保留较多空间,但部署约 40B FP16 时余量已明显收窄,仍需按 KV Cache、上下文和并发评估。

以 70B 模型 INT8 量化为例,裸权重约 70GB。H20 的 96GB 单卡从容量上可加载该权重,但余量仍需留给 KV Cache、量化元数据和运行时开销,因此更适合低并发或受控上下文配置;L20 48GB 单卡则无法加载。对 13B–20B 模型,两者单卡均可装入,但 H20 的显存余量更充裕,适合长上下文、高并发的 KV Cache 开销。

带宽 4.0 TB/s 对 864 GB/s。H20 约为 L20 的 4.6 倍。推理的解码阶段每生成一个 token 都要访问模型权重,是典型的访存主导环节,H20 的带宽在这一环节提供有利条件。但端到端生成速度还受量化格式、算子实现、batch、缓存与算力共同影响,不能仅凭带宽断定快慢,应以目标模型的实测结果为准。

显存类型差异。H20 采用 HBM3,容量大、带宽高、功耗也高;L20 采用 GDDR6 with ECC,容量和带宽低于 HBM3,但成本与功耗更低。两种显存类型面向的设计取舍不同,不是简单的“谁更好”。

五、推理场景怎么选

推理可以拆成两个阶段看瓶颈:

Prefill(预填充)阶段算力主导。批量处理输入 prompt 是计算密集环节;在相同模型、精度和软件栈下,H20 更高的 Tensor Core 峰值提供潜在优势,但实际吞吐仍取决于模型结构、量化、batch、Attention 实现与 KV Cache,应以目标服务压测结果决定。

Decode(解码)阶段访存主导。逐 token 生成时每步都要读取权重,小并发下显存带宽是主要瓶颈,H20 的 4.0 TB/s 提供有利条件;并发增大后计算逐渐成为上限,H20 的算力优势也会体现。

具体场景建议:

  • 单卡装中大模型:30B FP16 倾向 H20;40B FP16 与 70B INT8 虽可在 96GB 单卡上尝试,但可供 KV Cache 与运行时使用的余量有限,应按目标上下文和并发压测。
  • 小模型低并发、长上下文生成:倾向 H20。带宽主导且 KV Cache 占用大,H20 的两项显存指标都有利。
  • 小模型高并发吞吐服务:可评估 L20。并发上来后算力成为瓶颈,H20 的 Tensor 峰值更高,理论上更有利;但 L20 功耗仅 275W,若单位功耗成本敏感且模型很小,L20 的能效可能更优,最终需以压测为准。
  • 图形渲染、虚拟工作站、vGPU 场景:倾向 L20。L20 有 4×DisplayPort 1.4a 和 vGPU 支持,H20 在这些场景没有对应能力。
  • 多卡张量并行:H20 的 NVLink 配置公开资料存在不一致信息,部署前需向供应商确认;L20 不支持 NVLink,只能走 PCIe 4.0 x16,多卡并行效率受 PCIe 带宽限制更明显。

共同注意:两者的实际表现都取决于模型结构、量化方案、框架实现与并发结构,选型前建议以目标模型实测为准。

六、在立方云上怎么选

大模型推理可评估在售的H200 141GB(8 卡整机,页面标注带宽 4.8 TB/s)与 H100 80G SXM5(8 卡整机,页面标注带宽 3.0 TB/s);中小模型推理与开发验证可选 RTX 5090 32GB(单卡按小时计费,页面标价 ¥2.98/时)或 PRO 6000 96GB(单卡按小时计费,页面标价 ¥7.90/时)。以上为页面展示信息,具体规格、价格与可用库存以控制台实时展示为准。


本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 GPU 规格与计费方式,可前往 lifangyun.com 查看。

七、常见问题

1. H20和L20跑推理谁更快?

分模型大小和并发结构看:30B–40B 级模型及长上下文场景,H20 的显存容量与带宽提供有利条件;极小模型、高并发且功耗成本敏感时,L20 的能效可能更优。两者 Tensor Core 峰值差距约 24%,但实际端到端速度还受量化、框架和 batch 影响,不能脱离模型下结论,应以实测为准。

2. 70B模型选H20还是L20?

FP16 权重约需 140GB,两者单卡都装不下。INT8 权重约 70GB,H20 的 96GB 单卡从容量上可加载该权重,但余量仍需留给 KV Cache、量化元数据和运行时开销,因此更适合低并发或受控上下文配置;L20 48GB 单卡则无法加载。若采用多卡或多卡量化,应优先向供应商确认互联拓扑和实际可用显存。

3. L20能用来做训练吗?

L20 的 FP16/BF16 Tensor Core 峰值约为 119.5 TFLOPS(稠密),与 H20 接近但低于 H100/H200;48GB 显存对当前主流大模型训练也偏紧张。中小规模微调或 LoRA 实验可以评估,大规模训练不建议。

4. H20和L20分别支持什么量化精度?

H20(Hopper):第三方资料列出 INT8 与 FP8 峰值,未提供可核验的 INT4 与结构化稀疏数值;FP8 需模型和推理框架支持。L20(Ada Lovelace):官方数据表未逐行列出 Tensor Core 峰值,OEM/第三方资料列出 FP8/INT8/FP16/BF16 及结构化稀疏数值;INT4 未在常用资料中明确列出。实际可用精度与性能应以对应模型、量化后端、框架版本和供应商资料为准。

5. L20和L40S有什么区别?

L20、L40、L40S 均基于 Ada Lovelace 架构。L40S 是更高功耗、算力更高的版本(48GB GDDR6、FP32 约 91.6 TFLOPS、TDP 350W),L20 则是功耗更低、规格更收敛的版本(CUDA 核心从约 18,176 降至 11,776、FP32 59.8 TFLOPS、TDP 275W),更适合对功耗和成本更敏感的场景。L20 与 L40S 的外观和显存配置相近,但算力与功耗有明显差距。