H20单卡算力多少?显存和计算能力该怎么看?
H20 是 Hopper 架构的降算力型号:单卡 FP16 Tensor Core 稠密算力约 148 TFLOPS、FP32 约 44 TFLOPS(均为第三方口径),Tensor Core 算力约为 H100 的 15%,FP32 约为 H100 的 66%;但显存为 96GB HBM3、带宽 4.0 TB/s,容量和带宽均高于 H100 SXM5。看 H20 的规格要把算力和显存分开评估:算力决定计算密集任务的速度,显存容量和带宽决定能装下多大的模型、访存受限时数据搬运有多快。H20 与 H100、H200 的定位对比可参考《H20、H100、H200有什么区别?一张表看懂定位》。
一、H20单卡算力规格表
先说明数据来源:NVIDIA 未公开 H20 的官方产品页或数据表,以下算力数据均来自第三方规格整理,非 NVIDIA 官方确认,实际以对应 SKU 和供应商规格为准。
| 规格项 | H20(第三方口径) |
|---|---|
| 架构 | Hopper(GH100 芯片家族,仅启用部分 SM) |
| 显存容量 | 96GB HBM3 |
| 显存带宽 | 4.0 TB/s |
| FP64 | ~1 TFLOPS |
| FP32 | ~44 TFLOPS |
| TF32 Tensor Core(稠密) | ~74 TFLOPS |
| BF16/FP16 Tensor Core(稠密) | ~148 TFLOPS |
| FP8 Tensor Core(稠密) | ~296 TFLOPS |
| INT8 Tensor Core(稠密) | ~296 TOPS |
| TDP | 约 400W(flopper:TDP 400W / Max Power 约 460W) |
H20 与 H100 同属 GH100 芯片家族,但"基于 GH100"不代表拥有 H100 级别的算力:完整 GH100 芯片满配为 144 个 SM,H100 SXM5 启用 132 个,H20 启用的 SM 数量低于 H100 SXM5;公开第三方资料对 H20 具体 SM 数量的记载存在不一致(见文末核查备注),本文不采用未经官方确认的具体值。SM 是 GPU 的基本计算单元,启用数量削减是 H20 计算能力低于 H100 的直接原因之一。
表中 Tensor Core 数值为稠密口径。第三方资料对 H20 稀疏性能的推算约为稠密的 2 倍(如 FP16 约 296 TFLOPS),但该推算未经官方来源确认,实际以具体 SKU 为准。
二、不同精度算力怎么看
H20 的算力不是一个数字,按精度分出明显不同的层次:
FP32(~44 TFLOPS) 是 CUDA 核心的通用计算基准,约为 H100 SXM5(67 TFLOPS)的 66%。H20 的 CUDA 核心削减幅度远小于 Tensor Core,这意味着非 AI 的通用计算任务受影响相对小。
FP16/BF16 Tensor Core(~148 TFLOPS) 是 AI 训练和推理的主力精度,约为 H100 稠密值(990 TFLOPS)的 15%。这是 H20 与 H100 差距最大的维度,也是"H20 算力低"这一说法的主要来源。
FP8 Tensor Core(~296 TFLOPS)。H20 保留了对 FP8 精度和 Transformer Engine 的支持,低精度推理路径没有被砍掉;FP8 约为 FP16 稠密算力的 2 倍,这一比例关系与 H100 一致。
INT8 Tensor Core(~296 TOPS) 主要用于推理量化。TOPS 衡量整数运算、TFLOPS 衡量浮点运算,两者不能按数值直接比较。
FP64(~1 TFLOPS) 被削减到极低水平,不适合科学计算、数值模拟等双精度任务。有此类需求的用户不应考虑 H20。
三、显存和带宽才是H20的强项
H20 与H100的关系可以概括为"算力大幅让步、显存不降反升":
| 对比项 | H20 | H100 SXM5 | 变化 |
|---|---|---|---|
| 显存容量 | 96GB HBM3 | 80GB HBM3 | 约 1.2 倍 |
| 显存带宽 | 4.0 TB/s | 3.35 TB/s | 约 1.19 倍 |
| FP16 Tensor Core(稠密) | ~148 TFLOPS | ~990 TFLOPS | 约 15% |
| FP32 | ~44 TFLOPS | 67 TFLOPS | 约 66% |
两项显存指标各自决定不同的事:
显存容量决定能装下多大的模型。若仅按 FP16/BF16 裸权重以每参数约 2 字节估算,96GB 对应约 48B 参数;实际部署必须为 KV Cache、激活值、框架、工作区及其他运行时开销留出空间。按此口径,30B 级 FP16 模型单卡加载较稳妥,70B 级 FP16 模型(约 140GB)单卡装不下,需要量化或多卡。若采用 INT8 等量化方案,可加载的模型规模相应扩大,具体取决于量化方案和运行时开销。
显存带宽决定访存受限时的速度上限。推理的解码阶段每生成一个 token 都要访问模型权重,小并发下任务主要受带宽而非算力限制。在权重访存占主导的小并发解码场景,H20 的 4.0 TB/s 理论显存带宽提供了有利条件;但实际 token 生成速度仍受量化格式、算子实现、batch、缓存与计算能力共同影响,不能仅凭带宽断定其优于或等同于 H100,应以目标模型的实测结果为准。并发增大后,瓶颈会逐渐转向算力,H20 的 Tensor Core 峰值就开始构成上限。
与 H200(141GB HBM3e、4.8 TB/s)相比,H20 的两项显存指标都更低;三者显存维度的完整对比见《H20、H100、H200有什么区别?一张表看懂定位》。
四、算力和显存怎么搭配看
单看算力或单看显存都会误判 H20 的适用范围,关键是看任务的计算访存比——每搬运一个字节的数据需要做多少次计算:
- 计算密集型任务(大 batch 的矩阵乘法、大规模训练):瓶颈在算力。H20 的 Tensor Core 峰值约为 H100 的 15%,此类任务下差距最大。
- 访存密集型任务(小并发的解码推理、长上下文的 KV Cache 读写):瓶颈在显存带宽。在权重访存占主导的场景,H20 的 4.0 TB/s 提供了有利条件,但端到端速度仍受量化格式、算子实现、batch、缓存与算力共同影响,不能仅凭带宽得出性能结论。
- 显存容量受限任务(模型大到装不下):H20 的 96GB 提供了比 H100 80GB 更大的余量。
因此"H20 算力低"和"H20 适合推理"并不矛盾:推理的很多阶段是访存受限的,H20 保留的显存系统在这些阶段具备理论条件;而训练整体是计算密集的,H20 在训练场景的效率会明显受限。实际瓶颈还受模型结构、量化方式、batch size 和框架实现影响,选型前建议以实际压测为准。
五、H20适合什么任务
适合:大模型推理部署(模型能装入 96GB 显存、对吞吐要求不极端)、多模态实验、AIGC 任务、开发调试。H20 也支持 FP8 和 Transformer Engine,低精度推理路径可用。
不适合:大规模训练(Tensor Core 算力约为 H100 的 15%,训练效率明显受限);FP64 科学计算(双精度算力被削减到 ~1 TFLOPS)。
高并发、大 batch 的吞吐型推理会较早撞上算力上限,此类需求建议评估 H100/H200 或多卡方案后再决定。
本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 GPU 规格与计费方式,可前往 lifangyun.com 查看。
六、常见问题
1. H20单卡FP16算力是多少?
第三方口径为稠密约 148 TFLOPS,稀疏推算约 296 TFLOPS。NVIDIA 未公开 H20 官方数据表,稀疏值未经官方确认,实际以对应 SKU 和供应商规格为准。作为参照,H100 SXM5 的 FP16 Tensor Core 稠密值约为 990 TFLOPS,稀疏值约为 1,979 TFLOPS。
2. H20能跑70B模型吗?
FP16 权重约需 140GB,单卡 96GB 装不下,需要两张 H20 或对模型做量化(如 INT8 权重约 70GB)。量化后能否稳定运行还需结合上下文长度、并发、KV Cache 精度和框架开销评估,不能只看权重是否装得下。
3. H20能用来训练吗?
理论上可以,但不推荐。按第三方规格,H20 的 Tensor Core 算力约为 H100 的 15%,训练吞吐会明显受限;H20 更适合推理部署。中小规模的微调实验可以评估,大规模预训练不建议。
4. H20和H100的显存带宽谁高?
H20 更高:4.0 TB/s 对 3.35 TB/s,约为 1.19 倍;显存容量 96GB 对 80GB,约 1.2 倍。但 H100 的算力显著更高,两者面向的任务类型不同。
5. H20的NVLink带宽是多少?
公开第三方资料对 H20 的 NVLink 配置存在不一致信息,NVIDIA 未发布可核验的 H20 官方数据表。部署多卡任务时,应向云服务商或设备供应商确认对应服务器的 GPU 间互联方式、带宽和 NVSwitch 拓扑。