H20显存多大?适合跑什么规模的大模型推理?

H20 显存为 96GB HBM3、带宽 4.0 TB/s(第三方口径)。按裸权重估算,单卡 FP16/BF16 约可容纳 48B 参数、INT8 约 96B、INT4 约 192B;实际可部署规模还需扣除 KV Cache、量化元数据与运行时开销,需留余量。

一、H20的显存规格是多少?

H20 配备 96GB HBM3 显存、4.0 TB/s 显存带宽。需要说明的是,NVIDIA 未发布 H20 官方数据表,该规格为第三方数据库多来源交叉一致的口径(与《H20单卡算力多少?显存和计算能力该怎么看》一致),具体以对应 SKU 和供应商规格为准。

放在同期数据中心 GPU 里看,96GB 属于大显存档位

GPU 显存容量 显存带宽 口径说明
H20 96GB HBM3 4.0 TB/s 第三方口径
H100 80GB(SXM5) 80GB HBM3 官方 3.35 TB/s 官方数据表;立方云页面标注 3.0 TB/s
H200 141GB HBM3e 4.8 TB/s 官方与立方云页面口径一致
RTX PRO 6000(96GB) 96GB 页面标注 1.57 TB/s 立方云页面口径
RTX 5090 32GB 页面标注 1.79 TB/s 立方云页面口径

两点解读:

  • 容量决定"装不装得下":H20 的 96GB 大于 H100 80GB,小于 H200 141GB,与 RTX PRO 6000 同为 96GB 档。模型权重放不进显存,任务就无法在该卡上直接运行。

  • 带宽决定"读得多快":推理解码阶段每生成一个 token 都要读取权重,4.0 TB/s 在这一环节提供有利条件;但端到端速度还受算力、量化与软件栈影响,不能仅凭带宽下结论,应以实测为准。

二、大模型推理的显存占用怎么估算?

推理显存 = 模型权重 + KV Cache + 激活值 + 运行时开销。权重只是起点,很多"理论能跑"的配置在加上后三项后就会超出显存。

第一项:权重,按精度换算。常用估算:FP16/BF16 每参数约 2 字节,INT8 约 1 字节,INT4 约 0.5 字节(weight-only 量化,量化元数据另计)。同一个模型,量化一档,权重占用减半。

第二项:KV Cache,随上下文和并发线性增长。估算公式:每 token KV Cache ≈ 2 × 层数 × KV 头数 × 头维度 × 每元素字节数。以 Llama 2 70B(80 层、8 KV 头、头维度 128,GQA 结构)FP16 推理为例:2 × 80 × 8 × 128 × 2 字节 ≈ 0.31 MB/token;32K 上下文单请求约需 10.7GB,10 路并发约 107GB。注意力结构不同(MHA/GQA/MLA)差异很大,应以具体模型为准。

第三、四项:激活值与运行时开销。批处理激活值随 batch 增大;CUDA 上下文、框架缓冲、通信缓冲等运行时开销则难以用公式估算。本文不给固定预留值,建议部署后以实际占用监控为准,投产前用目标负载压测。

结论:可部署规模显著低于裸权重上限。模型越大、上下文越长、并发越高,三项开销越大,实际能跑的规模就越要往下降。

三、H20单卡能跑多大规模的模型?

按裸权重估算(96GB 显存,未含 KV Cache 与运行时开销),H20 单卡的容量上限为:FP16/BF16 约 48B 参数、INT8 约 96B、INT4 约 192B。落到常见模型规模上:

模型规模 精度 裸权重占用 剩余空间(近似) 单卡判断
7B FP16 14GB 约 82GB 宽松,可支撑长上下文与较高并发
14B FP16 28GB 约 68GB 宽松
32B FP16 64GB 约 32GB 可部署,需按上下文与并发评估 KV Cache
70B FP16 140GB 超出显存 单卡装不下,需多卡或量化
70B INT8 70GB 约 26GB 可加载,余量有限,适合低并发或受控上下文
70B INT4 35GB 约 61GB 余量较大

具体建议:

  • 7B–14B:从容。权重只占 14–28GB,剩余空间足以支撑较长上下文和不错的并发,是 H20 单卡上最宽松的区间。

  • 32B:FP16 可部署但需精算。剩余约 32GB 要装 KV Cache 与开销,长上下文或高并发会吃紧,可改用 INT8/INT4 腾出空间。

  • 70B:看精度。FP16 约 140GB 单卡装不下;INT8 约 70GB 可加载但余量仅约 26GB,更适合低并发或受控上下文配置;INT4 约 35GB 余量较大,是 H20 单卡跑 70B 级模型的现实路径。

  • MoE 模型另算。以 DeepSeek-R1(671B 总参数、37B 激活,MoE 架构)为例:推理时全部专家权重仍需驻留显存(不考虑 CPU offload 等优化时),INT4 裸权重约 335GB,单卡 H20 装不下;8 卡 H20 合计 768GB,按裸权重理论可容纳,但实际还需扣除 KV Cache、路由与运行时开销,且多卡方案需先向供应商确认互联拓扑。37B 激活参数影响的是计算量而非权重存储,不能按 37B 估算显存。也可考虑 R1-Distill 系列蒸馏版(70B 及以下稠密模型),按上表稠密模型口径评估。

注意:以上均为"能装下"的容量判断。显存够不等于跑得快——H20 的 FP16 Tensor Core 算力(约 148 TFLOPS,稠密)约为 H100 SXM5(约 990 TFLOPS)的 15%,在 prefill 密集、高并发的场景算力可能先于显存成为瓶颈,最终以目标负载压测为准。

四、哪些推理场景最能发挥H20的显存?

  • 长上下文生成:KV Cache 随上下文线性增长,96GB 提供了装下长序列 KV Cache 的空间,配合 4.0 TB/s 带宽在解码阶段提供有利条件。

  • 高并发服务:多路请求的 KV Cache 叠加占用大,大显存直接决定并发上限;但并发推高后计算逐渐成为瓶颈,H20 算力有限,需压测确认。

  • 中模型量化部署:70B INT8/INT4、32B FP16 这类"权重接近或超过 80GB 门槛"的配置,正是 96GB 相对 80GB 卡的价值区间。

  • 显存敏感而非算力敏感的任务:如低并发、长输出的生成式服务,瓶颈更多在访存而非计算,对 H20 更友好。

不适合的方向:双精度科学计算(H20 的 FP64 被大幅削减)、高算力需求的稠密大模型高并发 prefill、以及需要张量并行的大规模部署(H20 的 NVLink 配置公开资料记载不一致,部署前需向供应商确认)。

五、在立方云上怎么选?

立方云实例暂时未上架 H20;本文 H20 规格仅作选型科普参照,不代表平台在售。具体可用型号、库存和计费方式以控制台实时展示为准。

如果你的目标是"96GB 大显存推理",可评估页面在售的 PRO 6000 96GB(单卡按小时计费,页面标价 ¥7.90/时,页面标注带宽 1.57 TB/s):显存容量与 H20 同为 96GB,但页面标注带宽低于 H20 的第三方口径 4.0 TB/s,且两者口径来源不同,不能直接推断快慢;更大规模的推理可评估页面展示的 H200 141GB 8 卡整机(页面标注带宽 4.8 TB/s)与 H100 80G SXM5 8 卡整机(页面标注带宽 3.0 TB/s),均为获取报价模式。中小模型开发验证可选 RTX 5090 32GB(单卡按小时计费,页面标价 ¥2.98/时)。以上为页面展示信息,具体规格、价格与可用库存以控制台实时展示为准。


本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 GPU 规格与计费方式,可前往 lifangyun.com 查看。

六、常见问题

1. H20显存比H100大吗?

大。H20 为 96GB HBM3(第三方口径),H100 80GB SXM5 为 80GB HBM3。但 H20 的 Tensor Core 算力约为 H100 的 15%,显存大不等于整体更强,装得下与跑得快是两回事。

2. H20单卡能跑70B模型吗?

看精度:FP16 裸权重约 140GB,单卡装不下;INT8 约 70GB,可加载但余量约 26GB,适合低并发或受控上下文;INT4 约 35GB,余量较大,是单卡跑 70B 的现实路径。

3. H20能跑DeepSeek-R1吗?

完整版 R1 是 671B 总参数(37B 激活)的 MoE 模型,INT4 裸权重约 335GB,单卡 H20 装不下;8 卡 H20 合计 768GB 按裸权重理论可容纳,实际需扣除开销并确认互联拓扑。单卡可考虑 R1-Distill 蒸馏版(70B 及以下稠密模型)。

4. KV Cache大约占多少显存?

取决于模型结构,每 token 约等于 2 × 层数 × KV 头数 × 头维度 × 每元素字节数。以 Llama 2 70B(80 层、8 KV 头、128 维)FP16 为例约 0.31 MB/token,32K 上下文单请求约 10.7GB,随并发数线性叠加。

5. H20显存不够用怎么办?

按顺序考虑:降低量化精度(INT8/INT4)、限制上下文长度与并发数、使用 KV Cache 量化;仍不够则需多卡张量并行——H20 的 NVLink 配置公开资料记载不一致,多卡部署前需向供应商确认互联方式与拓扑。