H20和A800性能对比,推理场景怎么选?
H20 和 A800 是两代"方向相反"的合规特供卡。A800(Ampere 架构)保留 A100 级算力——FP16 Tensor Core 稠密 312 TFLOPS、INT8 624 TOPS,只把 NVLink 从 600 GB/s 降到 400 GB/s;H20(Hopper 架构)反其道而行——显存升级为 96GB HBM3、4.0 TB/s,Tensor 算力只剩约 148 TFLOPS(第三方口径),约为 A800 的一半。推理选型看计算访存比:低并发解码受显存带宽主导,H20 的 4.0 TB/s(约为 A800 的 2 倍)提供有利条件;长 prefill 和高并发批量受算力主导,A800 的 Tensor 峰值更高、在同等模型与软件栈下具备潜在优势。H20 独有 FP8 路径和更大显存余量,A800 的 400 GB/s NVLink 与 MIG 分区则有明确规格来源。三卡与 H100/H200 的定位对比可参考《H20、H100、H200有什么区别?一张表看懂定位》。
一、两张卡分别是什么
H20 和 A800 都是 NVIDIA 面向中国市场的合规特供型号,但两者的"合规方式"方向相反。
A800 基于 Ampere 架构,是 A100 在中国市场的替代型号。Lenovo 产品指南明确表述:A800 与 A100 的唯一区别是 NVLink 接口速率——A100 为 600 GB/s,A800 为 400 GB/s,算力、显存等其余规格与 A100 相同;A800 仅在中国大陆、香港和澳门销售。目前 Lenovo 已将该产品指南标注为 withdrawn(撤市),NVIDIA 中国区 A800 页面也已重定向无法访问。
H20 基于 Hopper 架构(GH100 芯片家族,仅启用部分 SM),是更晚一代的合规供货型号,削减思路与 A800 相反:显存保留 Hopper 级配置(96GB HBM3、4.0 TB/s),Tensor Core 算力大幅削减。H20 没有 NVIDIA 官方数据表,相关规格均为第三方口径。
规格口径说明:本文 A800 数据来自 Lenovo 官方产品指南的规格表,H20 数据沿用多来源交叉的第三方口径(与《H20单卡算力多少?显存和计算能力该怎么看》一致)。两者来源层级不同,对比时应以对应 SKU 和供应商规格为准。
二、核心规格对比
以 A800 80GB SXM 与 H20 芯片级规格为基准:
| 规格项 | H20(第三方口径) | A800 80GB SXM(Lenovo 规格) | 对比 |
|---|---|---|---|
| 架构 | Hopper(第四代 Tensor Core) | Ampere(第三代 Tensor Core) | 差一代 |
| 显存容量 | 96GB HBM3 | 80GB HBM2e | H20 约 1.2 倍 |
| 显存带宽 | 4.0 TB/s | 2,039 GB/s | H20 约 2 倍 |
| FP32 | ~44 TFLOPS | 19.5 TFLOPS | H20 约 2.3 倍 |
| TF32 Tensor Core | ~74 TFLOPS(稠密) | 156 / 312* TFLOPS | A800 约 2.1 倍(稠密口径) |
| FP16/BF16 Tensor Core | ~148 TFLOPS(稠密) | 312 / 624* TFLOPS | A800 约 2.1 倍(稠密口径) |
| INT8 Tensor Core | ~296 TOPS | 624 / 1,248* TOPS | A800 约 2.1 倍 |
| INT4 Tensor Core | 第三方资料未提供可核验值 | 1,248 / 2,496* TOPS | A800 有规格来源 |
| FP8 Tensor Core | ~296 TFLOPS(稠密) | 不支持(Ampere 无 FP8) | H20 支持 |
| FP64 | ~1 TFLOPS | 9.7 TFLOPS(TC 19.5) | A800 显著更高 |
| NVLink | 信息冲突,不采用 | 400 GB/s(Lenovo 确认) | A800 有已核验数值 |
| MIG | 未见可靠公开资料 | 最多 7 实例(每实例 10GB) | A800 确认支持 |
| TDP | ~400W | PCIe 300W / SXM 模组 500W | 同量级 |
*A800 标注为结构化稀疏(sparsity)口径,来自 Lenovo 规格表;H20 一列为第三方稠密口径;Flopper 还列出 FP8 带结构化稀疏为 592 TFLOPS,但该数值同样未经 NVIDIA 官方数据表确认。两个口径的数值不能直接相除比较。
注:A800 PCIe 版显存带宽为 1,935 GB/s、功耗 300W,通过 NVLink 桥接支持最高 2 卡互联;SXM 版为 2,039 GB/s。H20 的封装形态以供应商 SKU 为准,本文按芯片级规格对比。
三、算力对比:A800 的 Tensor 算力约为 H20 的 2 倍
Tensor Core 维度 A800 全面占优。FP16/BF16 稠密 312 对 148 TFLOPS、INT8 624 对 296 TOPS、TF32 156 对 74 TFLOPS——A800 的 Tensor 算力约为 H20 的 2.1 倍。这与两卡的定位直接相关:A800 完整保留了 A100 的 Tensor Core 配置,H20 则大幅削减了 Tensor 算力。
但 FP32 出现反转。H20 约 44 TFLOPS,反而约为 A800(19.5 TFLOPS)的 2.3 倍——H20 削减的主要是 Tensor Core 算力,CUDA 核心算力保留较多;A800 沿用 A100 的 FP32 配置。对以 Tensor Core 为主的 AI 推理影响不大,但说明"H20 算力全面低于 A800"的说法不准确,只有 Tensor 维度如此。FP64 上 A800(9.7 TFLOPS)远高于 H20(约 1 TFLOPS),科学计算类任务两者都不算首选。
FP8 是 H20 的独有路径。Hopper 架构引入 FP8 精度与 Transformer Engine,H20 保留了 FP8(第三方口径稠密约 296 TFLOPS);Ampere 架构的 A800 不支持 FP8。反过来,A800 支持 INT4 Tensor Core(1,248 / 2,496* TOPS);本文采用的 H20 第三方资料未提供可核验的 INT4 峰值,故不将其纳入规格比较——这不代表 H20 无低精度推理路径,实际可用精度应以对应模型、推理框架、量化后端和供应商资料为准。
四、显存对比:H20 容量与带宽都占优
容量 96GB 对 80GB。按 FP16/BF16 裸权重估算(每参数约 2 字节),96GB 对应约 48B 参数、80GB 对应约 40B 参数;实际部署必须为 KV Cache、激活值、框架与运行时开销留出空间,单卡可部署上限低于该估算。以 70B 模型 INT8 量化为例(裸权重约 70GB):H20 单卡剩余约 26GB,A800 剩余约 10GB——长上下文、高并发的 KV Cache 开销下,H20 的余量更充裕。
带宽 4.0 TB/s 对 2,039 GB/s。H20 约为 A800 的 2 倍;对 A800 PCIe 版(1,935 GB/s)差距更大。推理的解码阶段每生成一个 token 都要访问模型权重,是典型的访存主导环节,H20 的带宽在这一环节提供有利条件。但端到端生成速度还受量化格式、算子实现、batch、缓存与算力共同影响,不能仅凭带宽断定快慢,应以目标模型的实测结果为准。
五、推理场景怎么选
推理可以拆成两个阶段看瓶颈:
Prefill(预填充)阶段算力主导。批量处理输入 prompt 是计算密集环节;在相同模型、精度和软件栈下,A800 更高的 Tensor Core 峰值提供潜在优势,但实际吞吐仍取决于模型结构、量化、batch、Attention 实现与 KV Cache,应以目标服务压测结果决定。H20 若使用 FP8 量化(需模型与框架支持)可缩小差距。
Decode(解码)阶段访存主导。逐 token 生成时每步都要读取权重,小并发下显存带宽是主要瓶颈,H20 的 4.0 TB/s 提供有利条件;并发增大后计算逐渐成为上限,A800 更高的算力峰值转为有利条件。
具体场景建议:
- 单卡装大模型(如 70B INT8):倾向 H20。70GB 裸权重下 H20 余量约 26GB,A800 约 10GB 较紧,长上下文场景可能受限。
- 高并发吞吐服务:倾向 A800。并发上来后算力成为瓶颈,在相同模型、精度和软件栈下 A800 更高的 Tensor 峰值提供潜在优势;H20 需借助 FP8 量化或多卡部署,最终以压测结果决定。
- 低并发、长上下文生成:倾向 H20。带宽主导且 KV Cache 占用大,H20 的两项显存指标都有利。
- 多租户小模型推理:倾向 A800。MIG 最多分 7 个实例(每实例 10GB),适合隔离部署多个小模型;H20 的 MIG 支持情况未见可靠公开资料,需向供应商确认。
- 多卡张量并行:倾向 A800。A800 的 NVLink 400 GB/s 有明确规格来源;H20 的 NVLink 配置公开资料存在不一致信息,部署多卡前应向供应商确认互联拓扑。
共同注意:两者的实际表现都取决于模型结构、量化方案、框架实现与并发结构,选型前建议以目标模型实测为准。
六、在立方云上怎么选
立方云目前未上架H20 或 A800,大模型推理可评估在售的 H200 141GB(8 卡整机,页面标注带宽 4.8 TB/s)与 H100 80G SXM5(8 卡整机,页面标注带宽 3.0 TB/s);中小模型推理与开发验证可选 RTX 5090 32GB(单卡按小时计费,页面标价 ¥2.98/时)或 PRO 6000 96GB(单卡按小时计费,页面标价 ¥7.90/时)。以上为页面展示信息,具体规格、价格与可用库存以控制台实时展示为准。
本文首发于立方云技术博客。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力服务平台,提供裸金属与容器实例服务。如需了解当前可用 GPU 规格与计费方式,可前往 lifangyun.com 查看。
七、常见问题
1. H20和A800跑推理谁更快?
分阶段与并发结构看:prefill 和高并发批量下,相同模型与软件栈时 A800 更高的 Tensor 峰值提供潜在优势;低并发的 decode 阶段 H20 的带宽提供有利条件。若 H20 采用 FP8 量化且框架支持,可部分抵消算力差距。不能脱离模型和并发结构直接下结论,应以实测为准。
2. 70B模型选H20还是A800?
FP16 均需 2 卡(裸权重约 140GB)。INT8 单卡均可装入(约 70GB),但 H20 剩余约 26GB、A800 约 10GB,长上下文和高并发的 KV Cache 开销下 H20 更稳;追求吞吐则 A800(含双卡)的峰值更高,同等条件下更有利。还需结合量化方案的精度损失与框架支持评估。
3. H20算力只有A800的一半,为什么还常被推荐用于推理?
推理的 decode 阶段多为访存主导,且实际部署常受显存容量约束;H20 的 96GB 容量和 4.0 TB/s 带宽恰好覆盖这两个环节。但对高并发、prefill 密集的服务,A800 更高的 Tensor 峰值是重要考量——"适合推理"不等于"推理全面更快",具体以目标服务压测为准。
4. 两张卡分别支持什么量化精度?
A800(Ampere):INT8、INT4 Tensor Core,均为 Lenovo 规格表口径。H20(Hopper):本文采用的第三方资料列出 INT8 与 FP8 峰值,未提供可核验的 INT4 与结构化稀疏数值;FP8 需模型和推理框架支持。实际可用精度与性能应以对应模型、量化后端、框架版本和供应商资料为准。
5. A800和A100有什么区别?
Lenovo 产品指南表述:唯一区别是 NVLink 接口速率——A100 为 600 GB/s、A800 为 400 GB/s,算力与显存规格相同;A800 仅在中国大陆、香港和澳门销售。