
多卡RTX 5090部署为什么需要液冷或涡轮散热?
RTX 5090 的常见消费级 AIC 卡多为开放式散热:风扇将热量排入机箱空间,再依赖整机风道带走。在普通塔式机箱、卡间距不足或风道不足时,堆叠 3–4 张以上可能出现热再循环;而旗舰三风扇卡 3.8 槽的厚度在标准 ATX 的 7 条扩展槽位上也难以直插 4 张。常见路径包括涡轮版卡(双槽、从 I/O 挡板侧定向排风)、液冷(卡身压薄、将热量转移至冷排),或采用专用服务器风道与机房部署。

RTX 5090 的常见消费级 AIC 卡多为开放式散热:风扇将热量排入机箱空间,再依赖整机风道带走。在普通塔式机箱、卡间距不足或风道不足时,堆叠 3–4 张以上可能出现热再循环;而旗舰三风扇卡 3.8 槽的厚度在标准 ATX 的 7 条扩展槽位上也难以直插 4 张。常见路径包括涡轮版卡(双槽、从 I/O 挡板侧定向排风)、液冷(卡身压薄、将热量转移至冷排),或采用专用服务器风道与机房部署。

RTX 5090D 是 NVIDIA 面向中国大陆市场推出销售的 RTX 5090 对应版本。两者同为 Blackwell 架构、21,760 个 CUDA 核心与 PCIe 5.0 接口;RTX 5090 的官方参考显卡功耗为 575W,5090D 首发版则应以具体 AIC 型号规格单为准。核心差异在 AI 算力:RTX 5090 官方标注 3,352 AI TOPS,RTX 5090D 为 2,375 AI TOPS,理论峰值低约 29%,对本地大模型推理、AI 绘图等 Tensor 负载的影响大于对传统游戏的影响。另外要注意版本:2025 年 8 月起市场上出现了显存配置调整的 RTX 5090D v2(24GB GDDR7、384 位、1,344GB/s,对比标准版的 32GB、512 位、1,792GB/s),游戏帧率和显存敏感负载的差距都会进一步拉开。选购或对比评测数据时,先确认具体版本与规格单。

H20 是面向 HGX 类多 GPU 平台的数据中心 GPU:单卡 96GB HBM3、4.0TB/s 显存带宽、TDP 400W(可配置),公开资料口径支持最多 7 个 MIG 实例。若 OEM 提供 H20 的 HGX Hopper 8-GPU 配置,8 张卡的聚合显存可达 768GB;浪潮、新华三等平台的公开规格可作为 HGX Hopper 8-GPU 服务器在形态、供电、尺寸与环境方面的参考,但 H20 的具体封装形态、可配置 GPU 数量及是否为某台整机当前可订购配置,应以厂商配置单或正式数据表确认。功耗上,GPU 部分按 8×400W 计约为 3.2kW;整机输入功耗取决于 CPU、内存、存储、网卡、散热与电源冗余配置,公开第三方口径存在分歧,本文不设定固定整机满载值,应以厂商功耗计算器或整机数据表额定值为准。H20 没有 NVIDIA 官方 DGX 整机作参照,整机规格与功耗以具体 OEM 配置单为准。

按官方数据表同口径推算,B200 相比 H100 的张量算力提升在各主要精度上较为均匀:FP8、FP16/BF16、TF32、INT8 均约 2.3 倍,原生 NVFP4 低精度是 Blackwell 新增档;显存容量与带宽约 2.4 倍(80GB HBM3 → 192GB HBM3e、3.35TB/s → 8TB/s),节点内 NVLink 互连带宽翻倍(900GB/s → 1.8TB/s);FP32 与 FP64 等通用算力仅约 1.1 倍。时间线上,B200 与升级款 Blackwell Ultra 目前均已出货,下一代 Rubin 平台已宣布进入全面量产、伙伴出货自 2026 下半年开始。要不要等下一代,取决于你的任务是验证推理类(现有卡型即可启动)还是重资产的大规模训练采购(值得结合 Rubin 上市窗口评估单位成本),而不是单纯追新。

H100 的单卡功耗按形态分三档:SXM 版 TDP 最高可配置至 700W,PCIe 版 300–350W(可配置),NVL 版 350–400W(可配置),实际功耗随负载动态变化。8 卡 H100 服务器以 NVIDIA DGX H100 为参考,官方额定整机功耗最高 10.2 kW,其中 8 张 GPU 满载占 5.6 kW,其余为 CPU、内存、存储、网络与散热风扇;一项针对单个 8-GPU H100 HGX 节点的公开实测,在最大利用率压力测试下观察到最高约 8.4 kW。机房层面需要 200–240V AC 专用配电(6 路 C19/C20 冗余供电)、10 kW 级的单机供电与制冷容量、8U 机架空间与约 130kg 的承重能力——具体数值以所选整机型号的官方数据表为准。

H100 与 H800 对应的 80GB SXM 或 PCIe SKU,在主流 AI 精度(FP32、TF32、BF16/FP16、FP8、INT8)、显存容量和标称显存带宽上大体一致;核心规格差异主要集中在 FP64 双精度性能与 NVLink 互联带宽——H800 SXM 的 FP64 约 1 TFLOPS(H100 SXM 为 34 TFLOPS),NVLink 400 GB/s(H100 SXM 为 900 GB/s)。因此跑主流 AI 负载、单机或少卡场景,两者通常接近;以 FP64 为刚需的传统 HPC,或高通信密度的大规模并行训练,才是两者拉开差距的场景。

没有单一倍数,先问精度和任务:FP64 上 1 张 H100 SXM 约相当于 26 张 4090(34 对约 1.3 TFLOPS);FP16/BF16 与 FP8/INT8 的 Tensor 稠密理论峰值约相当于 3 张(约 989 对约 330 TFLOPS、约 1,979 对约 660 TOPS);显存容量与带宽约为 3.3 倍(80GB HBM 对 24GB GDDR6X、3.35TB/s 对约 1TB/s);FP32 则是 4090 更高(82.6 对 67 TFLOPS),游戏与图形任务仍应选 4090。理论峰值也不等于实际吞吐,还取决于模型、精度、batch、框架与多卡互联效率。

8 卡 A100 服务器的 GPU 部分功耗:80GB SXM 标准配置为 8×400W,合计约 3.2kW;NVIDIA DGX A100 整机数据表标注最大功率 6.5kW,多出的部分来自 CPU、内存、NVMe 存储、InfiniBand 网卡、电源转换损耗和散热风扇。以下温度和热量数值以 DGX A100 为例:单台对应约 2.2 万 BTU/h 的热量、5–30°C 的环境温度要求和机房级电路;其他 8 卡 A100/HGX OEM 服务器应以厂商整机数据表为准。PCIe 形态单卡 TDP 为 300W,8 卡 GPU 部分约 2.4kW,整机功率以具体配置为准。

A100 和 A800 同属 NVIDIA Ampere 架构的数据中心 GPU,80GB 主流规格的计算性能、显存配置与 MIG 能力基本对应;核心差异是多卡互联带宽——A100 的 NVLink 为 600 GB/s,A800 为 400 GB/s(SXM 与 PCIe 桥接形态均是如此)。具体 SKU 的 TDP 与散热方案仍须按产品数据表核对,例如部分 A800 SXM CTS SKU 最高可达 500W。A800 是 NVIDIA 面向中国大陆市场提供的 A100 系列版本。单卡任务通常没有由 NVLink 差异带来的性能差别,实际仍应结合具体整机配置、功耗和价格选择。

A100 不对应游戏显卡序列里的任何一个"级别"——它是 NVIDIA 2020 年发布的 Ampere 架构数据中心计算卡,与 RTX 4090(2022 年 Ada Lovelace 消费旗舰)属于两条产品线。和 4090 相比:FP32 图形算力反而是 4090 高,约为 A100 的 4 倍;FP16/BF16 Tensor 稠密理论峰值两卡接近(A100 312 对 4090 约 330 TFLOPS);而在大模型任务更看重的显存与互联维度上 A100 占优——显存容量约 3.3 倍(80GB vs 24GB)、显存带宽约 2 倍(2,039 vs 1,008 GB/s),并支持 NVLink 600 GB/s 多卡互联。两张卡该按任务选,而不是按"级别"排高下。

RTX 5090 属于 GeForce 消费级产品线,NVIDIA 未定义单独的"服务器版 RTX 5090"。所谓服务器/工作站版,通常指搭载 GeForce RTX 5090 板卡的整机方案;而 NVIDIA 真正面向工作站的专业卡是 RTX PRO 6000 系列(96GB 带 ECC 显存),与 GeForce 属于两条产品线。

RTX 5090 多卡间通信经 PCIe 完成;模型可单卡容纳时,通常优先采用数据并行。更大模型则需评估 ZeRO/FSDP 等显存分片方案,7B 以上全参训练还受单卡 32GB 显存与 PCIe 带宽双重限制。

多卡GPU服务器按卡间通信需求选型:数据并行训练小中型模型、多实例推理这类通信量小的任务,PCIe 互联机型即可;单卡装不下、需要在卡间做张量并行的大模型训练与推理,通常优先选择具备 NVLink/NVSwitch 的整机;单机 8 卡不够、要为 GPU 跨机训练通信扩展时,通常需要 InfiniBand 或 RoCE 高速网络。RTX 5090 不支持 NVLink,多卡通信经 PCIe;其接口支持 PCIe 5.0,理论 x16 双向带宽约 128 GB/s,实际链路速率和可用带宽需以服务器 CPU、槽位和 PCIe 交换拓扑为准。

在常规 PyTorch CUDA 训练或推理路径中,GPU 显存不足通常会触发 CUDA out of memory 并中断;只有显式启用 CPU offload、分片或其他内存迁移策略时,任务才可能避免即时 OOM,但通常以明显性能下降为代价。估算方法:推理显存 ≈ 权重 + KV Cache + 运行开销;训练显存还要再加梯度与优化器状态(混合精度 Adam 训练约每参数 16 字节),需按精度、上下文与并发留足余量。

A100 和 V100 跨越了一代中间架构(Volta → Turing → Ampere),在数据中心 GPU 路线上属于隔代升级,A100 在算力、显存、带宽、互联和功能特性上全面领先;老 V100 集群是否值得升级,取决于当前任务瓶颈和升级成本——如果任务受限于显存容量、Tensor Core 算力或互联带宽,升级到 A100 收益明显;如果现有 V100 已满足吞吐且折旧已完成,短期未必需要更换。