RTX 5090的算力是多少TOPS?和4090差多少?

RTX 5090官方标称AI算力为3,352 AI TOPS,RTX 4090为1,321 AI TOPS,官方口径下约2.5倍。但AI TOPS是FP4稀疏精度下的峰值营销指标,实际AI任务更常用FP16/BF16/INT8等精度,此时两者的差距主要由显存带宽(+78%)和显存容量(+8GB)决定,而非单纯的算力倍数。两张卡均不支持NVLink,多卡训练效率受限。

一、核心规格速查表:官方口径 vs 实际关注点

规格项 RTX 5090 RTX 4090 差距
架构 Blackwell (GB202) Ada Lovelace (AD102) 新一代
制程 TSMC 4NP TSMC 4N 同代工艺优化版
CUDA核心 21,760 16,384 +33%
Tensor Core 680 (5th Gen) 512 (4th Gen) +33%
显存 32GB GDDR7 24GB GDDR6X +8GB (+33%)
显存带宽 ~1,792 GB/s ~1,008 GB/s +78%
FP32算力 ~105 TFLOPS ~83 TFLOPS +27%
AI TOPS(官方标称) 3,352 1,321 约2.5倍
TDP 575W 450W +28%
PCIe Gen 5 x16 Gen 4 x16 带宽翻倍
NVLink 不支持 不支持 两者均无

数据来源:NVIDIA官方产品页。NVIDIA消费级产品页未提供FP16/FP8/FP4等细分Tensor运算规格的独立官方标称值,上表仅列出官方明确给出的规格项。

关键提醒:上表中的"AI TOPS"是NVIDIA在消费级产品页使用的统一营销口径,通常对应FP4稀疏精度下的峰值吞吐。实际AI任务中常用的FP16/BF16/INT8等精度,并没有独立的官方细分运算规格可供直接横向对照,因此不建议用AI TOPS的倍数直接外推为实际模型性能倍数。

二、"AI TOPS"到底是什么?别被营销数字误导

1. RTX 5090的3,352 AI TOPS是怎么来的?

NVIDIA官方给RTX 5090标注的"3,352 AI TOPS",是基于FP4精度、结构化稀疏模式下的峰值吞吐。这个数字的成立需要同时满足多个条件:

  • FP4精度:4位浮点,目前主流推理框架(vLLM、TRT-LLM等)对FP4的支持仍在成熟中,实际生产部署中常见FP16/BF16、INT8和INT4等方案;FP4、FP8的可用性取决于GPU、推理框架、量化工具链和模型兼容性
  • 结构化稀疏:2:4稀疏模式,即每4个权重中至少有2个为零;结构化稀疏的性能收益需要模型满足该稀疏模式,并由软件栈启用对应加速路径;未满足条件时,不应按稀疏峰值估算实际性能
  • 理想流水线:无内存瓶颈、无框架开销、无数据传输延迟

换句话说,3,352 AI TOPS是理论峰值,不是实际可获得的持续性能。在FP16/BF16等更常用的精度下,实际吞吐会显著低于该数字。

2. 为什么显存带宽比算力数字更值得关注?

对于当前大多数AI推理任务,尤其是大语言模型的低batch自回归Decode阶段,显存带宽往往是真正的性能瓶颈——每生成一个Token都需要从显存读取模型权重。但Prefill、高并发、MoE、量化模型或图像生成任务中,性能还可能受计算吞吐、KV Cache、调度与框架实现影响,不能一概而论。

RTX 5090相比4090最显著的规格跃升不是CUDA核心数(+33%),而是显存带宽(+78%)。带宽越高,权重读取越快,Token生成速度(tokens/sec)通常越高。但具体提升幅度还取决于模型结构、batch size、并发数和框架效率。

3. FP4和FP8:精度支持的实际意义

FP4:5090独有,但生态仍在成熟

RTX 5090支持FP4,RTX 4090不支持。FP4可将权重体积相比FP8再减半,意味着32GB显存可以装入更大模型。但当前vLLM、TRT-LLM等框架对FP4的支持仍在完善中,且FP4的精度损失需要针对具体模型验证。除非你的推理框架和模型已明确支持FP4且精度验证通过,否则不要仅以"支持FP4"作为选型依据。

FP8:两者都支持,但实现效率不同

RTX 5090和RTX 4090都支持FP8推理,但实现方式不同。RTX 5090的5th Gen Tensor Core原生支持FP8,吞吐效率通常更高;RTX 4090的4th Gen Tensor Core也支持FP8,但在部分框架和驱动版本中可能需要特定配置才能启用最优路径。实际吞吐需以目标模型、推理框架和部署配置下的压测结果为准。

三、显存容量:32GB vs 24GB的临界点

RTX 5090的32GB显存比RTX 4090的24GB多出8GB,这8GB在以下场景中是硬门槛

  • 13B模型FP16推理:纯权重约26GB,RTX 5090的32GB更接近单卡部署条件,但仍需为KV Cache、运行时缓存和框架开销预留空间;RTX 4090的24GB在较长上下文或较高并发下容易OOM
  • 32B模型量化推理:采用4bit量化后的权重通常仍需十几到二十多GB显存,实际占用因量化格式和框架而异;32GB可提供更大的部署余量,24GB则较为紧张
  • QLoRA微调:13B模型若采用FP16保存基座权重,单卡32GB的可用batch和上下文会受到明显限制;QLoRA通过量化基座模型可显著降低显存占用,但具体能否跑通还取决于量化格式、适配器规模和训练配置

对于7B以下模型,24GB通常够用,32GB的优势不明显。显存容量的价值随模型规模线性放大。

四、功耗和散热:575W不是小数字

RTX 5090的TDP为575W,比RTX 4090的450W高出28%。这意味着:

  • 电源需求:RTX 5090 Founders Edition的官方整机电源建议为1000W;具体还应结合CPU、硬盘数量、超频状态及显卡厂商的供电要求确认
  • 散热压力:需要机箱有足够风道,或选择涡轮散热版本用于服务器部署
  • 租赁成本:不同平台的价格差异受地区、租期、供需、CPU/内存配置和网络服务影响,应以同一平台的实时实例报价和单位任务成本比较

在数据中心或云平台租用场景下,功耗成本已内化到租赁价格中,用户更需关注的是单位任务成本(如每百万Token成本、每张图片成本),而非单纯的硬件性能。

五、一句话总结:什么时候选5090,什么时候选4090?

场景 推荐卡型 理由
13B模型FP16推理、32B模型量化推理或较大规模QLoRA微调 RTX 5090 32GB显存可提供更大的部署余量,带宽优势在大模型上更显著
7B以下模型推理/开发 RTX 4090 24GB够用,单位成本更低,生态更成熟
需要FP4精度探索 RTX 5090 唯一选择,但需确认框架和模型支持
预算敏感、低并发 RTX 4090 时租价格低,小模型上性价比更高
高并发批量推理 RTX 5090 带宽优势在高并发下通常更充分释放

立方云提供RTX 5090等GPU算力租赁服务,支持按需实例和裸金属形态。如需验证具体模型在RTX 5090上的推理性能,建议直接以实际业务参数进行测试。具体卡型、价格和可用配置以 lifangyun.com 实时展示为准。

六、常见问题

1. RTX 5090的3,352 AI TOPS是实际性能吗?

不是。3,352 AI TOPS是FP4稀疏精度下的理论峰值,实际持续性能受模型结构、精度、显存带宽、上下文、batch、并发和软件实现共同影响。在FP16/BF16等常用精度下,实际吞吐通常显著低于该数字。

2. RTX 5090比RTX 4090快多少?

RTX 5090的官方AI TOPS、显存容量和显存带宽均高于RTX 4090;具体模型的实际速度提升应以统一框架和参数下的压测结果为准。显存带宽提升78%在理论上对内存受限型任务(如大模型低batch Decode)帮助最大,但实际收益还取决于模型、框架和并发配置。

3. RTX 5090支持NVLink吗?多卡训练效率如何?

不支持。RTX 5090和RTX 4090均为消费级卡,无NVLink。多卡训练依赖PCIe 5.0(5090)或PCIe 4.0(4090)通信,卡间带宽远低于数据中心GPU(如H100 SXM的900 GB/s NVLink)。多卡数据并行可行,但大模型分布式训练的扩展效率会受限。

4. 32GB显存能跑多大的模型?

单卡FP16精度下:7B–13B模型通常更容易部署;32B模型往往需要4bit量化或更激进的压缩。具体能跑多大还取决于上下文长度、并发数、KV Cache占用和框架开销。32GB对13B FP16是"更接近单卡部署条件"而非" comfortably 装入",上下文一长或并发一高仍可能OOM。

5. RTX 4090已经够用,有必要升级5090吗?

如果你主要跑7B以下模型、开发调试或低并发服务,RTX 4090性价比更高,升级边际收益有限。如果你需要跑13B–32B模型、高并发推理或探索FP4,RTX 5090的显存和带宽优势是硬提升。建议以实际任务在两种卡型上跑基准测试,再按单位任务成本决策。


本文首发于立方云技术博客。立方云是网鼎科技旗下专注GPU算力租赁的平台,提供裸金属与容器实例服务。如需体验,请访问 lifangyun.com