AI模型推理部署需要什么样的GPU算力?选型与成本指南
一句话答案:推理部署的GPU选型取决于模型规模和并发量——7B-14B模型单卡RTX 5090或A100即可,70B模型需H100/H200或量化后单卡运行,高并发场景推荐vLLM+多卡集群。
一、AI推理和训练,对GPU的要求有什么不同?
推理是“只读”任务,训练是“读写”任务。这个本质差异决定了硬件选型的方向完全不同。
训练时,GPU需要同时存储模型参数、梯度、优化器状态和激活值,显存消耗是推理的3-4倍。推理时模型处于只读状态,显存主要消耗在模型权重、KV Cache和激活值三部分。
推理更看重显存带宽,训练更看重算力。Token生成速度(尤其是自回归解码阶段)受限于显存带宽——每生成一个token都需要从显存读取全部模型权重。H200的4.8 TB/s带宽比H100的3.35 TB/s高出约43%,在推理场景中的吞吐量提升非常明显。
并发量决定你需要多少卡。单用户低延迟推理,一张高端卡足够;服务100个并发用户,需要多卡集群+负载均衡。
二、不同规模的模型,推理需要多少显存?
显存不是只装模型权重。一个安全的估算公式是:
总显存需求 ≈ 模型权重 + KV Cache + 激活值 + 框架开销 + 余量缓冲
模型权重 = 参数量 × 精度字节数。FP16/BF16为2字节/参数,INT8为1字节,INT4为0.5字节。
关于MoE模型的特殊说明:对于DeepSeek-V3等MoE(混合专家)架构模型,总参数量不等于推理时的权重显存。每次推理只激活部分专家。以671B总参数的模型为例,实际激活参数约37B,FP8精度下权重部分仅约37GB,加上共享参数和冗余,单卡H200或2-4卡集群即可运行。务必区分“总参数”和“激活参数”,避免显存估算严重偏高。
KV Cache是推理中的“隐形消耗”,随序列长度和并发请求数线性增长。长上下文场景下,KV Cache可能超过模型权重本身。以Llama 3 70B为例(该模型使用GQA分组查询注意力,有效降低了KV Cache占用),在32K上下文、batch_size=16时,KV Cache可达约80GB。实际值受注意力头数、KV头数、是否启用GQA/MQA等因素影响,部署前建议用工具精确测算。
安全余量:在模型权重基础上乘以1.2-1.5倍,用于覆盖KV Cache、激活值和框架开销。单batch低并发推理取1.2-1.3倍即可;高并发或长上下文场景需按KV Cache单独估算。
| 模型规模 | FP16权重 | INT8权重 | INT4权重 | 推荐显存(FP16单batch) | 推荐显存(INT4单batch) |
|---|---|---|---|---|---|
| 7B | 14GB | 7GB | 3.5GB | 18-21GB | 5-7GB |
| 13B | 26GB | 13GB | 6.5GB | 34-39GB | 9-12GB |
| 70B | 140GB | 70GB | 35GB | 182-210GB | 46-53GB |
| 671B MoE(激活37B) | 约74GB(仅激活) | 约37GB | — | 2-4卡H200(FP8) | 单卡H200(INT8) |
说明:MoE模型推荐显存基于DeepSeek-V3等“总参数671B、激活37B”的架构。其他MoE模型(如Mixtral 8×7B)激活参数比例不同,需另行计算。
消费级显卡跑7B-14B模型完全可行。RTX 5090的32GB GDDR7显存,在INT4量化下可以流畅运行14B模型;RTX 6000 Ada的48GB显存可以跑70B INT4量化模型。对于开发测试和轻量API服务,消费级卡完全够用。
三、推理GPU应该怎么选?按场景匹配
轻量推理/开发测试(7B-14B模型)
推荐卡型:RTX 5090 32GB、A100 80GB
7B模型FP16推理约需14GB显存,加上KV Cache和余量,18-21GB足够。RTX 5090的32GB显存不仅能跑7B FP16,还能跑14B INT4。
成本角度:按小时计费,RTX 5090约2.98元/时(立方云2026年6月价格,具体以平台为准),适合个人开发者做API服务原型验证。
企业级中等规模推理(30B-70B模型)
推荐卡型:H100 80GB、H200 141GB、H20 96GB
70B模型FP16推理需要约140GB显存,单卡H100 80GB不够,必须多卡并行或量化。H200的141GB显存可以单卡容纳70B FP16模型,是推理的“甜点卡”。
H20 96GB是性价比选择。显存带宽4.0 TB/s,高于H100的3.35 TB/s,推理场景下带宽优势明显。足够跑70B INT8(约70GB+开销),按时单价约6.95元/时(立方云2026年6月价格,具体以平台为准),比H100更经济。
高并发/大模型服务(70B+ / 多用户)
推荐卡型:8×H100/H200集群、B200
多用户并发场景下,KV Cache会随并发数和上下文长度线性增长,总量可能远超模型权重本身。8×H200 SXM5集群总显存1,128GB,可支撑70B模型高并发服务,或671B MoE模型(如DeepSeek V3,FP8精度)的单机多卡推理。
vLLM + PagedAttention是标配。相比传统静态分配,vLLM的PagedAttention能将KV Cache碎片化减少20%-30%,吞吐量提升2-4倍。部署时建议开启--enable-prefix-caching进一步降低重复prompt的显存占用。
四、三个降低推理成本的实用技术
量化是最直接的显存压缩手段。INT8量化节省50%显存且质量损失几乎不可感知;INT4(AWQ/GPTQ)节省75%显存,适合消费级显卡部署。FP8在Hopper/Blackwell架构上原生支持,质量接近FP16,注意需要模型原生支持或校准。
vLLM替代原生PyTorch推理。vLLM的PagedAttention和Continuous Batching能将GPU利用率从30%-50%提升到80%以上,同样的硬件能服务更多并发用户。关键参数建议:--tensor-parallel-size按注意力头数均分;--gpu-memory-utilization建议设为0.85-0.9;遇到OOM时优先缩减--max-model-len。
控制max_model_len(最大上下文长度)。KV Cache与序列长度成正比。将上下文从128K缩减到8K,可释放大量显存,这是解决OOM的第一手段,优先于加卡。
五、立方云的推理部署方案
立方云是网鼎科技旗下专注GPU算力租赁的平台,提供从单卡到8卡集群的多种GPU配置,适配不同规模的推理部署需求。镜像市场预装vLLM、TensorRT-LLM、PyTorch等主流推理框架,支持开箱即用的模型服务部署。8卡A100/H100集群支持NVLink高速互联,适合多卡推理部署。
六、常见问题
1. 推理和训练可以用同一张卡吗?
可以,但效率不同。训练卡(如H100)做推理完全没问题,但用推理专用卡(如L40S)做训练会很慢,因为L40S没有NVLink和FP8 Transformer Engine。立方云提供的RTX 5090、H20、A100、H100均支持训练与推理。
2. 7B模型部署成API服务,单卡能撑多少并发?
取决于量化精度和上下文长度。INT4量化+RTX 5090 32GB,在vLLM优化下可支撑5-10个轻并发用户;A100 80GB FP16可支撑10-20个并发。具体数字需根据实际模型和请求模式压测。
3. 推理部署比训练便宜多少?
两者的单价可以相同,但使用模式完全不同。推理可以随用随停、碎片化运行;训练通常需要连续跑数小时到数天。此外,推理可用消费级显卡(如RTX 5090),训练大模型必须用数据中心级卡。真正拉开成本差距的是使用时长和硬件选择,而非单价本身。
4. 为什么推理也推荐用H100而不是RTX 5090?
H100的HBM3带宽(3.35TB/s)远高于RTX 5090的GDDR7带宽(约1.79TB/s),在token生成速度上有显著优势。如果业务对延迟敏感(如实时聊天、代码补全),H100的体验更好;如果追求性价比且延迟要求不高,RTX 5090是更经济的选择。
5. 多卡推理怎么配置?
推荐使用vLLM的--tensor-parallel-size参数,将模型按注意力头数均分到多张GPU。注意tensor并行数必须整除注意力头数(通常支持1、2、4、8)。立方云8卡A100/H100集群支持NVLink高速互联,适合多卡推理部署。
本文首发于立方云技术博客。立方云是网鼎科技旗下专注GPU算力租赁的平台,提供裸金属与容器实例服务。如需体验,请访问 lifangyun.com。