裸金属GPU怎么做?从选型到部署的完整实操指南

一句话总结裸金属GPU的部署流程分为四步:明确任务需求→在控制台选择地区/配置/镜像/网络并创建实例→SSH登录后配置CUDA与深度学习环境→安装监控程序并提交训练/推理任务。创建到可用的时间受库存、硬件调度和系统部署状态影响,请以控制台状态为准。

一、选型:先明确需求,再匹配配置

裸金属GPU的选型不是"选最贵的",而是"选最匹配的"。选错配置的后果比选贵更严重——训练到一半显存溢出,或者推理延迟超标,都是选型阶段可以规避的问题。

1. 按任务类型选卡型

任务类型 推荐卡型方向 关键考量
7B–13B模型推理、LoRA/QLoRA微调 RTX 5090/4090级别,24GB–32GB显存 单卡显存够装权重+KV Cache,性价比高;全参数微调通常需要更多显存或多卡
30B模型推理 A100 40GB 需结合量化方式、上下文长度和并发需求评估
70B模型单卡推理 A100 80GB及以上 通常需80GB及以上显存,并结合量化方式、KV Cache和并发需求评估
AIGC内容生成(SD/ComfyUI) RTX 5090/6000D 单卡大显存可并行加载多个模型和LoRA
金融量化/自动驾驶仿真 按具体软件栈评估A100/H100或专业可视化GPU 重点关注显存、CPU与网络配置、软件兼容性及端到端延迟;不同业务需求差异较大

选型原则:先估算模型权重体积(如70B INT8约70GB,34B BF16约68GB),再为KV Cache、运行时缓冲和框架开销预留显存。推理场景应按上下文长度与并发数估算KV Cache;训练场景则需结合batch size、序列长度、激活重计算和并行策略测算。显存不够是一切痛苦的根源。

2. 按使用周期选计费模式

裸金属常见按月或按固定周期购买,是否提供按小时、包年及对应折扣取决于平台和资源类型。应按实际报价、最低购买时长、开通周期和资源闲置成本计算。裸金属的初始化耗时通常较长,频繁启停不划算。

3. 配套资源别忽略

除了GPU本身,CPU、内存和存储应按数据加载、预处理、checkpoint、并发和数据规模规划。多卡训练通常需要避免CPU、系统内存或存储吞吐成为瓶颈,但不存在适用于所有任务的固定倍数。建议:

  • CPU:数据预处理密集型任务建议多核配置
  • 内存:根据数据加载方式和框架开销评估
  • 存储:模型权重和数据集体积庞大,SSD容量建议预留充足空间
  • 网络带宽:推理服务需评估并发带宽,训练任务需关注内网带宽(多机扩展时)

二、创建:控制台操作全流程

立方云为例,裸金属实例的创建流程如下。其他平台操作逻辑类似,具体界面以各平台控制台为准。

Step 1:登录控制台,进入GPU裸金属页面

登录立方云控制台,在左侧菜单选择GPU裸金属,点击创建裸金属

Step 2:选择地域

选择实例所在地域(如华东-合肥)。如地域按钮置灰,表示该地域当前不可购买或暂无库存,需切换其他地域。

Step 3:选择实例配置

配置列表会展示CPU、内存、磁盘、库存和月价格。例如:

规格 CPU 内存 磁盘 参考价格
2×16 Core 32Threads Intel Xeon E5-2682 v4 256GB ECC 960GB SSD ¥4500/月
2×20 Core 40Threads Intel Xeon E5-2673 v4 256GB ECC 960GB SSD ¥5000/月

注意:具体可购买规格、库存和价格以控制台实时展示为准。选择时建议同时关注库存数量,避免选完配置发现无货。

Step 4:选择操作系统

选择平台提供的系统镜像,优先考虑Ubuntu 22.04/24.04 LTS、RHEL/Rocky Linux 8或9等仍在维护期内、且与目标CUDA和框架版本兼容的发行版。具体以平台提供的镜像列表为准。

Step 5:配置网络

  • 线路:选择公网线路(如移动、电信)
  • 带宽:按Mbps选择,页面会显示带宽单价(如¥5/Mbps)。带宽越高,公网访问能力越强,费用也相应增加

Step 6:设置系统配置

  • 主机名:用于识别实例,建议使用项目名+日期等易识别命名。仅支持英文字母、数字、下划线、句点、空格和连字符,且必须以字母或数字开头
  • 登录密码:创建时设置并确认,用于后续SSH登录。请妥善保存,平台通常不会在详情页明文展示密码

Step 7:确认订单并提交

核对配置、购买周期、购买数量和应付金额,确认账户余额充足后提交订单。创建提交后返回实例列表,等待实例状态变为运行中

重要提醒:裸金属是物理服务器资源,创建、重装系统、开机、关机和重启都需要平台调度底层硬件,耗时可能比容器实例更长。请以页面状态变化为准,耐心等待。

三、环境配置:从SSH登录到深度学习环境就绪

实例状态变为"运行中"后,即可开始环境配置。

1. SSH登录实例

使用外网IP通过SSH登录。以Linux为例:

ssh root@<你的外网IP>

首次连接时输入创建实例时设置的密码。如果平台或镜像指定了其他登录用户、端口或安全规则,请以控制台说明为准。

连接失败排查清单

  • 实例状态是否为"运行中"?
  • 外网IP是否正确?
  • 本地网络能否访问该公网IP?
  • 登录账号和密码是否正确?
  • 目标系统中SSH服务是否正常运行?

2. 检查GPU驱动状态

登录后首先确认GPU是否被系统正确识别:

nvidia-smi

如果显示GPU型号、显存、驱动版本等信息,说明驱动已正确安装。如果未显示,可能需要手动安装或更新NVIDIA驱动。

3. 安装CUDA Toolkit(如需要)

部分镜像可能已预装CUDA,可通过以下命令检查:

nvcc --version

如需编译CUDA扩展或使用nvcc,再按NVIDIA官方文档安装与系统、驱动兼容的CUDA Toolkit。安装路径和环境变量应以实际安装方式为准;仅运行预编译PyTorch时,通常优先确认NVIDIA驱动与所安装PyTorch版本的兼容性。

4. 安装深度学习框架

请在PyTorch官方"Start Locally"页面按操作系统、Python版本和目标CUDA运行时选择对应安装命令。以下仅为历史项目示例,不代表通用推荐:

# 示例:CUDA 12.1环境
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

验证安装是否成功:

import torch
print(torch.cuda.is_available())  # 应输出 True
print(torch.__version__)

如需TensorFlow,请先根据项目所用TensorFlow版本核对Python、NVIDIA驱动及相关CUDA运行时兼容性,再按官方安装说明部署。

建议:不同项目可能需要不同版本的框架,建议使用conda或venv创建隔离的虚拟环境,避免版本冲突。

5. 安装常用工具包

根据业务需求安装额外依赖:

pip install transformers datasets accelerate

如需运行特定开源项目,建议先阅读项目的requirements.txt,按依赖清单安装。

四、任务运行与监控

1. 提交训练/推理任务

环境就绪后,即可上传代码和数据集,提交任务。建议:

  • 大模型训练前先跑一个小规模测试(如用1/10数据跑1个epoch),确认显存占用和训练速度符合预期
  • 使用nvidia-sminvidia-smi dmon实时监控GPU利用率和显存占用
  • 设置Checkpoint自动保存,避免训练中断导致成果丢失

2. 安装监控程序(立方云特定)

立方云裸金属的监控数据依赖实例内安装的监控程序。首次查看监控前,需登录实例执行以下命令。仅在确认下载域名、脚本来源和版本可信后执行。生产环境建议先下载并审查脚本内容,再以最小必要权限安装。

curl -fsSL https://mirrors.mycdn.cn/lfy/tools/lifangyun-monitor-agent/install.sh | VERSION=1.0.1 bash

如当前用户非root,使用sudo执行:

curl -fsSL https://mirrors.mycdn.cn/lfy/tools/lifangyun-monitor-agent/install.sh | sudo VERSION=1.0.1 bash

安装完成后等待1–3分钟,监控程序会自动采集并上报数据。可在控制台查看CPU、磁盘、网络流量和内存等指标。

3. 日常管理操作

操作 适用场景 说明
关机 暂时停止系统运行 关机会中断业务,但不会释放资源,计费继续
重启 系统更新或服务异常 重启期间实例短暂不可用
重装系统 环境异常或需更换系统版本 会清除原系统数据,操作前务必备份
带宽升级 公网访问速度不足 按带宽差值计费,即时生效
续费 实例即将到期 建议提前续费,避免到期停机

注意:关机、重启不等于退订或释放资源,实例仍会按原购买周期保留到到期时间。

五、立方云能提供什么?

立方云网鼎科技旗下专注GPU算力租赁的边缘算力平台,提供容器化与裸金属两种算力服务。裸金属实例支持按地区、配置、操作系统、网络线路和带宽灵活选配,并提供监控、续费、重装系统、带宽升级等管理功能。具体可购买规格、库存、价格和交付时长以控制台实时页面为准。

如需了解当前可用配置,可前往 lifangyun.com 查看。

六、常见问题

1. 创建后为什么暂时不能使用?

裸金属是物理服务器资源,创建提交后还需要完成资源分配、系统部署和网络配置。部署期间状态可能不是"运行中",请耐心等待状态更新后再登录使用。

2. 裸金属适合装什么操作系统?

深度学习场景推荐Ubuntu 22.04/24.04 LTS、RHEL/Rocky Linux 8或9等仍在维护期内、且与目标CUDA和框架版本兼容的发行版。具体以平台提供的镜像列表为准。

3. 环境配错了怎么办?

如果只是Python包版本冲突,建议重新创建虚拟环境。如果系统级环境混乱(如CUDA版本装错、驱动冲突),可考虑通过控制台重装系统,快速恢复干净环境。重装前务必备份代码、数据、模型和配置文件。

4. 怎么判断GPU利用率是否正常?

训练时可结合GPU利用率、显存占用、step time、数据加载耗时和多卡通信情况综合判断。持续偏低时,再排查数据加载、CPU预处理、batch size、通信或代码同步点等瓶颈。

5. 任务跑完后需要关机吗?

在租赁平台上,关机通常不会停止计费。裸金属按月计费,关机期间实例仍保留到原到期时间。如果确认不再需要,应联系平台管理员执行退订或释放。可退金额以平台后台核算结果为准,可能受到订单周期、已使用天数、优惠和代金券等因素影响。


本文首发于立方云技术博客。立方云是网鼎科技旗下专注GPU算力租赁的边缘算力平台,提供裸金属与容器实例服务。如需体验,请访问 lifangyun.com