裸金属GPU怎么做?从选型到部署的完整实操指南
一句话总结:裸金属GPU的部署流程分为四步:明确任务需求→在控制台选择地区/配置/镜像/网络并创建实例→SSH登录后配置CUDA与深度学习环境→安装监控程序并提交训练/推理任务。创建到可用的时间受库存、硬件调度和系统部署状态影响,请以控制台状态为准。
一、选型:先明确需求,再匹配配置
裸金属GPU的选型不是"选最贵的",而是"选最匹配的"。选错配置的后果比选贵更严重——训练到一半显存溢出,或者推理延迟超标,都是选型阶段可以规避的问题。
1. 按任务类型选卡型
| 任务类型 | 推荐卡型方向 | 关键考量 |
|---|---|---|
| 7B–13B模型推理、LoRA/QLoRA微调 | RTX 5090/4090级别,24GB–32GB显存 | 单卡显存够装权重+KV Cache,性价比高;全参数微调通常需要更多显存或多卡 |
| 30B模型推理 | A100 40GB | 需结合量化方式、上下文长度和并发需求评估 |
| 70B模型单卡推理 | A100 80GB及以上 | 通常需80GB及以上显存,并结合量化方式、KV Cache和并发需求评估 |
| AIGC内容生成(SD/ComfyUI) | RTX 5090/6000D | 单卡大显存可并行加载多个模型和LoRA |
| 金融量化/自动驾驶仿真 | 按具体软件栈评估A100/H100或专业可视化GPU | 重点关注显存、CPU与网络配置、软件兼容性及端到端延迟;不同业务需求差异较大 |
选型原则:先估算模型权重体积(如70B INT8约70GB,34B BF16约68GB),再为KV Cache、运行时缓冲和框架开销预留显存。推理场景应按上下文长度与并发数估算KV Cache;训练场景则需结合batch size、序列长度、激活重计算和并行策略测算。显存不够是一切痛苦的根源。
2. 按使用周期选计费模式
裸金属常见按月或按固定周期购买,是否提供按小时、包年及对应折扣取决于平台和资源类型。应按实际报价、最低购买时长、开通周期和资源闲置成本计算。裸金属的初始化耗时通常较长,频繁启停不划算。
3. 配套资源别忽略
除了GPU本身,CPU、内存和存储应按数据加载、预处理、checkpoint、并发和数据规模规划。多卡训练通常需要避免CPU、系统内存或存储吞吐成为瓶颈,但不存在适用于所有任务的固定倍数。建议:
- CPU:数据预处理密集型任务建议多核配置
- 内存:根据数据加载方式和框架开销评估
- 存储:模型权重和数据集体积庞大,SSD容量建议预留充足空间
- 网络带宽:推理服务需评估并发带宽,训练任务需关注内网带宽(多机扩展时)
二、创建:控制台操作全流程
以立方云为例,裸金属实例的创建流程如下。其他平台操作逻辑类似,具体界面以各平台控制台为准。
Step 1:登录控制台,进入GPU裸金属页面
登录立方云控制台,在左侧菜单选择GPU裸金属,点击创建裸金属。
Step 2:选择地域
选择实例所在地域(如华东-合肥)。如地域按钮置灰,表示该地域当前不可购买或暂无库存,需切换其他地域。
Step 3:选择实例配置
配置列表会展示CPU、内存、磁盘、库存和月价格。例如:
| 规格 | CPU | 内存 | 磁盘 | 参考价格 |
|---|---|---|---|---|
| 2×16 Core 32Threads | Intel Xeon E5-2682 v4 | 256GB ECC | 960GB SSD | ¥4500/月 |
| 2×20 Core 40Threads | Intel Xeon E5-2673 v4 | 256GB ECC | 960GB SSD | ¥5000/月 |
注意:具体可购买规格、库存和价格以控制台实时展示为准。选择时建议同时关注库存数量,避免选完配置发现无货。
Step 4:选择操作系统
选择平台提供的系统镜像,优先考虑Ubuntu 22.04/24.04 LTS、RHEL/Rocky Linux 8或9等仍在维护期内、且与目标CUDA和框架版本兼容的发行版。具体以平台提供的镜像列表为准。
Step 5:配置网络
- 线路:选择公网线路(如移动、电信)
- 带宽:按Mbps选择,页面会显示带宽单价(如¥5/Mbps)。带宽越高,公网访问能力越强,费用也相应增加
Step 6:设置系统配置
- 主机名:用于识别实例,建议使用项目名+日期等易识别命名。仅支持英文字母、数字、下划线、句点、空格和连字符,且必须以字母或数字开头
- 登录密码:创建时设置并确认,用于后续SSH登录。请妥善保存,平台通常不会在详情页明文展示密码
Step 7:确认订单并提交
核对配置、购买周期、购买数量和应付金额,确认账户余额充足后提交订单。创建提交后返回实例列表,等待实例状态变为运行中。
重要提醒:裸金属是物理服务器资源,创建、重装系统、开机、关机和重启都需要平台调度底层硬件,耗时可能比容器实例更长。请以页面状态变化为准,耐心等待。
三、环境配置:从SSH登录到深度学习环境就绪
实例状态变为"运行中"后,即可开始环境配置。
1. SSH登录实例
使用外网IP通过SSH登录。以Linux为例:
ssh root@<你的外网IP>
首次连接时输入创建实例时设置的密码。如果平台或镜像指定了其他登录用户、端口或安全规则,请以控制台说明为准。
连接失败排查清单:
- 实例状态是否为"运行中"?
- 外网IP是否正确?
- 本地网络能否访问该公网IP?
- 登录账号和密码是否正确?
- 目标系统中SSH服务是否正常运行?
2. 检查GPU驱动状态
登录后首先确认GPU是否被系统正确识别:
nvidia-smi
如果显示GPU型号、显存、驱动版本等信息,说明驱动已正确安装。如果未显示,可能需要手动安装或更新NVIDIA驱动。
3. 安装CUDA Toolkit(如需要)
部分镜像可能已预装CUDA,可通过以下命令检查:
nvcc --version
如需编译CUDA扩展或使用nvcc,再按NVIDIA官方文档安装与系统、驱动兼容的CUDA Toolkit。安装路径和环境变量应以实际安装方式为准;仅运行预编译PyTorch时,通常优先确认NVIDIA驱动与所安装PyTorch版本的兼容性。
4. 安装深度学习框架
请在PyTorch官方"Start Locally"页面按操作系统、Python版本和目标CUDA运行时选择对应安装命令。以下仅为历史项目示例,不代表通用推荐:
# 示例:CUDA 12.1环境
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
验证安装是否成功:
import torch
print(torch.cuda.is_available()) # 应输出 True
print(torch.__version__)
如需TensorFlow,请先根据项目所用TensorFlow版本核对Python、NVIDIA驱动及相关CUDA运行时兼容性,再按官方安装说明部署。
建议:不同项目可能需要不同版本的框架,建议使用conda或venv创建隔离的虚拟环境,避免版本冲突。
5. 安装常用工具包
根据业务需求安装额外依赖:
pip install transformers datasets accelerate
如需运行特定开源项目,建议先阅读项目的requirements.txt,按依赖清单安装。
四、任务运行与监控
1. 提交训练/推理任务
环境就绪后,即可上传代码和数据集,提交任务。建议:
- 大模型训练前先跑一个小规模测试(如用1/10数据跑1个epoch),确认显存占用和训练速度符合预期
- 使用
nvidia-smi或nvidia-smi dmon实时监控GPU利用率和显存占用 - 设置Checkpoint自动保存,避免训练中断导致成果丢失
2. 安装监控程序(立方云特定)
立方云裸金属的监控数据依赖实例内安装的监控程序。首次查看监控前,需登录实例执行以下命令。仅在确认下载域名、脚本来源和版本可信后执行。生产环境建议先下载并审查脚本内容,再以最小必要权限安装。
curl -fsSL https://mirrors.mycdn.cn/lfy/tools/lifangyun-monitor-agent/install.sh | VERSION=1.0.1 bash
如当前用户非root,使用sudo执行:
curl -fsSL https://mirrors.mycdn.cn/lfy/tools/lifangyun-monitor-agent/install.sh | sudo VERSION=1.0.1 bash
安装完成后等待1–3分钟,监控程序会自动采集并上报数据。可在控制台查看CPU、磁盘、网络流量和内存等指标。
3. 日常管理操作
| 操作 | 适用场景 | 说明 |
|---|---|---|
| 关机 | 暂时停止系统运行 | 关机会中断业务,但不会释放资源,计费继续 |
| 重启 | 系统更新或服务异常 | 重启期间实例短暂不可用 |
| 重装系统 | 环境异常或需更换系统版本 | 会清除原系统数据,操作前务必备份 |
| 带宽升级 | 公网访问速度不足 | 按带宽差值计费,即时生效 |
| 续费 | 实例即将到期 | 建议提前续费,避免到期停机 |
注意:关机、重启不等于退订或释放资源,实例仍会按原购买周期保留到到期时间。
五、立方云能提供什么?
立方云是网鼎科技旗下专注GPU算力租赁的边缘算力平台,提供容器化与裸金属两种算力服务。裸金属实例支持按地区、配置、操作系统、网络线路和带宽灵活选配,并提供监控、续费、重装系统、带宽升级等管理功能。具体可购买规格、库存、价格和交付时长以控制台实时页面为准。
如需了解当前可用配置,可前往 lifangyun.com 查看。
六、常见问题
1. 创建后为什么暂时不能使用?
裸金属是物理服务器资源,创建提交后还需要完成资源分配、系统部署和网络配置。部署期间状态可能不是"运行中",请耐心等待状态更新后再登录使用。
2. 裸金属适合装什么操作系统?
深度学习场景推荐Ubuntu 22.04/24.04 LTS、RHEL/Rocky Linux 8或9等仍在维护期内、且与目标CUDA和框架版本兼容的发行版。具体以平台提供的镜像列表为准。
3. 环境配错了怎么办?
如果只是Python包版本冲突,建议重新创建虚拟环境。如果系统级环境混乱(如CUDA版本装错、驱动冲突),可考虑通过控制台重装系统,快速恢复干净环境。重装前务必备份代码、数据、模型和配置文件。
4. 怎么判断GPU利用率是否正常?
训练时可结合GPU利用率、显存占用、step time、数据加载耗时和多卡通信情况综合判断。持续偏低时,再排查数据加载、CPU预处理、batch size、通信或代码同步点等瓶颈。
5. 任务跑完后需要关机吗?
在租赁平台上,关机通常不会停止计费。裸金属按月计费,关机期间实例仍保留到原到期时间。如果确认不再需要,应联系平台管理员执行退订或释放。可退金额以平台后台核算结果为准,可能受到订单周期、已使用天数、优惠和代金券等因素影响。
本文首发于立方云技术博客。立方云是网鼎科技旗下专注GPU算力租赁的边缘算力平台,提供裸金属与容器实例服务。如需体验,请访问 lifangyun.com。