第一次租 GPU 服务器,完整路径是选预装镜像启动实例 → 通过 Jupyter 或 SSH 进入环境 → 数据放数据盘、大文件走对象存储 → 跑任务时盯住显存和磁盘 → 停机前备份数据、决定是否固化环境,再停止或删除实例。本文以立方云容器实例为例,按使用顺序讲清每一步。
很多人第一次租 GPU,卡在的不是"租"这个动作,而是租完之后:实例启动了不知道怎么进环境,数据传上去不知道放在哪算"安全",任务跑完随手一关,过几天发现文件没了或者账单还在走。
这篇文章按时间顺序讲第一次租 GPU 的完整路径:从选镜像开始,到停机收尾。每一步只讲"现在要做什么、怎么确认做对了",涉及的坑只点到为止,详细排查可以看另一篇《OPC 租 GPU 最容易踩的 7 个坑》。
⚠️ 本文涉及的平台功能、端口规则和计费方式以立方云官方文档为例,其他平台规则可能不同。操作前请以你所用平台的官方文档和控制台为准。
一、租之前先确认三件事
下单之前,先花五分钟把三件事想清楚,能省掉后面大部分返工。
第一,任务需要多少显存。 决定你选什么卡。跑 7B 模型推理和微调 70B 模型需要的显存差一个量级,选卡逻辑可以看《RTX 5090 能部署哪些大模型?7B、14B、32B 的量化、上下文与并发边界》里的容量估算,这里不重复。
第二,需要什么环境。 你要的是预装了 CUDA 和 PyTorch 的现成环境,还是自己完全控制的自建环境。第一次上云,优先选前者。
第三,数据和模型放哪。 实例的存储是分层的,不同位置在停机后的命运不同。这件事是停机收尾的基础,下文第四节展开。
二、第一步:选一个预装镜像,别从零装环境
实例创建页面会让你选镜像。镜像就是实例启动时的环境快照,可包含操作系统、CUDA、PyTorch 或其他框架及预配置路径;具体预装内容以镜像说明为准。
第一次租 GPU,优先从镜像市场选预装镜像,原因很直接:
- 预装镜像通常已提供可用的基础系统与常见框架环境,能减少自行安装的工作;但仍应根据镜像说明和目标 GPU 架构,核对 CUDA、PyTorch 与代码依赖是否兼容(版本不匹配的典型报错和排查,见避坑文坑 6)
- 启动后环境可直接使用,验证速度更快
- 如果跑 RTX 5090 这类 Blackwell 架构(sm_120)的卡,平台镜像是否已适配是个关键信息,下单前可在镜像说明里确认
选镜像时核对两件事:GPU 架构与 CUDA 版本的匹配 (镜像说明里通常有标注),以及框架版本是否满足你的代码要求。不确定时,先选平台标注为主流的组合,跑通后再换。
如果你之后在容器里装了自己的依赖,想让下次启动直接复用,可以保存为自定义镜像。但要注意:立方云保存镜像只固化容器可写层,/workspace 和 /object-storage 里的文件不会随镜像保存。也就是说,环境可以固化,数据和模型不会。这是很多第一次租 GPU 的人最容易误解的一点,也直接影响停机前要做什么。
三、第二步:实例启动后,怎么进入环境
实例启动后,进入环境主要有两条路:Jupyter 和 SSH。
Jupyter 路径。 实例页面会提供 Jupyter 的访问入口,使用平台分配的系统访问端口,登录时需要 token 认证(具体以实例页面展示的访问方式为准)。适合交互式写代码、看 notebook、临时调试。token 在实例页面可以找到,不要为了方便关闭认证------Jupyter 暴露在公网且无认证,等于把代码和数据开放给所有人。
SSH 路径。 在实例的"登录"弹窗中可以查看 SSH 连接信息和系统访问端口。SSH 适合跑长任务、用 scp/rsync 传文件、做环境管理。22 端口和 8888 端口在立方云是系统保留端口,直接使用页面提供的访问方式,不需要也不允许通过自定义端口新增映射。
自定义端口:给 Web 服务用的。 如果你要跑 WebUI(比如 Gradio 默认 7860)或自己的 HTTP 服务,需要在实例"登录"弹窗中添加端口映射(立方云仅支持 HTTP 类型),然后使用页面提供的外部地址和端口访问,而不是容器内的原始端口。同时确认服务绑定的是 0.0.0.0 而不是 127.0.0.1,否则外部依然访问不到。
第一次进入环境后,建议先跑两个命令确认基础状态:
bash
nvidia-smi # 确认 GPU 型号、驱动版本、显存总量
df -h # 确认磁盘分区和剩余空间
nvidia-smi 能看到 GPU 说明驱动正常;df -h 能看到数据盘挂载位置和容量,这是下一步的基础。
四、第三步:数据和模型放哪里
这一步决定停机后你的文件还在不在。立方云容器实例的存储分三个位置,作用完全不同。
| 位置 | 是什么 | 停机后 | 适合放 |
|---|---|---|---|
| 系统盘(容器可写层) | 容器内部存储 | 停止原容器后通常随容器保留;删除容器前如需复用环境,应保存镜像或记录环境清单 | conda 环境、安装的依赖 |
数据盘 /workspace |
独立挂载的数据存储 | 保留,但按容量继续计费 | 数据集、模型文件、输出结果 |
对象存储 /object-storage |
平台级文件存储 | 保留,独立计费 | 长期保存的模型和数据备份 |
三个位置里,/workspace 是日常工作区。把数据集、模型和输出都放在这里,而不是散落在容器根目录------数据盘有独立的容量和计费口径,也方便管理。
大文件的进出有两条常用路径:
下载模型: HuggingFace 在国内访问不稳定,常用替代是 hf-mirror.com(设置 HF_ENDPOINT 环境变量后用 huggingface-cli 下载)或 ModelScope(国产模型覆盖较全)。下载前先算体积:7B FP16 约 14GB,70B FP16 约 140GB,别下到一半发现磁盘不够。
上传备份: 输出结果和需要长期保存的模型,上传到对象存储。同区域的对象存储会在容器内以只读方式挂载到 /object-storage,你可以在容器里直接读取,复制到 /workspace 使用;反过来,保存到对象存储的文件需要在对象存储侧上传,容器内挂载是只读的。
还有一个时间维度的问题:下载大模型要不要开着 GPU 实例? 在按小时计费的场景,下载期间 GPU 闲置也在计费。如果模型还没准备好,更省的顺序是先完成下载和上传,再启动 GPU 实例。你可以在本地准备数据,或在平台提供的低成本 CPU 实例、无 GPU 环境中完成下载;具体可用形态以平台当前产品说明为准。
五、第四步:跑任务时,盯住两个数
任务运行期间,定时看两个数字就够了:
显存(nvidia-smi)。 接近上限时先降 batch size 或序列长度。如果显示被占用但找不到对应进程,属于另一类问题,排查方法在避坑文坑 1 里有展开。
磁盘(df -h)。 数据盘使用率较高时(例如超过 80%)建议开始清理;具体阈值取决于任务容错要求和后续还要写入的数据量。checkpoint 和 pip/conda 缓存是常见的静默膨胀来源------每个 checkpoint 可能几个 GB,几轮训练下来就能把数据盘吃满,而磁盘写满会导致任务失败甚至实例无法正常启动。
六、第五步:停机前要做什么
这是第一次租 GPU 最容易忽略、也最影响体验的环节。任务跑完不是直接点关闭就结束,收尾顺序建议固定为:备数据 → 定环境 → 再停机。
1. 备份要保留的数据
输出结果、训练好的模型、还想再用的数据集------上传到对象存储,或下载到本地。判断标准很简单:如果这个文件丢了会心疼,现在就备份。
/workspace 里的数据在停止容器后会保留,但有两个前提要清楚:数据盘会按较低费率继续计费;删除容器后,关联数据盘会进入释放流程,数据不应再视为可用或可恢复。删除前务必完成备份。
2. 决定环境要不要固化
如果你装好了环境、调通了依赖,后续是否保存镜像取决于你是否还会保留这台原容器:
- 保存自定义镜像:把容器可写层复制为可复用的自定义镜像,适合准备删除容器、迁移环境或后续创建新容器时使用。代价是镜像存放在仓库期间持续计费,体积越大费用越高;保存前建议清理 pip/conda 缓存,减小体积。
- 只记录环境清单:把关键版本号(驱动、CUDA、PyTorch、Python)和安装命令记到本地笔记。不产生镜像费用,但下次要重新安装。
若只是近期重启同一容器继续使用,环境通常会随原容器保留;若准备删除容器、迁移环境或后续创建新容器,建议保存自定义镜像。短期不再使用且不需要复现原环境时,可仅记录关键版本与安装命令。
3. 停止还是删除
立方云的计费规则里,这两者的区别直接决定账单:
| 操作 | GPU 算力费用 | 数据盘费用 | 数据 |
|---|---|---|---|
| 停止容器 | 停止 | 继续(较低费率) | 保留 |
| 删除容器 | 停止 | 停止 | 进入释放流程,删除前必须备份 |
所以决策逻辑是:近期还要用就停止,彻底不用才删除,删除前确认备份完成。 另外注意镜像和对象存储里的文件也是持续计费的,项目彻底结束后,不需要的镜像和文件一起清理,账单才真正归零。
停机前的检查清单,照着过一遍:
- 输出结果和模型已上传对象存储或下载到本地
-
/workspace里没有"丢了会心疼"的文件 - 环境已保存镜像,或版本清单已记录
- 已想清楚这次是停止还是删除
- 删除操作前,关键文件在第二个位置有副本
七、完整流程速查表
| 阶段 | 要做的事 | 确认做对了的标志 |
|---|---|---|
| 租之前 | 确认显存需求、环境需求、数据规划 | 知道选什么卡、用什么镜像、数据放哪 |
| 启动 | 选预装镜像,创建实例 | 实例状态为运行中 |
| 进入环境 | Jupyter 或 SSH;自定义端口在"登录"弹窗添加映射 | nvidia-smi 能看到 GPU |
| 放数据 | 工作文件进 /workspace;长期备份进对象存储 |
df -h 能看到数据盘 |
| 跑任务 | 盯显存和磁盘两个数 | 无 OOM、磁盘使用率低于 80% |
| 停机前 | 备数据 → 定环境(存镜像或记清单) → 停止或删除 | 检查清单五项全部打勾 |
第一次跑通这个流程后,第二次就是肌肉记忆了:选镜像、进环境、放数据、跑任务、备份、停机。循环起来之后,租 GPU 的心理成本会降到和开一台云服务器差不多。
常见问题
1. 第一次租 GPU,选容器还是裸金属?
两者都是平台提供的 GPU 交付形态。容器启动更快、自带镜像生态,适合训练、推理、开发和验证类任务;裸金属提供整机控制权,适合需要特定环境、长期稳定运行或整机资源独占的场景。详细的形态差异可以看《GPU 裸金属和 GPU 容器有什么区别?》。第一次上云做 AI 任务,容器实例通常是更轻的起点。
2. 停止实例后,数据还在吗?
在立方云,停止容器后 /workspace 数据盘里的数据保留,但数据盘按较低费率继续计费;删除容器后,关联数据盘会进入释放流程,数据不应再视为可用或可恢复,删除前务必完成备份。具体计费规则以平台官方文档为准。
3. 保存了镜像,为什么模型文件没在里面?
立方云保存镜像只固化容器可写层(系统和依赖环境),/workspace 和 /object-storage 的文件不随镜像保存。模型和数据需要单独上传到对象存储或下载到本地保存。
4. 下次还要继续用,是停止还是删除?
近期还要用就停止:GPU 算力费用停止,数据保留,随时可再启动。彻底不用才删除,且删除前确认数据已备份------删除后关联数据盘会进入释放流程,数据不应再视为可用或可恢复。同时清理不再需要的自定义镜像和对象存储文件,避免遗留存储费用。
5. 对象存储和数据盘有什么区别?
数据盘(/workspace)是实例的工作存储,随实例生命周期管理;对象存储是独立的文件存储,与实例解耦,适合长期保存。同区域时对象存储在容器内只读挂载到 /object-storage,读取时复制到 /workspace 使用。两者计费口径不同,以平台官方文档为准。
平台功能、端口规则和计费方式以立方云官方文档和实际控制台为准,其他平台的规则可能不同。立方云是网鼎科技旗下专注 GPU 算力租赁的边缘算力平台,提供RTX 5090等多种GPU实例以及裸金属服务,更多卡型,具体配置和价格可点击下方访问立方云平台。