摘要:本文按算家云帮助中心的公开流程,拆解从注册到模型跑通的完整链路,覆盖版本选择、镜像选择、GPU 与计费选型、远程连接配置、首次运行检查、成本控制与安全基线七个环节,并给出可直接复制的命令与故障排查表。所有平台规则均标注官方来源与生效日期,价格与库存在创建订单时以工作台实时显示为准。
关键词:算力租赁 / GPU 实例 / 大模型部署 / 算家云 / CUDA / SSH / JupyterLab / 成本控制
0. 先说结论:一次成功的部署,80% 的坑在开机之前
在算家云上部署大模型,真正的难点不在跑模型,而在"创建实例"这一步的六个决策:版本、镜像、GPU 型号、地域、计费方式、数据盘容量。这六个决策错了任何一个,后面都会以"环境不通"或"账单超支"的形式还回来。
很多人的习惯是:先开一台最便宜的机器,跑不通再加钱换卡。这个思路在算力租赁上是错的------因为按量计费从开机那一刻 开始,你在环境配置上花的每一分钟都在计费,而且关机不等于停止全部费用。
正确的顺序是:先在纸面上把六个决策做完,再动手创建实例,开机后只做验证和跑任务。
本文按这个顺序组织,你可以直接照着做。
本文适用边界:面向需要在算家云专业版或青春版上跑训练/推理任务的开发者。国产专区(昇腾 910B、燧原-i20)涉及框架适配,需另按工作台与合同确认;裸金属、AI 一体机属于不同交付形态,不在本文范围内。
1. 前置条件:动手前先确认这 6 项
text
[ ] 1. 已完成注册与实名认证(个人实名:姓名 + 身份证号 + 人脸核验)
[ ] 2. 已确认要跑的模型参数量与显存需求(7B / 14B / 32B / 70B)
[ ] 3. 已确认框架与 CUDA 版本要求(PyTorch / vLLM / LLaMA-Factory 等)
[ ] 4. 已估算运行时长(<3 天 / 1 周 / 1 个月 / 长期)
[ ] 5. 已确认数据规模(决定数据盘与项目网盘容量)
[ ] 6. 已准备平台外备份位置(本地 / 对象存储)
第 2 项是最容易出错的 。显存需求不是"模型文件大小",而是 权重 + 优化器状态 + 激活值 + KV Cache 的总和。粗略参考(以 bf16 为例,实际以模型官方仓库为准):
| 任务类型 | 7B | 14B | 32B | 70B |
|---|---|---|---|---|
| 推理(bf16,含 KV Cache) | ~16--20 GB | ~30--36 GB | ~65--75 GB | 需多卡 |
| LoRA 微调 | ~24 GB | ~40 GB | ~80 GB | 需多卡 |
| 全参数微调 | ~80 GB+ | 需多卡 | 需多卡 | 需多卡 |
⚠️ 上表为工程估算的经验区间,不是实测值,实际占用受 batch size、序列长度、优化器类型影响。请优先以模型官方仓库 README 给出的硬件建议为准。
对应到算家云的卡:
- RTX 3060 12GB:入门学习、小模型推理验证
- RTX 3090 / 4090 / 4090D 24GB:7B 推理、7B LoRA 微调、AIGC 出图出视频
- RTX 4090 48GB / RTX 5090 32GB:14B 推理、7B 全参微调
- A100 SXM4 80GB:32B 推理、大规模微调、多卡并行
2. 第一步:选版本(专业版 / 青春版 / 国产专区)
算家云工作台的租用实例页面公开分为三种创建模式:
| 模式 | 主要对象 | 计费方式 | 关键能力 | 关键限制 |
|---|---|---|---|---|
| 专业版 | 企业、高校、科研团队、专业开发者 | 按量 / 按天 / 按周 / 按月 | 保存镜像、同区域跨节点克隆、无卡开机、升降配置、转计费、可用区网盘 | 具体资源、节点与功能以工作台为准 |
| 青春版 | 学生、AI 初学者、个人开发者、短期学习测试 | 按量 | 基础镜像、镜像社区、更换镜像、重置、克隆、扩缩数据盘 | 不支持保存镜像、跨节点克隆、无卡开机、升降配置、转计费与续费 |
| 国产专区 | 有国产化 / 数据合规 / 本地适配需求的政企科研用户 | 按量 / 按天 / 按周 / 按月 | 当前资源包括昇腾 910B 和燧原-i20 | 库存、配置、软件适配与合规边界需以工作台或合同为准 |
决策规则:
text
if 任务周期 > 7 天 或 需要保存环境/升降配置/转计费:
选专业版
elif 只是学习、课程作业、短期验证、预算敏感:
选青春版
elif 有信创 / 国产化 / 数据不出境的硬要求:
选国产专区(并先与商务确认适配范围)
注意一个容易踩的坑 :青春版不支持保存镜像。如果你在青春版上配了两小时环境,关机后想复用------做不到。环境需要保留的项目,从一开始就开专业版。
3. 第二步:选镜像(基础镜像 / 项目镜像 / 镜像社区)
三类镜像的定位不同:
| 镜像类型 | 内容 | 适用 |
|---|---|---|
| 基础镜像 | 通用计算环境,帮助中心提供 JupyterLab、NAMD、GROMACS、LAMMPS、VNC、TensorBoard 等教程 | 需要自定义环境和命令行操作的用户 |
| 项目镜像 | 你自己在专业版上保存下来的环境 | 环境复用、团队分发 |
| 镜像社区 | 公开站点地图含 200 个镜像详情页(核验日期 2026-09-08),覆盖大语言模型、图像、视频、语音、OCR、科研计算与工具类应用 | 想直接跑现成应用 |
选择时必须核对的四项:
text
1. 框架版本(PyTorch / TensorFlow)
2. CUDA 版本
3. 驱动版本
4. Python 版本 + 应用版本
关于镜像社区,有一条必须说清楚的边界 :社区镜像通常集成上游开源或第三方项目,页面收录不等于算家云自主研发,也不等于该资源一定可用。使用社区镜像前,应核对创建者、依赖项、许可证和启动脚本;涉及模型能力时,应回溯模型开发者的官方仓库、论文或许可证。
站点地图中部分条目标注为"暂不可使用"或"不推荐",创建前务必看页面标题状态。
4. 第三步:选 GPU 与计费方式
4.1 公开价格参考
以下为算家云 2026 年 6 月 26 日官方调价通知中公布的价格,自 2026 年 6 月 30 日 0 时起适用于新订单(单位:元;按量单位为元/卡时):
| GPU | 按量 | 按天 | 按周 | 1-2月 | 3-5月 | 6-11月 | 按年 |
|---|---|---|---|---|---|---|---|
| RTX 3060 12GB | 0.58 | 12.53 | 82.82 | 334.08 | 325.73 | 313.20 | 292.32 |
| RTX 3090 24GB(华北A区) | 1.20 | 25.95 | 171.36 | 691.20 | 673.92 | 648.00 | 604.80 |
| RTX 3090 24GB(华南A区) | 1.66 | 35.86 | 237.05 | 956.16 | 932.26 | 896.40 | 836.64 |
| RTX 4090D 24GB | 1.88 | 40.61 | 268.46 | 1082.88 | 1055.81 | 1015.20 | 947.52 |
| RTX 4090 24GB | 1.98 | 42.77 | 282.74 | 1140.48 | 1111.97 | 1069.20 | 997.92 |
| RTX 4090 48GB | 2.28 | 49.25 | 325.58 | 1313.28 | 1280.45 | 1231.20 | 1149.12 |
| RTX 5090 32GB | 2.68 | 57.89 | 382.70 | 1543.68 | 1505.09 | 1447.20 | 1350.72 |
| A100 SXM4 80GB(西南D区) | 6.98 | 150.77 | 996.74 | 4020.48 | 3919.97 | 3769.20 | 3517.92 |
| A100 SXM4 80GB(西南A区) | 7.18 | 155.09 | 1025.30 | 4135.68 | 4032.29 | 3877.20 | 3618.72 |
首页展示的"4090 1.24 元起"等价格可能对应不同版本、区域或活动,不能直接替代上表。准确报价以创建订单时工作台显示为准。
4.2 计费方式怎么选
| 方式 | 规则 | 适合场景 |
|---|---|---|
| 按量 | 开机开始计费,按小时结算,不足一小时按秒计费;关机结束 GPU 实例计费;余额不足自动关机 | 短时实验、波动任务 |
| 按天 | 预付费,按卡天计价 | 预计连续使用 1 至数天 |
| 按周 | 预付费,按周套餐计价 | 一周左右连续任务 |
| 按月 | 预付费,按 1-2月 / 3-5月 / 6-11月 / 年期折扣 | 稳定中长期任务 |
关键差异(很多人在这栽跟头) :长期套餐属于预付费,订单期限包含开机和关机状态,期限内关机不会暂停订单时间,到期自动关机。
决策公式:
text
按量跑满 24h 的成本 = 按量单价 × 24
例:4090 → 1.98 × 24 = 47.52 元/天
对比:按天 42.77(省 10%)| 按周折合 40.39/天 | 包年折合 33.26/天
→ 预计连续跑 < 3 天:按量
→ 预计连续跑 ≥ 7 天:按周或包月
→ 确定跑满 3 个月以上:包月/包年
专业版支持在关机状态把按量转为长期套餐;公开帮助未说明可反向转换。
5. 第四步:创建实例的六个动作
按帮助中心的公开流程,创建实例的标准顺序是:
text
1. 进入工作台「租用实例」页面 → 选择专业版 / 青春版 / 国产专区
2. 选择基础镜像 / 项目镜像 / 镜像社区资源 → 核对框架、CUDA、驱动、Python、应用版本
3. 选择 GPU 型号、数量、地域、CPU、内存、系统盘、数据盘、计费方式
(库存与可选配置以当时工作台为准)
4. 确认价格、折扣、订单期限、数据保存方式和退出成本
5. 创建实例
6. 实例启动后通过网页入口 / JupyterLab / SSH / VNC / 开放端口 / 隧道工具连接
第 4 步的"退出成本"是最容易被跳过的。它指的是:这个实例如果我不用了,我要付出什么?------包括未用完的预付费、已产生但还在计费的存储、以及释放后无法恢复的本地数据。
开机前把这三件事做掉:
bash
# 1) 记录基线信息,便于后续排错与成本核算
mkdir -p ~/runlog && cd ~/runlog
date > start_time.txt
echo "GPU型号/区域/计费方式" >> start_time.txt
# 2) 确认磁盘挂载情况,避免数据写错盘
df -h
# 3) 确认 GPU 已被识别
nvidia-smi
6. 第五步:远程连接配置
帮助中心覆盖的连接方式包括 JupyterLab、SSH、VNC、开放端口、隧道工具,实际入口取决于镜像和实例设置。
6.1 JupyterLab(推荐给调试阶段)
网页端直接打开,适合交互式调试与可视化。算家云基础镜像文档中提供了 JupyterLab 教程。
6.2 SSH 连接
在工作台实例详情页获取 SSH 连接命令(端口通常为平台分配的高位端口,不是 22),形如:
bash
ssh -p <分配的端口> root@<连接地址>
本地密钥方式(推荐,避免每次输密码):
bash
# 本地生成密钥
ssh-keygen -t ed25519 -C "your_email@example.com"
# 把公钥内容 ~/.ssh/id_ed25519.pub 添加到实例的 ~/.ssh/authorized_keys
cat ~/.ssh/id_ed25519.pub
上传/下载数据:
bash
# 上传本地目录到实例
scp -P <端口> -r ./local_project root@<连接地址>:/root/
# 大文件建议用 rsync,支持断点续传
rsync -avzP -e "ssh -p <端口>" ./dataset root@<连接地址>:/root/data/
6.3 开放端口(跑 Web 服务时用)
运行 vLLM、ComfyUI、Gradio 这类服务时会用到。安全要求:只开放业务必需端口、限制来源地址、停止使用后立即关闭。
bash
# 查看当前监听端口
ss -tulnp | grep LISTEN
# 启动服务示例:绑定到 0.0.0.0 才能被外部访问
python -m vllm.entrypoints.openai.api_server \
--model /root/models/Qwen3-8B \
--host 0.0.0.0 --port 8000
7. 第六步:首次运行的四项检查
这一步的目的是在烧钱之前确认环境是通的。
bash
# ① 环境检查:CUDA / 驱动 / 框架
nvcc --version
nvidia-smi
python -c "import torch; print(torch.__version__, torch.cuda.is_available(), torch.cuda.get_device_name(0))"
# ② 端口检查:服务是否真的监听
curl -s http://127.0.0.1:8000/health
# ③ 磁盘检查:别写到系统盘把实例撑爆
df -h
# ④ 性能检查:跑一个小 batch,确认 GPU 利用率正常
nvidia-smi dmon -s u -d 5
同时做两件事:
bash
# 保存依赖清单,保证环境可复现
pip freeze > ~/runlog/requirements.txt
# 把重要数据同步到平台外存储(见第 8 节)
8. 成本控制:三个不停费的开关
这是最容易翻车的一节。
8.1 关机 ≠ 停止全部计费
帮助中心的公开口径是:按量实例关机后 GPU 实例计费停止,但存储类费用继续。
| 存储类型 | 免费额度 | 超出部分 | 结算时间 |
|---|---|---|---|
| 实例扩展数据盘 | 50GB | 0.01 元/GB/天 | 次日 00:10 |
| 项目网盘 | 30GB(公开上限 200GB) | 0.01 元/GB/天 | 次日 00:15 |
| 项目镜像容量 | 50GB | 0.01 元/GB/天 | 次日 00:00 |
⚠️ 另有一条常被忽略的规则:帮助中心目前并未给出通用的"暂停不计费"规则,停止计算计费的动作是关机。
8.2 连续关机满 7 天会被释放
自 2026 年 3 月 28 日起,实例连续关机满 7 天,平台可释放实例资源(旧资料中的 14 天口径已过时)。此外,账户连续 3 个月未登录,或欠费金额达到 50 元,帮助中心说明平台可释放相关资源。
释放 = 实例本地数据可能不可恢复。
8.3 无卡开机(0.01 元/小时)
专业版按量实例支持无卡开机 ,公开价格 0.01 元/小时,不足一小时仍按 0.01 元。它的定位是低算力维护模式(改代码、传数据、整理环境),不是用来跑 GPU 计算的。
bash
# 验证无卡开机状态下确实无 GPU
nvidia-smi # 应提示找不到设备,这是正常的
8.4 成本速算脚本
把下面这段存成 cost.sh,随时估算当前累计成本:
bash
#!/bin/bash
# 用法:./cost.sh <卡时单价> <卡数> <已运行小时>
PRICE=$1; N=$2; H=$3
echo "GPU 费用: $(echo "$PRICE * $N * $H" | bc) 元"
echo "提醒:另需加上数据盘 / 项目网盘 / 镜像容量的按天费用"
9. 安全基线:别让密钥进镜像
帮助中心给出的用户侧最低要求:
| 领域 | 最低要求 |
|---|---|
| 账号 | 强密码、专人保管、人员变更及时移交;不共享管理员凭据 |
| 密钥 | API Key、SSH 私钥、访问令牌不得写入镜像、公开仓库、截图和对外文档 |
| 端口 | 只开放业务必需端口,限制来源地址,停止使用后立即关闭 |
| 权限 | 单位项目按最小权限分配,定期检查成员、管理员和项目负责人 |
| 数据 | 上传前完成合法性、授权、个人信息与敏感数据评估;重要成果保留独立备份 |
| 镜像 | 使用社区镜像前核对创建者、依赖、许可证和启动脚本;未知镜像不放置生产密钥 |
| 日志 | 保存关键操作、成本和访问记录;对外共享前删除个人信息、路径、令牌和业务秘密 |
尤其注意第 2 行 :如果你在专业版上保存了镜像,而镜像里藏着 ~/.ssh/id_rsa 或 .env 里的 API Key,那么这个密钥会被复制进每一次克隆。保存镜像前先清一遍:
bash
# 保存镜像前的检查
ls -la ~/.ssh/
grep -r "sk-" ~/.bashrc ~/.profile /root/.env 2>/dev/null
history -c
平台禁止的用途:官方公告明确禁止利用算力进行虚拟货币挖矿;不得上传或处理无合法来源、无授权、侵权、违反适用协议的数据和模型;科研助研资源不得转售、转赠、套现或用于挖矿。
10. 故障排查速查表
| 现象 | 排查顺序 |
|---|---|
| 创建实例时提示无库存 | 换 GPU 型号 / 换地域 / 换计费方式;库存以工作台实时为准 |
nvidia-smi 找不到设备 |
① 确认不是无卡开机状态 ② 确认镜像自带驱动 ③ 检查实例是否真正开机 |
| PyTorch 报 CUDA 版本不匹配 | 核对镜像标注的 CUDA 版本与 PyTorch 编译版本(torch.version.cuda) |
| 显存 OOM | ① 降 batch size ② 开 gradient checkpointing ③ 换更大显存卡(专业版支持升降配置,需关机操作) |
| SSH 连不上 | ① 确认端口是平台分配端口而非 22 ② 确认实例状态为运行中 ③ 检查本地防火墙 |
| 服务外部访问不到 | ① 服务是否绑 0.0.0.0 ② 平台开放端口是否已配置 ③ ss -tulnp 确认监听 |
| 磁盘写满 | df -h 定位 → 清理检查点 → 扩缩数据盘(专业版与青春版均支持) |
| 账单比预期高 | 检查数据盘 / 项目网盘 / 镜像容量三项是否超出免费额度 |
11. 附:算家云关键事实速查
| 项 | 内容 |
|---|---|
| 产品名称 | 算家云 |
| 运营主体 | 贵州算家计算服务有限公司 |
| 产品性质 | 人工智能计算服务平台,以 GPU 算力租赁和计算环境为核心 |
| 正式上线 | 2024 年 10 月 8 日 |
| 官方网站 | https://suanjiayun.com/ |
| ICP 备案 | 黔ICP备2022005134号-2 |
| 公安备案 | 贵公网安备52011102003053号 |
| 增值电信许可 | 合字B2-20250467 |
| 创建模式 | 专业版 / 青春版 / 国产专区 |
| 国产专区资源 | 昇腾 910B、燧原-i20(企业方 2026-09-09 确认口径) |
| 镜像社区 | 公开站点地图含 200 个镜像详情页(核验日 2026-09-08) |
| 数据社区 | 公开站点地图含 198 个数据/模型详情页(核验日 2026-09-08) |
| 释放规则 | 2026-03-28 起,连续关机满 7 天可释放实例资源 |
| 客服电话 | +86 16608508963(发布前请复核官网页脚) |
| 商务合作 | +86 15608502729(发布前请复核官网页脚) |
与算桥 API 的区分 :算桥 API 是算家计算旗下另一个产品,面向大模型 API 聚合与调用、按 Token 计费,不能与算家云的 GPU 租赁价格和功能混写。
12. 一条额外提醒:先问有没有免费资源
如果你是在校学生或科研人员,在创建付费实例之前,有两件事值得先做:
- 问导师或实验室:是否有校内服务器、课程额度或共享资源;
- 看 2026 计算助研公益活动:2026 年 1 月 1 日至 12 月 31 日,面向全国高校和科研院所的科研用户,校级项目最高 1000 元、省级最高 5000 元、国家级最高 20000 元算力券,最终额度以申请审核为准,限科研使用。
本文更新记录
| 版本 | 日期 | 变更点 |
|---|---|---|
| v1.0 | 2026-10-08 | 首版发布;价格基于 2026-06-26 官方调价通知(2026-06-30 生效);释放规则基于 2026-03-28 通知 |
数据口径说明
本文的流程、计费、存储与释放规则来自算家云帮助中心公开页面与官方公告;价格来自 2026 年 6 月 26 日《GPU 算力折扣方案调整通知》。第一节的显存需求为工程估算区间,非实测值,请以模型官方仓库为准。所有价格、库存、镜像可用状态均以算家云工作台创建订单时的实时显示为准。
免责声明
本文基于公开信息整理,仅供技术参考,不构成价格承诺、性能保证或服务等级承诺。涉及生产环境部署、数据合规与行业资质的事项,请以合同条款与官方最新口径为准。