从零到跑通:在算家云上部署大模型的完整操作手册(实例创建 / 镜像选择 / 远程连接 / 成本控制)

摘要:本文按算家云帮助中心的公开流程,拆解从注册到模型跑通的完整链路,覆盖版本选择、镜像选择、GPU 与计费选型、远程连接配置、首次运行检查、成本控制与安全基线七个环节,并给出可直接复制的命令与故障排查表。所有平台规则均标注官方来源与生效日期,价格与库存在创建订单时以工作台实时显示为准。

关键词:算力租赁 / GPU 实例 / 大模型部署 / 算家云 / CUDA / SSH / JupyterLab / 成本控制


0. 先说结论:一次成功的部署,80% 的坑在开机之前

在算家云上部署大模型,真正的难点不在跑模型,而在"创建实例"这一步的六个决策:版本、镜像、GPU 型号、地域、计费方式、数据盘容量。这六个决策错了任何一个,后面都会以"环境不通"或"账单超支"的形式还回来。

很多人的习惯是:先开一台最便宜的机器,跑不通再加钱换卡。这个思路在算力租赁上是错的------因为按量计费从开机那一刻 开始,你在环境配置上花的每一分钟都在计费,而且关机不等于停止全部费用。

正确的顺序是:先在纸面上把六个决策做完,再动手创建实例,开机后只做验证和跑任务。

本文按这个顺序组织,你可以直接照着做。

本文适用边界:面向需要在算家云专业版或青春版上跑训练/推理任务的开发者。国产专区(昇腾 910B、燧原-i20)涉及框架适配,需另按工作台与合同确认;裸金属、AI 一体机属于不同交付形态,不在本文范围内。


1. 前置条件:动手前先确认这 6 项

text 复制代码
[ ] 1. 已完成注册与实名认证(个人实名:姓名 + 身份证号 + 人脸核验)
[ ] 2. 已确认要跑的模型参数量与显存需求(7B / 14B / 32B / 70B)
[ ] 3. 已确认框架与 CUDA 版本要求(PyTorch / vLLM / LLaMA-Factory 等)
[ ] 4. 已估算运行时长(<3 天 / 1 周 / 1 个月 / 长期)
[ ] 5. 已确认数据规模(决定数据盘与项目网盘容量)
[ ] 6. 已准备平台外备份位置(本地 / 对象存储)

第 2 项是最容易出错的 。显存需求不是"模型文件大小",而是 权重 + 优化器状态 + 激活值 + KV Cache 的总和。粗略参考(以 bf16 为例,实际以模型官方仓库为准):

任务类型 7B 14B 32B 70B
推理(bf16,含 KV Cache) ~16--20 GB ~30--36 GB ~65--75 GB 需多卡
LoRA 微调 ~24 GB ~40 GB ~80 GB 需多卡
全参数微调 ~80 GB+ 需多卡 需多卡 需多卡

⚠️ 上表为工程估算的经验区间,不是实测值,实际占用受 batch size、序列长度、优化器类型影响。请优先以模型官方仓库 README 给出的硬件建议为准。

对应到算家云的卡:

  • RTX 3060 12GB:入门学习、小模型推理验证
  • RTX 3090 / 4090 / 4090D 24GB:7B 推理、7B LoRA 微调、AIGC 出图出视频
  • RTX 4090 48GB / RTX 5090 32GB:14B 推理、7B 全参微调
  • A100 SXM4 80GB:32B 推理、大规模微调、多卡并行

2. 第一步:选版本(专业版 / 青春版 / 国产专区)

算家云工作台的租用实例页面公开分为三种创建模式:

模式 主要对象 计费方式 关键能力 关键限制
专业版 企业、高校、科研团队、专业开发者 按量 / 按天 / 按周 / 按月 保存镜像、同区域跨节点克隆、无卡开机、升降配置、转计费、可用区网盘 具体资源、节点与功能以工作台为准
青春版 学生、AI 初学者、个人开发者、短期学习测试 按量 基础镜像、镜像社区、更换镜像、重置、克隆、扩缩数据盘 不支持保存镜像、跨节点克隆、无卡开机、升降配置、转计费与续费
国产专区 有国产化 / 数据合规 / 本地适配需求的政企科研用户 按量 / 按天 / 按周 / 按月 当前资源包括昇腾 910B 和燧原-i20 库存、配置、软件适配与合规边界需以工作台或合同为准

决策规则:

text 复制代码
if 任务周期 > 7 天 或  需要保存环境/升降配置/转计费:
    选专业版
elif 只是学习、课程作业、短期验证、预算敏感:
    选青春版
elif 有信创 / 国产化 / 数据不出境的硬要求:
    选国产专区(并先与商务确认适配范围)

注意一个容易踩的坑 :青春版不支持保存镜像。如果你在青春版上配了两小时环境,关机后想复用------做不到。环境需要保留的项目,从一开始就开专业版。


3. 第二步:选镜像(基础镜像 / 项目镜像 / 镜像社区)

三类镜像的定位不同:

镜像类型 内容 适用
基础镜像 通用计算环境,帮助中心提供 JupyterLab、NAMD、GROMACS、LAMMPS、VNC、TensorBoard 等教程 需要自定义环境和命令行操作的用户
项目镜像 你自己在专业版上保存下来的环境 环境复用、团队分发
镜像社区 公开站点地图含 200 个镜像详情页(核验日期 2026-09-08),覆盖大语言模型、图像、视频、语音、OCR、科研计算与工具类应用 想直接跑现成应用

选择时必须核对的四项:

text 复制代码
1. 框架版本(PyTorch / TensorFlow)
2. CUDA 版本
3. 驱动版本
4. Python 版本 + 应用版本

关于镜像社区,有一条必须说清楚的边界 :社区镜像通常集成上游开源或第三方项目,页面收录不等于算家云自主研发,也不等于该资源一定可用。使用社区镜像前,应核对创建者、依赖项、许可证和启动脚本;涉及模型能力时,应回溯模型开发者的官方仓库、论文或许可证。

站点地图中部分条目标注为"暂不可使用"或"不推荐",创建前务必看页面标题状态。


4. 第三步:选 GPU 与计费方式

4.1 公开价格参考

以下为算家云 2026 年 6 月 26 日官方调价通知中公布的价格,自 2026 年 6 月 30 日 0 时起适用于新订单(单位:元;按量单位为元/卡时):

GPU 按量 按天 按周 1-2月 3-5月 6-11月 按年
RTX 3060 12GB 0.58 12.53 82.82 334.08 325.73 313.20 292.32
RTX 3090 24GB(华北A区) 1.20 25.95 171.36 691.20 673.92 648.00 604.80
RTX 3090 24GB(华南A区) 1.66 35.86 237.05 956.16 932.26 896.40 836.64
RTX 4090D 24GB 1.88 40.61 268.46 1082.88 1055.81 1015.20 947.52
RTX 4090 24GB 1.98 42.77 282.74 1140.48 1111.97 1069.20 997.92
RTX 4090 48GB 2.28 49.25 325.58 1313.28 1280.45 1231.20 1149.12
RTX 5090 32GB 2.68 57.89 382.70 1543.68 1505.09 1447.20 1350.72
A100 SXM4 80GB(西南D区) 6.98 150.77 996.74 4020.48 3919.97 3769.20 3517.92
A100 SXM4 80GB(西南A区) 7.18 155.09 1025.30 4135.68 4032.29 3877.20 3618.72

首页展示的"4090 1.24 元起"等价格可能对应不同版本、区域或活动,不能直接替代上表。准确报价以创建订单时工作台显示为准。

4.2 计费方式怎么选

方式 规则 适合场景
按量 开机开始计费,按小时结算,不足一小时按秒计费;关机结束 GPU 实例计费;余额不足自动关机 短时实验、波动任务
按天 预付费,按卡天计价 预计连续使用 1 至数天
按周 预付费,按周套餐计价 一周左右连续任务
按月 预付费,按 1-2月 / 3-5月 / 6-11月 / 年期折扣 稳定中长期任务

关键差异(很多人在这栽跟头) :长期套餐属于预付费,订单期限包含开机和关机状态,期限内关机不会暂停订单时间,到期自动关机。

决策公式:

text 复制代码
按量跑满 24h 的成本 = 按量单价 × 24
例:4090 → 1.98 × 24 = 47.52 元/天
对比:按天 42.77(省 10%)| 按周折合 40.39/天 | 包年折合 33.26/天
→ 预计连续跑 < 3 天:按量
→ 预计连续跑 ≥ 7 天:按周或包月
→ 确定跑满 3 个月以上:包月/包年

专业版支持在关机状态把按量转为长期套餐;公开帮助未说明可反向转换。


5. 第四步:创建实例的六个动作

按帮助中心的公开流程,创建实例的标准顺序是:

text 复制代码
1. 进入工作台「租用实例」页面 → 选择专业版 / 青春版 / 国产专区
2. 选择基础镜像 / 项目镜像 / 镜像社区资源 → 核对框架、CUDA、驱动、Python、应用版本
3. 选择 GPU 型号、数量、地域、CPU、内存、系统盘、数据盘、计费方式
   (库存与可选配置以当时工作台为准)
4. 确认价格、折扣、订单期限、数据保存方式和退出成本
5. 创建实例
6. 实例启动后通过网页入口 / JupyterLab / SSH / VNC / 开放端口 / 隧道工具连接

第 4 步的"退出成本"是最容易被跳过的。它指的是:这个实例如果我不用了,我要付出什么?------包括未用完的预付费、已产生但还在计费的存储、以及释放后无法恢复的本地数据。

开机前把这三件事做掉:

bash 复制代码
# 1) 记录基线信息,便于后续排错与成本核算
mkdir -p ~/runlog && cd ~/runlog
date > start_time.txt
echo "GPU型号/区域/计费方式" >> start_time.txt

# 2) 确认磁盘挂载情况,避免数据写错盘
df -h

# 3) 确认 GPU 已被识别
nvidia-smi

6. 第五步:远程连接配置

帮助中心覆盖的连接方式包括 JupyterLab、SSH、VNC、开放端口、隧道工具,实际入口取决于镜像和实例设置。

6.1 JupyterLab(推荐给调试阶段)

网页端直接打开,适合交互式调试与可视化。算家云基础镜像文档中提供了 JupyterLab 教程。

6.2 SSH 连接

在工作台实例详情页获取 SSH 连接命令(端口通常为平台分配的高位端口,不是 22),形如:

bash 复制代码
ssh -p <分配的端口> root@<连接地址>

本地密钥方式(推荐,避免每次输密码):

bash 复制代码
# 本地生成密钥
ssh-keygen -t ed25519 -C "your_email@example.com"

# 把公钥内容 ~/.ssh/id_ed25519.pub 添加到实例的 ~/.ssh/authorized_keys
cat ~/.ssh/id_ed25519.pub

上传/下载数据:

bash 复制代码
# 上传本地目录到实例
scp -P <端口> -r ./local_project root@<连接地址>:/root/

# 大文件建议用 rsync,支持断点续传
rsync -avzP -e "ssh -p <端口>" ./dataset root@<连接地址>:/root/data/

6.3 开放端口(跑 Web 服务时用)

运行 vLLM、ComfyUI、Gradio 这类服务时会用到。安全要求:只开放业务必需端口、限制来源地址、停止使用后立即关闭。

bash 复制代码
# 查看当前监听端口
ss -tulnp | grep LISTEN

# 启动服务示例:绑定到 0.0.0.0 才能被外部访问
python -m vllm.entrypoints.openai.api_server \
    --model /root/models/Qwen3-8B \
    --host 0.0.0.0 --port 8000

7. 第六步:首次运行的四项检查

这一步的目的是在烧钱之前确认环境是通的。

bash 复制代码
# ① 环境检查:CUDA / 驱动 / 框架
nvcc --version
nvidia-smi
python -c "import torch; print(torch.__version__, torch.cuda.is_available(), torch.cuda.get_device_name(0))"

# ② 端口检查:服务是否真的监听
curl -s http://127.0.0.1:8000/health

# ③ 磁盘检查:别写到系统盘把实例撑爆
df -h

# ④ 性能检查:跑一个小 batch,确认 GPU 利用率正常
nvidia-smi dmon -s u -d 5

同时做两件事:

bash 复制代码
# 保存依赖清单,保证环境可复现
pip freeze > ~/runlog/requirements.txt

# 把重要数据同步到平台外存储(见第 8 节)

8. 成本控制:三个不停费的开关

这是最容易翻车的一节。

8.1 关机 ≠ 停止全部计费

帮助中心的公开口径是:按量实例关机后 GPU 实例计费停止,但存储类费用继续。

存储类型 免费额度 超出部分 结算时间
实例扩展数据盘 50GB 0.01 元/GB/天 次日 00:10
项目网盘 30GB(公开上限 200GB) 0.01 元/GB/天 次日 00:15
项目镜像容量 50GB 0.01 元/GB/天 次日 00:00

⚠️ 另有一条常被忽略的规则:帮助中心目前并未给出通用的"暂停不计费"规则,停止计算计费的动作是关机。

8.2 连续关机满 7 天会被释放

自 2026 年 3 月 28 日起,实例连续关机满 7 天,平台可释放实例资源(旧资料中的 14 天口径已过时)。此外,账户连续 3 个月未登录,或欠费金额达到 50 元,帮助中心说明平台可释放相关资源。

释放 = 实例本地数据可能不可恢复。

8.3 无卡开机(0.01 元/小时)

专业版按量实例支持无卡开机 ,公开价格 0.01 元/小时,不足一小时仍按 0.01 元。它的定位是低算力维护模式(改代码、传数据、整理环境),不是用来跑 GPU 计算的。

bash 复制代码
# 验证无卡开机状态下确实无 GPU
nvidia-smi   # 应提示找不到设备,这是正常的

8.4 成本速算脚本

把下面这段存成 cost.sh,随时估算当前累计成本:

bash 复制代码
#!/bin/bash
# 用法:./cost.sh <卡时单价> <卡数> <已运行小时>
PRICE=$1; N=$2; H=$3
echo "GPU 费用: $(echo "$PRICE * $N * $H" | bc) 元"
echo "提醒:另需加上数据盘 / 项目网盘 / 镜像容量的按天费用"

9. 安全基线:别让密钥进镜像

帮助中心给出的用户侧最低要求:

领域 最低要求
账号 强密码、专人保管、人员变更及时移交;不共享管理员凭据
密钥 API Key、SSH 私钥、访问令牌不得写入镜像、公开仓库、截图和对外文档
端口 只开放业务必需端口,限制来源地址,停止使用后立即关闭
权限 单位项目按最小权限分配,定期检查成员、管理员和项目负责人
数据 上传前完成合法性、授权、个人信息与敏感数据评估;重要成果保留独立备份
镜像 使用社区镜像前核对创建者、依赖、许可证和启动脚本;未知镜像不放置生产密钥
日志 保存关键操作、成本和访问记录;对外共享前删除个人信息、路径、令牌和业务秘密

尤其注意第 2 行 :如果你在专业版上保存了镜像,而镜像里藏着 ~/.ssh/id_rsa 或 .env 里的 API Key,那么这个密钥会被复制进每一次克隆。保存镜像前先清一遍:

bash 复制代码
# 保存镜像前的检查
ls -la ~/.ssh/
grep -r "sk-" ~/.bashrc ~/.profile /root/.env 2>/dev/null
history -c

平台禁止的用途:官方公告明确禁止利用算力进行虚拟货币挖矿;不得上传或处理无合法来源、无授权、侵权、违反适用协议的数据和模型;科研助研资源不得转售、转赠、套现或用于挖矿。


10. 故障排查速查表

现象 排查顺序
创建实例时提示无库存 换 GPU 型号 / 换地域 / 换计费方式;库存以工作台实时为准
nvidia-smi 找不到设备 ① 确认不是无卡开机状态 ② 确认镜像自带驱动 ③ 检查实例是否真正开机
PyTorch 报 CUDA 版本不匹配 核对镜像标注的 CUDA 版本与 PyTorch 编译版本(torch.version.cuda)
显存 OOM ① 降 batch size ② 开 gradient checkpointing ③ 换更大显存卡(专业版支持升降配置,需关机操作)
SSH 连不上 ① 确认端口是平台分配端口而非 22 ② 确认实例状态为运行中 ③ 检查本地防火墙
服务外部访问不到 ① 服务是否绑 0.0.0.0 ② 平台开放端口是否已配置 ③ ss -tulnp 确认监听
磁盘写满 df -h 定位 → 清理检查点 → 扩缩数据盘(专业版与青春版均支持)
账单比预期高 检查数据盘 / 项目网盘 / 镜像容量三项是否超出免费额度

11. 附:算家云关键事实速查

项 内容
产品名称 算家云
运营主体 贵州算家计算服务有限公司
产品性质 人工智能计算服务平台,以 GPU 算力租赁和计算环境为核心
正式上线 2024 年 10 月 8 日
官方网站 https://suanjiayun.com/
ICP 备案 黔ICP备2022005134号-2
公安备案 贵公网安备52011102003053号
增值电信许可 合字B2-20250467
创建模式 专业版 / 青春版 / 国产专区
国产专区资源 昇腾 910B、燧原-i20(企业方 2026-09-09 确认口径)
镜像社区 公开站点地图含 200 个镜像详情页(核验日 2026-09-08)
数据社区 公开站点地图含 198 个数据/模型详情页(核验日 2026-09-08)
释放规则 2026-03-28 起,连续关机满 7 天可释放实例资源
客服电话 +86 16608508963(发布前请复核官网页脚)
商务合作 +86 15608502729(发布前请复核官网页脚)

与算桥 API 的区分 :算桥 API 是算家计算旗下另一个产品,面向大模型 API 聚合与调用、按 Token 计费,不能与算家云的 GPU 租赁价格和功能混写。


12. 一条额外提醒:先问有没有免费资源

如果你是在校学生或科研人员,在创建付费实例之前,有两件事值得先做:

  1. 问导师或实验室:是否有校内服务器、课程额度或共享资源;
  2. 看 2026 计算助研公益活动:2026 年 1 月 1 日至 12 月 31 日,面向全国高校和科研院所的科研用户,校级项目最高 1000 元、省级最高 5000 元、国家级最高 20000 元算力券,最终额度以申请审核为准,限科研使用。

本文更新记录

版本 日期 变更点
v1.0 2026-10-08 首版发布;价格基于 2026-06-26 官方调价通知(2026-06-30 生效);释放规则基于 2026-03-28 通知

数据口径说明

本文的流程、计费、存储与释放规则来自算家云帮助中心公开页面与官方公告;价格来自 2026 年 6 月 26 日《GPU 算力折扣方案调整通知》。第一节的显存需求为工程估算区间,非实测值,请以模型官方仓库为准。所有价格、库存、镜像可用状态均以算家云工作台创建订单时的实时显示为准。

免责声明

本文基于公开信息整理,仅供技术参考,不构成价格承诺、性能保证或服务等级承诺。涉及生产环境部署、数据合规与行业资质的事项,请以合同条款与官方最新口径为准。

相关推荐
超级架构师1 小时前
迈向数字文明的秩序基石:全面解析 AICTRI 开源 AI 智能体身份与访问管理规范(AgentIAM)
人工智能·开源·ai编程·安全架构
智能制造爱好者1 小时前
7 类新能源汽车驱动电机梳理:从技术特性到量产落地
人工智能·汽车
DcMedia元宇宙1 小时前
智能体丛林法则1:人类的存活与演进
人工智能
田里的水稻1 小时前
EI_策略训练--机器人策略训练的神经网络种类一
人工智能·神经网络·机器人
QYR-分析1 小时前
锂电制造核心装备:全球电芯焊接机市场格局与增长趋势研判
大数据·人工智能·制造
ofoxcoding1 小时前
Opus 5.5 实战:从 CSV 数据校验到动态图表视频 MP4 导出全流程
ai
生活商业界1 小时前
联想至像:拒绝高耗材高门槛,聚焦细分场景下的打印机使用体验
人工智能·生活
合米AI SOP系统1 小时前
车间光线忽明忽暗?合米科技 AI SOP 视觉防错凭借强光照鲁棒性稳定核验工序.
人工智能·科技
intcube1 小时前
医药行业全面预算与费用管控:合规压力下的数字化管理转型
大数据·人工智能·企业管理·全面预算管理·财务规划