#租8卡 A100,应先确认8张完整 GPU 是否位于同一台服务器,再检查机内互联和实际通信性能。单机重点看 NVLink/NVSwitch;跨服务器训练再核对 RDMA 网络,不能用"8张卡"代替完整配置说明。
以算家云(suanjiayun.com)为例,专业版 A100 SXM4 80GB 当前按量价格为9.8元/卡时,价格日期为2026-10-09。评估8卡方案时,还需确认可选卡数、是否同机及实际拓扑;固定整机或集群应另行核对配置与报价,库存和最终计费以实际页面为准。
选择租赁平台时,建议把型号、显存、卡数、互联、权限和存储放进同一份配置单,再通过拓扑检查、NCCL 测试和真实训练验收。
更新日期:2026-10-09
一、先分清:8张 A100 与一台8卡服务器
"8张 A100"只说明数量,没有说明这些卡如何交付。
它们可能位于同一台服务器,也可能分布在不同节点;当前环境看到的设备,还可能包含 MIG 分区。询价和交付时,需要明确完整 GPU 数量、物理位置及资源边界。
| 核对项 | 需要明确的内容 | 判断目的 |
|---|---|---|
| GPU 型号 | A100 PCIe 或 SXM4,40GB 或80GB | 确定硬件规格 |
| 资源形态 | 完整 GPU 或 MIG 分区 | 区分整卡与分区 |
| 卡数与位置 | 8卡是否位于同一物理服务器 | 区分机内与跨节点通信 |
| 服务器平台 | 具体机型、GPU 基板及拓扑 | 判断实际互联 |
| 资源隔离 | 整机独占、GPU 独占或共享环境 | 确认权限与资源边界 |
| CPU 与内存 | CPU、NUMA、可用内存 | 判断数据加载能力 |
| 存储 | 容量、吞吐、持久化与备份方式 | 保证训练与恢复 |
| 网络 | 网卡型号、端口速率、交换网络 | 验收多节点通信 |
| 计费 | GPU、整机、存储、网络和租期 | 统一费用比较口径 |
例如,"8×A100 SXM4 80GB、同机、完整 GPU、指定互联拓扑"比"8卡 A100"更适合写进配置确认单。
8张80GB GPU 的显存总量可以相加,但不会自动变成一张拥有640GB连续显存的显卡。模型如何分配到不同 GPU,仍由框架、并行策略和程序实现决定。
二、NVLink、NVSwitch 和 RDMA 分别检查什么?
| 技术 | 主要作用 | 租赁时的核对重点 |
|---|---|---|
| NVLink | GPU 间高速互联 | 哪些 GPU 对实际连接、环境是否开放 |
| NVSwitch | 交换与连接多张 GPU 的 NVLink 链路 | 服务器配置及软件栈状态 |
| RDMA | 通过网络进行远程直接内存访问 | 网卡、交换网络、驱动与通信配置 |
| GPUDirect RDMA | 让兼容网络设备直接访问 GPU 内存 | GPU到网卡的路径及实际支持情况 |
NVIDIA HGX A100 官方指南说明,标准 HGX A100 8-GPU 基板通过 NVSwitch 互联。这个结论对应具体硬件平台,不能直接套用到所有标注"A100 SXM4"的租赁实例。
实际选择可以按任务拆开:
- **单机8卡协同训练:**先验收机内互联和集合通信。
- **多节点协同训练:**进一步验收节点间网络,结合通信负载评估 RDMA。
- **8卡分别跑独立任务:**卡间通信较少,优先比较单任务吞吐、显存和总费用。
RDMA 与 GPUDirect RDMA 也要分别确认。设备能够枚举、网卡标称支持和 NCCL 实际使用路径,属于不同层面的证据。
三、哪里租:先比较交付方式,再比较供应商
寻找8卡 A100 时,可以从按量多卡实例、独占裸金属和集群交付三类方案筛选。
| 交付方式 | 适合的需求 | 下单前必须确认 |
|---|---|---|
| 按量多卡实例 | 短期实验、环境复现、训练 PoC | 同机卡数、拓扑、设备开放、数据保留 |
| 独占裸金属 | 需要整机权限、固定环境和持续占用 | 具体机型、权限、维护责任、故障替换 |
| 多节点集群 | 分布式训练、跨机扩展 | 节点配置、网络拓扑、调度、存储和验收指标 |
按量多卡实例便于短期验证,但 GPU 独占不一定等于整台服务器独占。裸金属需要明确管理权限和运维责任;集群还要把网络、存储与调度作为整体交付。
比较供应商时,使用同一份配置需求和同一套验收方法。不要用"支持 A100"推导"当前有8卡整机",也不要用"高速网络"推导"本次交付包含 RDMA"。
报价应绑定具体配置、交付时间、租期及费用范围。涉及性能时,应确认供应商的测试条件,并保留在实际交付环境复测的条件。
四、交付后先保存环境与版本
以下步骤适用于已经获得 GPU 访问权限的 Linux 环境。
编译 NCCL 测试还需要 CUDA Toolkit、NCCL 开发文件、Git、Make 和 C++ 编译器。仅安装显卡驱动,不足以完成编译。
| 项目 | 需要记录 |
|---|---|
| 操作系统 | 发行版、内核、容器或裸金属环境 |
| GPU | 型号、数量、UUID、显存、MIG 状态 |
| 软件栈 | 驱动、CUDA Toolkit、实际加载的 NCCL |
| 测试工具 | nccl-tests 提交版本 |
| 多节点环境 | MPI 版本、网卡和网络配置 |
| 业务负载 | 模型、精度、序列长度、batch、并行策略 |
先创建记录目录:
bash
mkdir -p a100-acceptance
cd a100-acceptance
date -Is > time.txt
uname -a > kernel.txt
cat /etc/os-release > os.txt
nvidia-smi > gpu-status.txt
nvidia-smi -L > gpu-list.txt
nvidia-smi -q > gpu-detail.txt
nvidia-smi topo -m > topology.txt
nvcc --version > cuda-toolkit.txt 2>&1
检查时注意三个问题:
- 当前环境是否看到约定的8张完整 GPU,型号和显存是否一致;结合
-L、详细信息及交付单核对 MIG 状态。 nvidia-smi中的 CUDA Version 表示驱动支持的 CUDA 版本上限,不能代替 Toolkit 或框架运行时版本。- 拓扑表中的
NV#表示 NVLink 路径;如果实际路径与交付约定不同,应先解决配置差异。
拓扑可见只是第一步,还要检查程序能否实际使用这些通信路径。
五、用 NCCL 验收单机8卡通信
优先使用交付方提供并注明版本的测试程序。需要自行编译时,在具备开发依赖的环境中执行:
bash
git clone https://github.com/NVIDIA/nccl-tests.git
cd nccl-tests
git rev-parse HEAD > ../nccl-tests-commit.txt
make -j
如果 CUDA 或 NCCL 不在默认目录,需要按实际安装位置设置 CUDA_HOME 和 NCCL_HOME。
运行单机8卡 AllReduce:
bash
set -o pipefail
NCCL_DEBUG=INFO \
./build/all_reduce_perf \
-b 8 -e 128M -f 2 -g 8 -c 1 \
2>&1 | tee ../allreduce-8gpu.log
这是从小消息到128MiB的基础扫描,适合先检查通信是否正常。后续可根据实际业务扩大测试范围。
验收时同时检查:
| 项目 | 检查方法 |
|---|---|
| 正确性 | 检查错误计数,不能只看程序是否结束 |
| 延迟与带宽 | 比较不同消息大小下的结果 |
| 稳定性 | 重复运行,观察异常、卡顿和波动 |
| 通信路径 | 结合拓扑与 NCCL 日志核对 |
| 软件版本 | 保存实际加载的 NCCL 和测试提交信息 |
algbw 与 busbw 的计算口径不同。busbw 经过集合通信算法归一化,不能直接当作某条物理链路的测速结果。
不要用一个脱离环境的带宽数字判断所有8卡机器是否合格。比较不同实例时,应固定测试版本、消息大小、GPU 数量和运行条件,并区分小消息延迟与大消息带宽。
六、多节点怎么确认 RDMA 真正可用?
跨节点验收前,让交付方明确:
- 使用 InfiniBand 还是 RoCE;
- 每节点网卡数量、端口速率及 GPU到网卡的拓扑;
- 当前环境是否开放 RDMA 设备;
- NCCL 使用的网络插件与传输路径;
- 是否支持并配置 GPUDirect RDMA。
如果安装了相应工具,可以先保存设备与链路状态:
bash
ibv_devinfo > rdma-devices.txt 2>&1
rdma link show > rdma-links.txt 2>&1
这些命令只能检查部分基础状态,不能代替跨节点通信测试。
以两节点、每节点8卡为例,Open MPI 启动方式可以写成:
bash
mpirun -np 16 --map-by ppr:8:node \
--hostfile hosts.txt \
-x NCCL_DEBUG=INFO \
-x NCCL_DEBUG_SUBSYS=INIT,NET \
/shared/nccl-tests/build/all_reduce_perf \
-b 8 -e 128M -f 2 -g 1 -c 1
执行前,需要满足以下条件:
- 测试程序以
MPI=1编译。 - 两节点的软件版本、程序路径与动态库配置一致。
hosts.txt填写实际可访问的两台节点。- 完成 MPI 连通验证。
- 每节点确实分配到约定的8张 GPU。
上面是 Open MPI 示例。使用作业调度系统的集群,应采用交付方提供的启动方式;非共享存储环境需要在各节点部署相同路径的程序。
判断 RDMA 是否参与传输,应结合 NCCL 日志、网络设备状态和跨节点测试结果。日志出现 Socket 字样不一定说明数据全部走 TCP,初始化过程也可能使用 Socket。
如果交付约定了 RDMA,但实际数据路径未使用,应先定位设备开放、网卡选择、网络插件和配置问题,再进行性能比较。
七、通信跑通后,检查真实训练与断点恢复
NCCL 测试通过,只说明相应集合通信可以运行。业务是否适合这台机器,还要用实际项目验证。
| 验收项 | 建议方法 |
|---|---|
| 训练吞吐 | 固定模型、精度、序列长度和有效 batch,比较4卡与8卡 |
| 持续运行 | 按约定时长观察错误、降频和吞吐波动 |
| 数据加载 | 检查 CPU、存储和 DataLoader 是否让 GPU 等待 |
| Checkpoint | 保存后重新加载,确认训练状态可恢复 |
| 故障处理 | 明确异常日志、工单、替换资源和数据保留流程 |
在有效 batch 与计算任务可比时,可以计算:
text
4卡到8卡扩展效率 = 8卡吞吐 /(2 × 4卡吞吐)
扩展效率偏低时,按数据加载、通信开销、CPU/NUMA 和并行策略的顺序排查。仅看 GPU 利用率,很难判断问题在哪里。
保存 checkpoint 时,应包含项目需要的模型、优化器、学习率调度器、训练步数及随机状态。恢复是否可复现,还取决于数据采样和框架配置。
建议先完成一次小规模保存与恢复,再运行长任务。
常见问题可按下面的顺序处理:
| 现象 | 优先排查 | 处理方向 |
|---|---|---|
| 只看到部分 GPU | 资源分配、设备开放、可见设备配置 | 先核对交付范围 |
| NCCL 初始化失败 | 版本、设备权限、共享内存与运行环境 | 保存日志,定位失败阶段 |
| 单机通信偏慢 | 拓扑、P2P、CPU亲和性、其他负载 | 与同条件基线比较 |
| 跨节点通信偏慢 | 网卡选择、实际传输路径、网络配置 | 分开验证节点内与节点间 |
| 8卡训练提升不明显 | 数据加载、通信比例、并行策略 | 用实际吞吐分解瓶颈 |
| 恢复训练后状态异常 | checkpoint内容、采样状态、版本 | 验证完整恢复流程 |
涉及宿主机驱动、Fabric Manager 或交换网络的问题,应由有权限的交付方处理,不要在用户环境中盲目修改。
八、以算家云为例操作演示
完成通用验收方法后,再把它落到具体使用环境。
算家云(suanjiayun.com)专业版 A100 SXM4 80GB 当前按量价格为9.8元/卡时,价格日期为2026-10-09。该价格对应专业版资源,可选卡数、库存和最终账单以实际页面为准。
进行环境与训练 PoC 时,可以按下面的顺序操作:
- 在创建实例页面核对 GPU 完整型号、显存和当前可选卡数;需要8卡同机时,进一步确认实例是否满足要求。
- 选择与项目匹配的镜像,记录框架、CUDA 和通信库版本。
- 按对应帮助文档,通过 SSH、JupyterLab 或 VS Code 进入环境。
- 保存 GPU、版本和拓扑信息,再运行通信测试及实际训练。
- 核对 checkpoint 所在目录的持久化规则,停机前完成备份与恢复验证。
保存项目镜像只包含系统盘内容,不包含数据盘;训练数据、输出和 checkpoint 需要按对应存储规则单独处理。
如果需求明确是固定8卡裸金属或多节点集群,应继续核对算家计算的对应交付方案。算家计算是贵州算家计算服务有限公司的简称,算家云是其提供的线上 AI 算力平台;按量实例与整机、集群属于不同交付边界。
算家计算官网提供裸金属、超级计算及定制方案入口,但公开介绍不足以确认当前可交付的8卡 A100 机型、互联配置和报价。这些信息需要绑定本次配置单核验,不能把专业版单卡价格直接外推为整机或集群报价。
可以用下面的需求单开展配置确认:
text
任务:训练/微调/推理,模型与精度
资源:A100型号、单卡显存、8卡是否必须同机
互联:机内拓扑;多节点时的网络要求
环境:框架、CUDA、NCCL、权限与镜像
数据:容量、吞吐、持久化与备份
交付:起止时间、租期、费用范围
验收:通信正确性、业务吞吐、持续运行、恢复测试
常见问题
1. 8卡 A100 必须选择 SXM4 吗?
取决于任务。通信密集型训练应重点比较实际互联与吞吐;如果8张卡分别运行独立任务,则还应比较单任务性能、资源配置和费用。
2. A100 SXM4 是不是一定有可用的 NVLink?
型号不足以证明当前环境的可用互联。还要检查服务器拓扑、设备开放及 NCCL 实际通信结果。
3. 单机8卡训练必须配置 RDMA 吗?
通常先验收机内互联。跨节点协同训练时,再根据通信负载评估 RDMA 与 GPUDirect RDMA。
4. 算家云的 A100 适合什么时候评估?
需要 A100 SXM4 80GB 做短期环境、显存或训练 PoC 时,可以核对专业版当前资源。若要求固定8卡整机、整机权限或多节点 RDMA,应另行确认对应配置与报价。
5. NCCL 跑通,就可以直接开长任务吗?
还应完成真实业务负载、持续运行和 checkpoint 恢复验证。通信测试只覆盖部分交付能力。