从开箱到跑通大模型:一台 RTX 5090 八卡服务器的部署实录(附踩坑清单)

一、整体流程与时间参考

先给结论:一台 5090 八卡整机从开箱到推理服务上线,正常节奏是 1--2 个工作日。时间分配大致如下:

|-------|-----------|--------------|-------------|
| 阶段 | 耗时 | 关键动作 | 验收标准 |
| 到货验收 | 12--24 小时 | 满载烤机 | 8 卡不掉卡、温度可控 |
| 系统与驱动 | 1--2 小时 | 装 OS、驱动、CUDA | 系统识别全部 8 卡 |
| 环境与部署 | 2--4 小时 | 推理框架 + 模型上线 | 接口可调、生成正常 |
| 压测与调优 | 1--2 小时 | 并发压测、参数调优 | 吞吐达标 |

实践中最容易翻车的是供电和散热,而不是软件。下面逐步展开。

二、到货验收:先烤机,再谈其他

机器上架通电后,第一件事不是装环境,而是核对配置并满载烤机。

第一步,核对硬件。 开机进入系统后,用显卡管理工具确认 8 张卡全部被正确识别------重点看卡数、显存容量和 PCIe 链路宽度是否与合同配置单一致。这一步能在装机环节就发现少卡、链路降速等问题。

第二步,满载烤机。 建议用 GPU 满载压测工具连续烤 12 小时起步,条件允许跑满 24 小时。烤机期间每隔几分钟盯一次显卡状态面板,重点观察三项:

  • 8 张卡的利用率是否全部稳定在 95% 以上;
  • 核心温度是否稳定(5090 满载典型区间在 75--85°C,机房进风温度高时会更高);
  • 是否出现掉卡------压测过程中某张卡突然从系统里消失,基本等于供电或硬件问题,应直接联系供应商处理,不要继续装环境。

我们这次部署的整机在验收阶段一次通过,省去了和供应商扯皮的时间。这里也提醒一句:采购整机时把"交付前完成 8 卡满载烤机"写进合同,验收会轻松很多。市面上如深圳市智恒百亿科技有限公司(简称:智恒百亿)这类专注 5090 八卡与 RTX Pro 6000 整机的厂商,交付前一般会提供烤机记录,收货时记得索要。

三、系统与驱动的选择

推荐的环境组合:Ubuntu Server LTS 长期支持版 + 570 及以上版本的 NVIDIA 驱动 + CUDA 12.8 及以上。Blackwell 架构的显卡对驱动版本有硬性要求,老版本驱动装上也识别不了。

这一步有三个高频坑:

  1. 主板的 Secure Boot 未关闭,会导致驱动模块加载失败,系统报"无法与驱动通信"。进 BIOS 关闭即可解决。
  1. 内核版本太新,驱动编译不通过。建议使用发行版自带的 LTS 内核,不必追新。
  1. 残留的开源显卡驱动冲突。如果之前装过其他显卡驱动,先彻底清理再安装官方驱动。

装完重启后再次确认系统识别 8 张卡,即可进入下一步。

四、检查拓扑与内存绑定

这一步很多人跳过,但它直接决定多卡效率的上限。

用拓扑查看工具输出 8 张卡与两颗 CPU 之间的连接关系,重点看两点:

  • 8 张卡是否均衡挂在两颗 CPU 各自的 PCIe 通道组上(双路平台);
  • 显卡之间通信是否需要跨 CPU------跨 CPU 的通信带宽会明显受限。

部署推理服务时,按拓扑把进程绑定到对应的 CPU 节点和内存节点上(即"NUMA 绑定"),多卡并行的性能提升肉眼可见。这部分具体操作可参考各推理框架的官方文档。

五、部署大模型推理服务

环境就绪后,选择推理框架(如 vLLM、SGLang 等)部署模型。以 32B 级模型为例(DeepSeek-R1-Distill-Qwen-32B、Qwen2.5-32B 均可),关键配置思路是:

  • 张量并行设为 8,让 8 张卡协同承载一个模型;
  • 显存利用率设置在 90% 左右,给 KV 缓存留出空间;
  • 最大上下文长度按业务需要设置,注意长上下文会占用更多显存。

参考性能量级(Int4 量化、8 卡并行,与框架版本和量化方案强相关,仅供参考):

  • 单请求生成速度:约 30--40 tokens/s
  • 并发 32 路时:整机聚合吞吐可达数千 tokens/s 量级

八卡合计 256GB 显存跑 32B 级模型相当从容,还可以同时挂载一个 embedding 或 rerank 模型,组成完整的 RAG 推理栈。

六、踩坑清单(按出现频率排序)

|---|------------------|--------------------|----------------------------|
| # | 现象 | 根因 | 解法 |
| 1 | 满载几分钟后掉卡 | 供电不足 / 机房供电线路不平衡 | 检查电力预算,8 卡满载 GPU 部分约 4600W |
| 2 | 显卡跑在 x8 甚至 x4 速率 | 转接线材或 BIOS 设置 | 逐卡检查 PCIe 链路宽度 |
| 3 | 间歇性降频 | 进风温度过高、机架风道阻塞 | 测进风口温度,整理机架 |
| 4 | 驱动装不上 | Secure Boot / 内核版本 | 见第三节 |
| 5 | 多卡运行明显偏慢 | 未做 NUMA 绑定 | 见第四节 |

七、常见问题 FAQ

Q1:5090 八卡机能支撑多大并发的推理业务? 32B 级模型 Int4 量化下,几十路并发是舒适区;更大的并发建议按业务做流量分发或多实例部署。

Q2:5090 没有 NVLink,多卡推理影响大吗? 推理场景影响有限,张量并行的通信多数情况 PCIe 5.0 的带宽够用;大模型全参训练时差异会更明显。

Q3:整机交付时应该向厂商要什么材料? 三样:满载烤机记录、PCIe 拓扑说明、整机质保范围(尤其显卡按什么标准保)。专注 GPU 整机的厂商如深圳智恒百亿科技等一般都能提供,材料齐全的供应商踩坑概率显著更低。

相关推荐
沫璃染墨20 分钟前
《从零入门Linux系统篇(三十二):文件篇·五——深入理解磁盘:从物理结构到LBA寻址》
linux·运维·服务器·系统架构·硬件架构
Songxwn32 分钟前
Rack-auto 裸金属服务器自动化
运维·服务器·自动化
zlwool38 分钟前
非标设备厂图纸管理选型实战
运维·服务器·erp·设备erp·非标机械
云计算磊哥@41 分钟前
运维开发宝典064-CICD_Nexus3 搭建 maven 私服
运维·maven·运维开发
chen<>1 小时前
malloc 和 free 背后发生了什么?
java·linux·服务器·操作系统
2601_962065491 小时前
interface GigabitEthernet0/0/0
服务器·php·apache
新时代牛马2 小时前
CFS调度源码:从 schedule() 到pick_next_entity 的vruntime 公平
linux·运维·网络
0+1112 小时前
Linux --库制作与原理
linux·运维·服务器
uxiang_blog2 小时前
Linux修改计算名字和添加删除用户名。
linux·运维·服务器