ubuntu 服务器(带NVLink)更新显卡驱动 (巨坑!!)

如果你使用的是大型的带NVLink的GPU服务器,例如H100\H20\A100等,就不要去学那些普通服务器或个人电脑的显卡驱动更新的教程,因为不一样!很容易导致更新后,nvidia-fabricmanager 的版本和驱动对不上,而且 apt-get 根本找不到对应的版本!

正确步骤:

1. 卸载原有驱动

复制代码
apt-get --purge remove "*nvidia*" -y  

2. 下载 Data Center 驱动

注意要下载Data Center 驱动而不是普通显卡驱动。去官网,选择想要的版本,按照官网步骤(如下图所示)做完(直到做完 apt-get install -y nvidia-open-570这一步),那么此时驱动安装完毕

3. 下载 nvidia-fabricmanager

NVLink的服务器必须安装nvidia-fabricmanager,不然即使nvidia-smi可以看到GPU,使用torch时也检测不到GPU

安装的nvidia-fabricmanager必须和nvidia-driver版本号严格对应,安装前可以先检查可安装的版本是否和driver对得上:

复制代码
apt-cache policy nvidia-fabricmanager-570

如果能找到正确版本,则安装它:

复制代码
apt-get install -y nvidia-fabricmanager-570

最后重启

复制代码
reboot

4. 开启nvidia-fabricmanager

重启后需要开启fabricmanager服务,参考此篇

复制代码
sudo systemctl enable nvidia-fabricmanager   # 配置Fabric Manager服务随实例开机自启动
sudo systemctl start nvidia-fabricmanager    # 启动Fabric Manager服务
sudo systemctl status nvidia-fabricmanager    # 查看Fabric Manager服务是否正常启动,回显active(running)表示启动成功

然后使用nvidia-smi检查显卡,使用 torch.cuda.is_available() 检测显卡,如果没问题则大功告成。

相关推荐
老A的AI实验室3 小时前
赛博月刊 #2026年9月
大数据·人工智能·深度学习·ai·llm
AOI小白新手上路3 小时前
深度学习模块缝合方法论 · 人物蒸馏笔记
人工智能·笔记·深度学习
C++ 老炮儿的技术栈3 小时前
有符号变量与无符号变量的区别
服务器·开发语言·前端·数据结构·c++·算法·c
梦帮科技4 小时前
多任务权重流形融合:SLERP 球形线性插值、DARE 稀疏剪枝与多专家模型融合落地
人工智能·深度学习·算法·机器学习·tensorflow·聚类·剪枝
YYRAN_ZZU4 小时前
如何编一个gcc的交叉工具链
linux·c++
Yolanda_20224 小时前
17.卷积操作
人工智能·深度学习
`流年づ4 小时前
卷积核与反卷积知识补充
人工智能·深度学习·计算机视觉
shjita4 小时前
centos中安装docker
linux·docker·centos
YOLO_DATA4 小时前
YOLO27防震锤缺陷检测数据集 防震锤数据集 1000张 防震锤 带标注 voc yolo 2 类 目标检测
人工智能·深度学习·yolo·目标检测·计算机视觉·数据集·无人机
程序猿老A4 小时前
阿里云linux服务器安装mysql并实现远程访问
linux·服务器·阿里云