ubuntu显卡驱动重启后失效的解决办法

写在前方:ubuntu系统,显卡重启后驱动失效,显卡不可用。网上冲浪之后得以有效解决,以下是解决方案

  • 查看显卡nvidia-smi;驱动失效消息:
bash 复制代码
(base) root@node:~# nvidia-smi 
NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver. Make sure that the latest NVIDIA driver is installed and running.
  • 驱动失效原因:

      系统内核升级,与原驱动信息不匹配

  • 解决办法:

      不建议重新安装驱动,可通过DKMS(Dynamic Kernel Module Support)修复,它能够维护内核外的驱动程序,并且在内核版本变化后自动生成新的模块。

1、下载dkms,apt-get install dkms

bash 复制代码
(base) root@node:~# apt-get install dkms

2、查看驱动版本信息ls /usr/src |grep nvidia

bash 复制代码
(base) root@node:~# ls /usr/src |grep nvidia
nvidia-550.90.07

3、使用dkms修复:

bash 复制代码
(base) root@node:~# dkms install -m nvidia -v 550.90.07

4、检查驱动是否可用:nvidia-smi

bash 复制代码
(base) root@node:~# nvidia-smi 
Fri Jul 12 06:00:52 2024       
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 550.90.07              Driver Version: 550.90.07      CUDA Version: 12.4     |
|-----------------------------------------+------------------------+----------------------+
| GPU  Name                 Persistence-M | Bus-Id          Disp.A | Volatile Uncorr. ECC |
| Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
|                                         |                        |               MIG M. |
|=========================================+========================+======================|
|   0  NVIDIA A800 80GB PCIe          Off |   00000000:4B:00.0 Off |                    0 |
| N/A   41C    P0             68W /  300W |       1MiB /  81920MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   1  NVIDIA A800 80GB PCIe          Off |   00000000:65:00.0 Off |                    0 |
| N/A   43C    P0             68W /  300W |       1MiB /  81920MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   2  NVIDIA A800 80GB PCIe          Off |   00000000:B1:00.0 Off |                    0 |
| N/A   42C    P0             71W /  300W |       1MiB /  81920MiB |      3%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   3  NVIDIA A800 80GB PCIe          Off |   00000000:E3:00.0 Off |                    0 |
| N/A   48C    P0             74W /  300W |       1MiB /  81920MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
                                                                                         
+-----------------------------------------------------------------------------------------+
| Processes:                                                                              |
|  GPU   GI   CI        PID   Type   Process name                              GPU Memory |
|        ID   ID                                                               Usage      |
|=========================================================================================|
|  No running processes found                                                             |
+-----------------------------------------------------------------------------------------+

参考资料:
https://blog.csdn.net/trainingVIP/article/details/137789875

相关推荐
難釋懷2 分钟前
Nginx测试工具charles
运维·nginx·php
云飞云共享云桌面5 分钟前
东莞制造业研发降本方案:1 台云主机承载 10 人 SolidWorks,钣金操作秒响应
linux·运维·服务器·安全·电脑
Mark White9 分钟前
一次 Ubuntu 内核升级翻车的运维记录:从 Kernel Panic 到锁定 6.14 内核
运维·ubuntu
hanbr12 分钟前
[特殊字符] Linux 学习笔记(二):压缩、Vim 与配置
linux·技术
修炼室12 分钟前
告别天天变动的随机端口!基于 Tailscale 子网路由(Subnet Router)外网原生直连学院服务器及安装踩坑指南
运维·服务器
赛博三把手13 分钟前
实操篇一:Claude Code + Token173 国内直连 Anthropic Fable 5 完整接入教程
linux·编辑器·vim
sbjdhjd14 分钟前
企业级 Tomcat (上):WEB 技术栈 + 架构演进 + 生产级安装部署
linux·运维·云原生·开源·tomcat·云计算·负载均衡
JAMSAN093015 分钟前
AI服务器MLCC:从“电子大米”到“算力石油”的价值重估
运维·人工智能·数据分析·智能硬件
华纳云IDC服务商17 分钟前
高防服务器清洗流量导致丢包怎么办?
运维·服务器·网络
KuaCpp18 分钟前
C++进阶(上)
linux·c++