NVIDIA-SMI has failed because it couldn“t communicate with the NVIDIA driver .

文章目录

报错

  1. 执行nvidia-smi报错

    NVIDIA-SMI has failed because it couldn"t communicate with the NVIDIA driver .
    Make sure that the atest NVIDIA driver is installed and running.

  2. 运行使用gpu的docker容器时

    NVIDIA Docker - initialization error: nvml error: driver not loaded

原因分析

  1. 大概率是因为重启后内核升级了 (起码我的问题是因为这样)。
  2. 驱动文件被删除

解决办法

  1. 查看显卡连接是否正常
sh 复制代码
$ sudo lshw -C display

应该会输出

  1. 查看已安装内核
sh 复制代码
$ dpkg --get-selections |grep linux-image
  1. 查看在使用内核
sh 复制代码
$ uname -a

如果本地有多核内核大概可能是因为内核升级导致驱动无法识别

  1. 查看本地之前安装的驱动版本
sh 复制代码
$ ls /usr/src | grep nvidia

输出:nvidia-515.105.01 (记住:515.105.01 这个版本号)

5... 此时只需要执行

复制代码
$ sudo apt-get install dkms
$ sudo dkms install -m nvidia -v 515.105.01(515.105.01表示的是驱动版本号,上面查到的)
  1. 此时应该是解决了此问题
sh 复制代码
$ nvidia-smi

可以看到gpu的列表

防患于未然

1)命令行关闭系统自动更新,使用命令打开文件并编辑

sh 复制代码
$ sudo gedit /etc/apt/apt.conf.d/10periodic

将双引号中的"1"全部置"0"即可,修改后保存。

相关推荐
Codefengfeng31 分钟前
Python Base环境中加包的方法
开发语言·python
清水白石00832 分钟前
《Python 编程全景解析:从核心精要到测试替身(Test Doubles)五大武器的实战淬炼》
开发语言·python
如若1231 小时前
AutoDL云服务器 NVIDIA 570驱动 EGL渲染修复全记录
运维·服务器·python
甲枫叶2 小时前
【claude】Claude Code正式引入Git Worktree原生支持:Agent全面实现并行独立工作
java·人工智能·git·python·ai编程
清水白石0082 小时前
《Python 编程全景解析:从核心精要到 Hypothesis 属性基测试的边界探索》
开发语言·python
勇往直前plus3 小时前
深入理解 Python 内存模型:模块、类、对象的存储与运行机制
开发语言·python
yunhuibin3 小时前
NIN网络学习
人工智能·python·深度学习·神经网络·学习
派大星-?3 小时前
自动化测试五模块一框架(下)
开发语言·python
两万五千个小时4 小时前
构建mini Claude Code:02 - 把 Bash 拆成专用工具(read_file, write_file 等)
人工智能·python
henry1010105 小时前
Ansible自动化运维全攻略(AI生成)
linux·运维·python·ansible·devops