【深度学习】训练过程中一个OOM的问题,太难查了

现象:

各位大佬又遇到过ubuntu的这个问题么?

现象是在训练过程中,ssh 上不去了,能ping通,没死机,但是ubunutu 的pc侧的显示器,鼠标啥都不好用了。只能重启。

问题原因:

OOM了95G,尼玛!!!!

pytorch爆内存了,然后journald假死了,在journald被watchdog干掉之后,系统就崩溃了。

这种规模的爆内存一般,即使被oom kill了,也要卡半天的,确实会这样,能不能配一点虚拟内存上去啊。

设置swap交换空间:

bash 复制代码
(base) justin@justin-System-Product-Name:~$ sudo dd if=/dev/zero of=/swapfile bs                                                                  =1M count=327680
dd: failed to open '/swapfile': Text file busy
(base) justin@justin-System-Product-Name:~$ sudo swapoff
swapoff: bad usage
Try 'swapoff --help' for more information.
(base) justin@justin-System-Product-Name:~$ swapoff --help

Usage:
 swapoff [options] [<spec>]

Disable devices and files for paging and swapping.

Options:
 -a, --all              disable all swaps from /proc/swaps
 -v, --verbose          verbose mode

 -h, --help             display this help
 -V, --version          display version

The <spec> parameter:
 -L <label>             LABEL of device to be used
 -U <uuid>              UUID of device to be used
 LABEL=<label>          LABEL of device to be used
 UUID=<uuid>            UUID of device to be used
 <device>               name of device to be used
 <file>                 name of file to be used

For more details see swapoff(8).
(base) justin@justin-System-Product-Name:~$ sudo swapoff -a
(base) justin@justin-System-Product-Name:~$ sudo dd if=/dev/zero of=/swapfile bs                                                                  =1M count=327680

我的swap交换空间2GB, 可以用 free -m 查看

然后 先关闭:

sudo swapoff -a

然后写入:

sudo dd if=/dev/zero of=/swapfile bs =1M count=327680

写了32G

bash 复制代码
32768+0 records in
32768+0 records out
34359738368 bytes (34 GB, 32 GiB) copied, 371.924 s, 92.4 MB/s

sudo chmod 600 /swapfile

sudo mkswap /swapfile

bash 复制代码
(base) justin@justin-System-Product-Name:~$ sudo chmod 600 /swapfile
(base) justin@justin-System-Product-Name:~$ sudo mkswap /swapfile
Setting up swapspace version 1, size = 32 GiB (34359734272 bytes)
no label, UUID=e8a65557-0a65-4820-808b-e8924548ec90
(base) justin@justin-System-Product-Name:~$

启用交换空间:

sudo swapon /swapfile

检查交换空间

sudo swapon --show

永久设置:

如果希望系统在每次启动时自动启用交换空间,可以将下面的行添加到 /etc/fstab 文件中:

复制代码
echo '/swapfile none swap sw 0 0' | sudo tee -a /etc/fstab

这将确保在系统启动时,交换文件会自动被挂载。

最后,你可以使用以下命令来检查交换空间的使用情况:

free -h

这将显示系统的内存和交换空间使用情况。确保交换空间处于正常运行状态,以提供额外的内存支持。

ref:https://blog.csdn.net/qq_42244167/article/details/135755665?utm_medium=distribute.pc_relevant.none-task-blog-2~default~baidujs_baidulandingword\~default-1-135755665-blog-128822763.235^v43^pc_blog_bottom_relevance_base2\&spm=1001.2101.3001.4242.2\&utm_relevant_index=4

相关推荐
zhaoshuzhaoshu11 分钟前
人工智能(AI)发展史:详细里程碑
人工智能·职场和发展
Luke~12 分钟前
阿里云计算巢已上架!3分钟部署 Loki AI 事故分析引擎,SRE 复盘时间直接砍掉 80%
人工智能·阿里云·云计算·loki·devops·aiops·sre
weixin_1562415757612 分钟前
基于YOLOv8深度学习花卉识别系统摄像头实时图片文件夹多图片等另有其他的识别系统可二开
大数据·人工智能·python·深度学习·yolo
QQ6765800818 分钟前
AI赋能轨道交通智能巡检 轨道交通故障检测 轨道缺陷断裂检测 轨道裂纹识别 鱼尾板故障识别 轨道巡检缺陷数据集深度学习yolo第10303期
人工智能·深度学习·yolo·智能巡检·轨道交通故障检测·鱼尾板故障识别·轨道缺陷断裂检测
小陈工20 分钟前
2026年4月7日技术资讯洞察:下一代数据库融合、AI基础设施竞赛与异步编程实战
开发语言·前端·数据库·人工智能·python
tq108620 分钟前
组织的本质:从科层制到伴星系统的决断理论
人工智能
科技与数码24 分钟前
互联网保险迎来新篇章,元保方锐分享行业发展前沿洞察
大数据·人工智能
云程笔记29 分钟前
002.计算机视觉与目标检测发展简史:从传统方法到深度学习
深度学习·yolo·目标检测·计算机视觉
汽车仪器仪表相关领域35 分钟前
NHFID-1000型非甲烷总烃分析仪:技术破局,重构固定污染源监测新体验
java·大数据·网络·人工智能·单元测试·可用性测试·安全性测试