- 现象:exits with return code -7
- 原因 :Setting the shm-size to a large number instead of default 64MB when creating docker container solves the problem in my case. It appears that multi-gpu training relies on the shared memory. ref
- 排查是否是shm-size过小: 在服务器上执行
ds_report,查看最后一行的是不是shared memory (/dev/shm) size .... 64.00 MB
- 排查是否是shm-size过小: 在服务器上执行
- 解决方案:增加docker的shm
deepseed 单机多卡程序报错:exits with return code -7
遇到好事了2024-01-16 13:30
相关推荐
饼饼学习空间智能1 小时前
低空经济进入新兴支柱产业:物理AI如何重构低空智能监管系统?在所不辞兄2 小时前
常微分方程详解与应用武子康3 小时前
Cosmos Curator 只跑一条视频,为什么还会加载一串模型?Rocky Ding*3 小时前
Janus-Pro深度解析:视觉编码解耦之后,统一多模态模型如何通过训练与数据扩展能力破壁者-燕5 小时前
MLE 基础学习 Transformer高洁015 小时前
AI软件工程:大模型赋能软件研发全流程革新牧羊人.3335 小时前
动手学深度学习 06|学习率调整硅谷秋水6 小时前
将物理先验嵌入机器人学习:综述机器学习之心10 小时前
DCNN-PINN锂电池SOC估计,因果空洞卷积+物理信息神经网络,把库仑定律写进损失函数,MATLAB代码