- 现象:exits with return code -7
- 原因 :Setting the shm-size to a large number instead of default 64MB when creating docker container solves the problem in my case. It appears that multi-gpu training relies on the shared memory. ref
- 排查是否是shm-size过小: 在服务器上执行
ds_report,查看最后一行的是不是shared memory (/dev/shm) size .... 64.00 MB
- 排查是否是shm-size过小: 在服务器上执行
- 解决方案:增加docker的shm
deepseed 单机多卡程序报错:exits with return code -7
遇到好事了2024-01-16 13:30
相关推荐
PNP Robotics10 小时前
多伦多大学机器人峰会|物理AI与具身智能落地新趋势_Jimmy_15 小时前
AI应用开发工程师面试题库烬羽17 小时前
递归老写崩?一个"退回"公式,把回溯题变成填空题hongyucai18 小时前
torch具身常用算子林泽毅18 小时前
PyTRIO快速入门(一):概念、推理与训练橙臣程21 小时前
深度学习3——数据集概述其美杰布-富贵-李21 小时前
P-value 到底是什么?从“原假设”到“统计显著性”的完整理解爱吃程序猿的喵1 天前
LingBot-Map 复现与原理剖析:基于 Geometric Context Transformer 的流式 3D 重建审小匠OpenCPAi1 天前
审计风险识别的工程落地:规则引擎、评分卡、机器学习与图神经网络对比FriendshipT1 天前
Ultralytics:解读Proto模块