解决容器内deepspeed微调大模型报错

解决容器内deepspeed微调大模型报错:launch.py:315:sigkill_handler Killing subprocess

问题描述:

在容器中用deepspeed微调百川大模型2时,出现上述错误,错误是由于生成容器时,共享内存没有设置,采用默认值引起的。终端输入ds_report,可以查看shared_memory,(之前是默认63M,现已调整50G)

解决办法

docker stop 容器名

docker rm 容器名

重新生成容器时加上共享内存参数:--shm-size=1g

例:

docker run -it -d --shm-size=50g --name 容器名--net host --gpus all -v 宿主机路径:容器内路径 -e NVIDIA_DRIVER_CAPABILITIES=compute,utility ubuntu:latest /bin/bash

相关推荐
机器学习是魔鬼几秒前
当 AI 学会“上课”:清华 OpenMAIC 如何打造真正的 AI 互动课堂
人工智能·矩池云
断眉的派大星3 分钟前
NVIDIA AI 软件生态完整学习笔记
人工智能
Capricorn19886 分钟前
知芽 Notebook Skill 引用存在性校验与单元记忆破解幽灵引用危机
大数据·论文阅读·人工智能·论文笔记
有Li9 分钟前
AI帮你做CT/MR分割,想分哪里分哪里
人工智能·学习·医学生
redreamSo10 分钟前
想给产品加一个 AI 搜索,是上向量数据库还是用 MongoDB 就够了?
数据库·人工智能·mongodb
山铃11 分钟前
Agent开发第1步:抽象模型接口 (Model Adapter)
人工智能
桃西西呀14 分钟前
换个会话就失忆?拆开 Agent 记忆的 4 层与 4 个流派,附9个坑的自检清单
人工智能·llm·ai编程
山铃14 分钟前
Agent开发第2步:定义工具抽象 (Tools)
人工智能
桃西西呀15 分钟前
风控模型说自己 80% 准,却漏掉了 76% 该拦的人:一次把模型评估讲透
人工智能·机器学习·llm
山铃15 分钟前
Agent开发第4步:定义 RunEvent
人工智能