解决容器内deepspeed微调大模型报错

解决容器内deepspeed微调大模型报错:launch.py:315:sigkill_handler Killing subprocess

问题描述:

在容器中用deepspeed微调百川大模型2时,出现上述错误,错误是由于生成容器时,共享内存没有设置,采用默认值引起的。终端输入ds_report,可以查看shared_memory,(之前是默认63M,现已调整50G)

解决办法

docker stop 容器名

docker rm 容器名

重新生成容器时加上共享内存参数:--shm-size=1g

例:

docker run -it -d --shm-size=50g --name 容器名--net host --gpus all -v 宿主机路径:容器内路径 -e NVIDIA_DRIVER_CAPABILITIES=compute,utility ubuntu:latest /bin/bash

相关推荐
思录Echo1 小时前
光学轮廓仪质检设备厂家怎么选?优可测国产替代方案深度解析
大数据·人工智能
麻瓜code1 小时前
【Agent】AI 应用开发环境搭建 & 大模型三种接入方式对比
人工智能
R²AIN SUITE1 小时前
2026企业级AI Agent开发平台怎么选?RAG知识库到工作流编排的四层架构拆解
人工智能·架构
延凡科技1 小时前
建筑节能新视角:智慧冷站的数字化实践
java·人工智能·能源·暖通
zzzll11111 小时前
RAG(检索增强生成)会不会消亡?
人工智能·深度学习·机器学习
鹿鸣天涯2 小时前
Hugging Face AI开源平台学习入门
人工智能
Htr_2 小时前
Reflexio 使用指南:让 AI 智能体从每次交互中持续学习
人工智能·学习·交互
leoZ2312 小时前
第 7 篇:进阶——校验、联动、列表页
开发语言·前端·javascript·vue.js·人工智能·目标检测·ecmascript
临沂GEO2 小时前
芝麻开门GEO|AI数字化新趋势,助力企业线上长效增长
大数据·人工智能·python