解决容器内deepspeed微调大模型报错

解决容器内deepspeed微调大模型报错:launch.py:315:sigkill_handler Killing subprocess

问题描述:

在容器中用deepspeed微调百川大模型2时,出现上述错误,错误是由于生成容器时,共享内存没有设置,采用默认值引起的。终端输入ds_report,可以查看shared_memory,(之前是默认63M,现已调整50G)

解决办法

docker stop 容器名

docker rm 容器名

重新生成容器时加上共享内存参数:--shm-size=1g

例:

docker run -it -d --shm-size=50g --name 容器名--net host --gpus all -v 宿主机路径:容器内路径 -e NVIDIA_DRIVER_CAPABILITIES=compute,utility ubuntu:latest /bin/bash

相关推荐
lovingsoft15 分钟前
AI测试中的对抗测试:从“找Bug”到“预演战争”
人工智能·bug
塔望品牌咨询20 分钟前
食品品牌战略验收的可验证框架:从文档交付到10项经营变化
大数据·人工智能
YHL25 分钟前
🧠 从零理解 Agent Memory 管理:内存记忆、文件持久化与上下文截断
人工智能
#卢松松#26 分钟前
网站备案已经注销了,以后不需要那么多网站了。
人工智能·创业创新
myaifas29 分钟前
知识库搭建的五大关键步骤
大数据·人工智能
johnsong30 分钟前
AI 前沿日报 · 2026-09-11
人工智能
野生技术架构师31 分钟前
从向量检索到混合搜索优化:Spring AI 2.0.1 + pgvector RAG 实战
java·人工智能·spring
这张生成的图像能检测吗31 分钟前
(论文速读)DISCA:利用与蒸馏兼容的可学习特征缓存加速视频扩散转换器
人工智能·扩散模型·视频生成·特征缓存·步骤蒸馏
零依赖极客36 分钟前
《30 天手搓 ARM 架构零依赖纯 C 推理引擎》课程介绍与大纲
c语言·开发语言·arm开发·人工智能·嵌入式硬件·ai编程
sarasuki40 分钟前
别只会给 LLM 包一层 while 循环:一个 Agent 的 7 个设计取舍
人工智能·架构