解决容器内deepspeed微调大模型报错

解决容器内deepspeed微调大模型报错:launch.py:315:sigkill_handler Killing subprocess

问题描述:

在容器中用deepspeed微调百川大模型2时,出现上述错误,错误是由于生成容器时,共享内存没有设置,采用默认值引起的。终端输入ds_report,可以查看shared_memory,(之前是默认63M,现已调整50G)

解决办法

docker stop 容器名

docker rm 容器名

重新生成容器时加上共享内存参数:--shm-size=1g

例:

docker run -it -d --shm-size=50g --name 容器名--net host --gpus all -v 宿主机路径:容器内路径 -e NVIDIA_DRIVER_CAPABILITIES=compute,utility ubuntu:latest /bin/bash

相关推荐
具身新纪元6 分钟前
CVPR 2026|新缺陷不断上线,如何让工业视觉检测模型不忘旧账?
人工智能·深度学习·目标检测·机器学习·计算机视觉·目标跟踪·视觉检测
Raas1007 分钟前
MAIGateway,魔芋企业级AI网关的FinAPI成本弹性设计
人工智能
小狼嚎月10 分钟前
K8s PV / PVC / StorageClass 有状态应用持久化
云原生·容器·kubernetes
constCpp12 分钟前
AI 编程:追不完的工具,理得清的问题
人工智能·ai编程·ai-native
2401_8652616312 分钟前
亦唐科技(YIKTONG):驱动国产贴片机迈向智能化未来
大数据·人工智能
阿kun要赚马内14 分钟前
工具在langchain agent中的调用
人工智能·后端·python
IT_陈寒15 分钟前
Vite的HMR在我项目上突然失效,排查三天找到离谱原因
前端·人工智能·后端
牛马也想出海17 分钟前
使用Playwright被检测为机器人的原因及反检测方案
开发语言·网络·人工智能·机器人·php
一路向北North18 分钟前
Spring AI(11) :ChatPDF-向量数据库、PDF处理、向量写入和向量搜索
数据库·人工智能·spring
Wang's Blog22 分钟前
AI Agent白手起家44: LangChain 文档切分实战 — 长度、文本架构与语义切片
人工智能·langchain