pytorch训练的时候 shm共享内存不足,导致训练停止

1.查看shm情况

bash 复制代码
df -h /dev/shm

内存已经满了,因为之前训练多次训练意外停止到shm中的缓存不能及时被清理

2、手动清理shm

依然没被释放

3、查看关联的进程,一个一个kill

bash 复制代码
lsof |grep deleted

kill -9 46619 44618 44617 。。。。。

4、搞定

相关推荐
Qyr9918 分钟前
吞咽困难介护食:老龄化社会中的营养安全守护者
人工智能
火山引擎开发者社区19 分钟前
文件上传即可检索|实时多模态向量链路落地实践分享
人工智能
YYJ-F25 分钟前
Anthropic——AI安全人工智能研究公司,核心产品Claude Code辅助编程
人工智能·安全
具身智能进化论30 分钟前
协作机器人产业进入规模化部署期,未来几年的增长从何而来
大数据·运维·人工智能·机器人·自动化·工厂方法模式
hzcj88834 分钟前
汇正财经:储能装机回暖,估值有待提升
大数据·人工智能
妄想出头的工业炼药师1 小时前
GLAM-SLAM
人工智能
Livia要学习1 小时前
Python装饰器
开发语言·python
一直都在5721 小时前
LangChain4j精讲
开发语言·人工智能
八号当铺1 小时前
使用 Figma Agent Kit:插件 + MCP + 还原 Skill,打通本地设计协作
前端·人工智能·ai编程
今天AI了吗1 小时前
时序大模型 TimechoAI 实战:从数据接入到智能时序分析全链路指南
人工智能