深度学习踩坑记录

深度学习踩坑记录

在跑一个深度学习的项目的时候,为了计算每个epoch的Loss,肯定要把每个batch_size的loss给加起来,就会有类似如下的代码

python 复制代码
train_loss += loss

是的当时手抖,忘了是loss.item(),代码也能正常运行,也能正常算,并且每一步需要跑的时间也是一样的,但是这样会导致每一步的内存都是叠加的。并且这种占显存的方式你在nvidia-smi还看不出来,得去htop里面看,一看好家伙,显存占的高的离谱,正常来说我就占4个G,他占了十几个G,当时就感觉不对劲了,后面发现这叫显存泄露

总而言之言而总之,如果你直接+loss,也能跑,结果也是一样的,但是这就会导致需要的内存一步步的叠加,我是跑到10几个epoch的时候莫名其妙被killed了,去查了一下是out of memory的问题,刚开始还以为是别的因素,后面才发现是我的问题T T

相关推荐
搞科研的小刘选手7 分钟前
【IOS 出版 | EI、Scopus检索 | 成都举办】第六届大数据、人工智能与风险管理国际学术会议(ICBAR 2026)
大数据·人工智能·学术会议·成都·会议推荐
胡家伟++8 分钟前
当 AI 自主思维链撞上果蝇全脑仿真(一)
人工智能
用户58333398166813 分钟前
电商RPA避坑实战:抖音、拼多多、天猫商品上架的风控、重试与限流设计
人工智能
Discipline102915 分钟前
尼泊尔河流流量:天气驱动的预测与高流量风险
人工智能·算法
搞科研的小刘选手18 分钟前
【中国-西安 | IEEE出版】第七届大数据、人工智能与物联网工程国际会议(ICBAIE 2026)
大数据·人工智能·学术会议·物联网工程·会议推荐
9i编程20 分钟前
15. 把 DDD 开源脚手架化为自己的:第四次联调(一)——刚加载瘦身的 CLAUDE.md,问题就排着队来
人工智能·openai·ai编程
编程老船长21 分钟前
别急着买大模型——老板能看懂的落地路线图
人工智能
故七月32 分钟前
存量城市更新视角:国资改造 OPC 社区的落地逻辑与治理实践 —— 以成都锦邻创享 OPC 社区为例
大数据·人工智能·锦邻创享opc社区·opc社区·成都opc社区推荐
飞猫的边缘AI32 分钟前
边缘AI应用:家庭AI智能体的三种生意模式
人工智能·边缘ai·ai场景
千里码aicood33 分钟前
基于DenseNet的皮肤病变分类算法设计与实现
人工智能·分类·数据挖掘