深度学习踩坑记录

深度学习踩坑记录

在跑一个深度学习的项目的时候,为了计算每个epoch的Loss,肯定要把每个batch_size的loss给加起来,就会有类似如下的代码

python 复制代码
train_loss += loss

是的当时手抖,忘了是loss.item(),代码也能正常运行,也能正常算,并且每一步需要跑的时间也是一样的,但是这样会导致每一步的内存都是叠加的。并且这种占显存的方式你在nvidia-smi还看不出来,得去htop里面看,一看好家伙,显存占的高的离谱,正常来说我就占4个G,他占了十几个G,当时就感觉不对劲了,后面发现这叫显存泄露

总而言之言而总之,如果你直接+loss,也能跑,结果也是一样的,但是这就会导致需要的内存一步步的叠加,我是跑到10几个epoch的时候莫名其妙被killed了,去查了一下是out of memory的问题,刚开始还以为是别的因素,后面才发现是我的问题T T

相关推荐
~央千澈~1 分钟前
优雅草科技卓伊凡PC电脑清理器-优雅草清理器2026年9月14日发布
人工智能
Keep_Trying_Go1 分钟前
Kaggle CLI Datasets上传文件教程(保姆级)
人工智能·计算机视觉·kaggle
桃西西呀8 分钟前
提前一天预报雾霾:手搓神经网络,讲清学习率、初始化、正则化
人工智能·深度学习·llm
这张生成的图像能检测吗18 分钟前
(论文速读)FiDeSR:高保真保细节一步扩散超分辨率
图像处理·人工智能·深度学习·计算机视觉·扩散模型·图像超分
网易易盾19 分钟前
应用加固如何应对AI辅助逆向?从单点防护到持续对抗
人工智能·安全
维核科技20 分钟前
自动驾驶商业化提速:Robotaxi 开始收费,无人重卡走向量产
人工智能
武子康25 分钟前
同一套小智源码,换块 ESP32 开发板为何还要重新适配?
人工智能·llm·agent
炎黄盈动_200328 分钟前
汽车零部件企业AI智能费控方案:私有化部署、数据安全与业财一体化实践
人工智能·低代码·ai
jsl_jsl_jsl29 分钟前
《从单 Agent 到多 Agent:一次不推倒重来的架构演进》
人工智能
科技研学社35 分钟前
一次性内裤制造的工艺痛点与自动化工艺改良方案
人工智能·自动化