深度学习踩坑记录

深度学习踩坑记录

在跑一个深度学习的项目的时候,为了计算每个epoch的Loss,肯定要把每个batch_size的loss给加起来,就会有类似如下的代码

python 复制代码
train_loss += loss

是的当时手抖,忘了是loss.item(),代码也能正常运行,也能正常算,并且每一步需要跑的时间也是一样的,但是这样会导致每一步的内存都是叠加的。并且这种占显存的方式你在nvidia-smi还看不出来,得去htop里面看,一看好家伙,显存占的高的离谱,正常来说我就占4个G,他占了十几个G,当时就感觉不对劲了,后面发现这叫显存泄露

总而言之言而总之,如果你直接+loss,也能跑,结果也是一样的,但是这就会导致需要的内存一步步的叠加,我是跑到10几个epoch的时候莫名其妙被killed了,去查了一下是out of memory的问题,刚开始还以为是别的因素,后面才发现是我的问题T T

相关推荐
Raas100几秒前
MAI Gateway(魔芋企业级AI网关)功能全解:AI网关支持本地模型吗?一文看懂AI网关能力矩阵
大数据·人工智能·网关·ai网关·mai gateway·企业级产品
蜗牛互联网4 分钟前
AI给面试打分不够,求职者更需要可核对的证据
java·人工智能·后端
不开大的凯20777 分钟前
跑分已死,交付为王
人工智能·ai·麦当秀aippt·ai office
AI多Agent协作实战派13 分钟前
【AI探索历程19】飞牛版:给NAS用户的一键部署
人工智能
爱签AI电子合同27 分钟前
电子合同服务稳定性怎么测?可用性保障维度专项测评
大数据·人工智能·电子合同·电子签名
AI模力圈32 分钟前
Pytorch图模式技术原理解析
pytorch·深度学习·torch.compile
IC一站式服务36 分钟前
AI时代数据中心互联:PCIe重定时器、重驱动器与交换机全解析
人工智能
正经教主42 分钟前
【FDE系列】阶段2:Day 35:Python + SQL — 工单接入 MySQL + 本周收官
人工智能·python·fde
I Am a robert girl44 分钟前
谷歌迈出RSI一大步:从Gemini模型迭代看AI工程化的新风向
人工智能·大模型·gemini·ai工程化·上下文工程·rsi·工具链集成
leoZ2311 小时前
第 16 篇 转型路线图与求职实战
人工智能·大模型·agent