深度学习踩坑记录

深度学习踩坑记录

在跑一个深度学习的项目的时候,为了计算每个epoch的Loss,肯定要把每个batch_size的loss给加起来,就会有类似如下的代码

python 复制代码
train_loss += loss

是的当时手抖,忘了是loss.item(),代码也能正常运行,也能正常算,并且每一步需要跑的时间也是一样的,但是这样会导致每一步的内存都是叠加的。并且这种占显存的方式你在nvidia-smi还看不出来,得去htop里面看,一看好家伙,显存占的高的离谱,正常来说我就占4个G,他占了十几个G,当时就感觉不对劲了,后面发现这叫显存泄露

总而言之言而总之,如果你直接+loss,也能跑,结果也是一样的,但是这就会导致需要的内存一步步的叠加,我是跑到10几个epoch的时候莫名其妙被killed了,去查了一下是out of memory的问题,刚开始还以为是别的因素,后面才发现是我的问题T T

相关推荐
55873 生态系统4 分钟前
价值005+55873 价值定义篇:文化资产实体价值体系重构
人工智能·55873全域文明生态体系·55873操作系统·全域文明生态系统·55873技术底层
Jlzn88886 分钟前
深圳CCS产线AOI漏焊检出怎么拆解检测逻辑?
人工智能
找了一圈尾巴8 分钟前
Agent 运行时架构发展
人工智能·架构
iThinkAi智能体8 分钟前
一句话直出高级宣传片!Codex+HyperFrames 视频生成全流程实操
人工智能·经验分享·gpt·prompt·codex
智塑未来11 分钟前
通过GMP认证的制药MES系统推荐:审计追踪与电子签名能力对比
大数据·人工智能
9i编程31 分钟前
17. 把 DDD 开源脚手架化为自己的:第四次联调(三)——一坨 MalformedInputException,最后查出来是 yml 里的中文注释
人工智能·openai·ai编程
回眸&啤酒鸭33 分钟前
【回眸】私人定制旅游路线助手
人工智能
用户3600555790033 分钟前
Day 1·3 确定性测试门:推理引擎的PASS/FAIL自检机制
人工智能
知几蜗牛39 分钟前
HydraFusion的Single、Cascade与Critique如何落到工程门禁
人工智能
mit6.82440 分钟前
plz直接提交 pull equest
人工智能