深度学习踩坑记录

深度学习踩坑记录

在跑一个深度学习的项目的时候,为了计算每个epoch的Loss,肯定要把每个batch_size的loss给加起来,就会有类似如下的代码

python 复制代码
train_loss += loss

是的当时手抖,忘了是loss.item(),代码也能正常运行,也能正常算,并且每一步需要跑的时间也是一样的,但是这样会导致每一步的内存都是叠加的。并且这种占显存的方式你在nvidia-smi还看不出来,得去htop里面看,一看好家伙,显存占的高的离谱,正常来说我就占4个G,他占了十几个G,当时就感觉不对劲了,后面发现这叫显存泄露

总而言之言而总之,如果你直接+loss,也能跑,结果也是一样的,但是这就会导致需要的内存一步步的叠加,我是跑到10几个epoch的时候莫名其妙被killed了,去查了一下是out of memory的问题,刚开始还以为是别的因素,后面才发现是我的问题T T

相关推荐
张彦峰ZYF4 分钟前
从“能调查”到“可持续调查”:长时网络安全智能体的工程化方法论
人工智能·claude code·agent sdk·长时网络安全智能体生产落地·证据收集+关联研判+调查报告·上下文与记忆管理·自动化评估
xiaohaiAIgeo5 分钟前
【2026年】通风柜面风速控制的时滞与补偿策略
人工智能·科普知识
小淮AI12 分钟前
AI远程操控电脑,距离日常办公还有多远?
人工智能·电脑
头发够用的程序员13 分钟前
别被 TOPS 参数迷惑:手把手推导边缘 GPU 整型算力
人工智能·python·ubuntu·计算机视觉·硬件架构·边缘计算
lucky_syq16 分钟前
小模型推理能力天花板:是Transformer架构锁死,还是参数规模不够?换架构能否实现推理飞跃?
深度学习·架构·transformer
思考着亮21 分钟前
5.成本、缓存与可观测性
人工智能
大闸蟹u27 分钟前
图解 AI Agent:Agent = 模型 + Harness
人工智能
dunge202628 分钟前
ChatGPT Plus / Pro 与 Codex 深度实战:2026年9月5日 从模型能力对比到代码生成工作流全解析
人工智能·chatgpt
阿拉斯攀登29 分钟前
SpringCloudAlibaba微服务消息调用:跨服务业务异步解耦
人工智能
joinwell5230 分钟前
只发 GET,为什么还是写进去了?从公共 Wiki 到 Agent 工具门禁的效果边界
人工智能·http