Pytorch报错RuntimeError: CUDA error: device-side assert triggered

参考:

  • https://blog.csdn.net/BetrayFree/article/details/134267306

完整报错如下:

shell 复制代码
Traceback (most recent call last):
  File "/home/yingmuzhi/SpecML2/test.py", line 150, in <module>
    trainer.fit(model, data)
  File "/home/yingmuzhi/SpecML2/core.py", line 486, in fit
    self.fit_epoch()
  File "/home/yingmuzhi/SpecML2/core.py", line 496, in fit_epoch
    loss = self.model.training_step(self.prepare_batch(batch))
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/yingmuzhi/SpecML2/core.py", line 394, in training_step
    self.plot('loss', l, train=True)
  File "/home/yingmuzhi/SpecML2/core.py", line 384, in plot
    self.board.draw(x, value.to(cpu()).detach().numpy(),
                       ^^^^^^^^^^^^^^^
RuntimeError: CUDA error: device-side assert triggered
CUDA kernel errors might be asynchronously reported at some other API call, so the stacktrace below might be incorrect.
For debugging consider passing CUDA_LAUNCH_BLOCKING=1.
Compile with `TORCH_USE_CUDA_DSA` to enable device-side assertions.

有很多愿意会导致这个CUDA triggered的Error,我的问题是在于网络前半部分都是卷积层,在最后一层使用了全连接层,而在最后一层我的输出并没有和类别相匹配。例如,原先多分类我用的是十个类别,更改成二十二种类别后忘记改输出的类别了,将类别和输出channel相匹配便解决了。

相关推荐
赫文派13 分钟前
K3 与 Kimi Code 实战:模型到终端 Agent
人工智能·ai编程
larance14 分钟前
机器学习特征预处理之标准化/归一化
开发语言·python·机器学习
z123456777916 分钟前
2026年企业AI办公工具深度评测:钉钉悟空平替横向选型指南
人工智能·钉钉
tokenova17 分钟前
Python 多模型统一调用封装类,一套代码兼容 GPT/Claude/Grok
python
网易云信21 分钟前
网易智企入选《2026人工智能发展白皮书》,帝王蟹引领“智能增效”场景
人工智能·agent
老兵发新帖22 分钟前
Transformer最新小样本学习能力分析
人工智能
阿虎儿26 分钟前
Dify Failed to invoke tool: Aborted: Maximum execution steps exceeded: 501 > 500
人工智能
后端小肥肠30 分钟前
用它做的第一条视频自然流就是投流的 3 倍,我做了个抖音全栈运营 Skill
人工智能·aigc·agent
雪隐33 分钟前
个人电脑玩AI-10让5060 Ti给你打工——我让 Claude Code 喝上了本地杂粮:Ternary-Bonsai-27B 部署历险记
前端·人工智能·后端
新知图书39 分钟前
6.3 详细实现与核心配置(双语绘本速记单词智能体开发)
人工智能·agent·ai agent·智能体·扣子