RuntimeError: CUDA error: device-side assert triggered

报错源码情况

复制代码
Traceback (most recent call last):
  File "/home/pyUser/proDB/project-ml/nlp/python/wmt/run_tf_1.py", line 701, in <module>
    train_seq2seq( lr, 1, device)
  File "/home/pyUser/proDB/project-ml/nlp/python/wmt/run_tf_1.py", line 676, in train_seq2seq
    Y_hat, _ = tf_net(X, dec_input, X_valid_len)
               ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/anaconda3/envs/pytorch/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1751, in _wrapped_call_impl
    return self._call_impl(*args, **kwargs)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/anaconda3/envs/pytorch/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1762, in _call_impl
    return forward_call(*args, **kwargs)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/proDB/project-ml/nlp/python/wmt/run_tf_1.py", line 517, in forward
    enc_outputs = self.encoder(enc_X, *args)
                  ^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/anaconda3/envs/pytorch/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1751, in _wrapped_call_impl
    return self._call_impl(*args, **kwargs)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/anaconda3/envs/pytorch/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1762, in _call_impl
    return forward_call(*args, **kwargs)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/proDB/project-ml/nlp/python/wmt/run_tf_1.py", line 366, in forward
    to_pos = emb_data *  math.sqrt(self.num_hiddens)
             ~~~~~~~~~^~~~~~~~~~~~~~~~~~~~~~~~~~~~~~
RuntimeError: CUDA error: device-side assert triggered
CUDA kernel errors might be asynchronously reported at some other API call, so the stacktrace below might be incorrect.
For debugging consider passing CUDA_LAUNCH_BLOCKING=1
Compile with `TORCH_USE_CUDA_DSA` to enable device-side assertions.

第一步:启用同步模式,方便调试

复制代码
import os
# CUDA_LAUNCH_BLOCKING=1:启用同步模式,主机等待内核完成。这有助于调试和性能分析,但会降低整体效率。‌

# CUDA_LAUNCH_BLOCKING=0(默认):保持异步模式,允许主机与GPU并行执行,提升性能。‌

os.environ['CUDA_LAUNCH_BLOCKING'] = '1'

增加后,报错信息如下:

复制代码
Traceback (most recent call last):
  File "/home/pyUser/proDB/project-ml/nlp/python/wmt/run_tf_1.py", line 707, in <module>
    train_seq2seq( lr, 1, device)
  File "/home/pyUser/proDB/project-ml/nlp/python/wmt/run_tf_1.py", line 682, in train_seq2seq
    Y_hat, _ = tf_net(X, dec_input, X_valid_len)
               ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/anaconda3/envs/pytorch/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1751, in _wrapped_call_impl
    return self._call_impl(*args, **kwargs)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/anaconda3/envs/pytorch/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1762, in _call_impl
    return forward_call(*args, **kwargs)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/proDB/project-ml/nlp/python/wmt/run_tf_1.py", line 523, in forward
    enc_outputs = self.encoder(enc_X, *args)
                  ^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/anaconda3/envs/pytorch/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1751, in _wrapped_call_impl
    return self._call_impl(*args, **kwargs)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/anaconda3/envs/pytorch/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1762, in _call_impl
    return forward_call(*args, **kwargs)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/proDB/project-ml/nlp/python/wmt/run_tf_1.py", line 370, in forward
    emb_data = self.embedding(X)
               ^^^^^^^^^^^^^^^^^
  File "/home/pyUser/anaconda3/envs/pytorch/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1751, in _wrapped_call_impl
    return self._call_impl(*args, **kwargs)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/anaconda3/envs/pytorch/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1762, in _call_impl
    return forward_call(*args, **kwargs)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "/home/pyUser/anaconda3/envs/pytorch/lib/python3.12/site-packages/torch/nn/modules/sparse.py", line 190, in forward
    return F.embedding(
           ^^^^^^^^^^^^
  File "/home/pyUser/anaconda3/envs/pytorch/lib/python3.12/site-packages/torch/nn/functional.py", line 2551, in embedding
    return torch.embedding(weight, input, padding_idx, scale_grad_by_freq, sparse)
           ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
RuntimeError: CUDA error: device-side assert triggered
Compile with `TORCH_USE_CUDA_DSA` to enable device-side assertions. 

错误明确指出是在 torch.nn.functional.embedding 调用时出错。:

结论:X 中包含非法 token ID(超出词表范围或为负数)

因为使用了SentencePiece,所以先验证控制符

复制代码
sp_model_path = './format_data/'
sp = spm.SentencePieceProcessor()
sp.load(sp_model_path + "spm_bpe.model")

print("Vocab size:", sp.vocab_size())
print("PAD ID:", sp.pad_id())
print("BOS ID:", sp.bos_id())
print("EOS ID:", sp.eos_id())
print("UNK ID:", sp.unk_id())

# 验证这些 ID 是否在合法范围内 [0, vocab_size)
assert 0 <= sp.pad_id() < sp.vocab_size()
assert 0 <= sp.bos_id() < sp.vocab_size()
assert 0 <= sp.eos_id() < sp.vocab_size()
assert 0 <= sp.unk_id() < sp.vocab_size()

然后发现pad_id 为-1

发现原训练语句有误:

复制代码
spm_train \
  --input=all_data_no_split.txt \
  --model_prefix=spm_bpe \
  --vocab_size=32000 \
  --model_type=bpe \
  --user_defined_symbols="<pad>,<bos>,<eos>" \ 
  --unk_id=0 \
  --bos_id=1 \
  --eos_id=2 \
  --pad_id=3 \
  --num_threads=16

问题出在: --user_defined_symbols="<pad>,<bos>,<eos>" \

删除后重新训练词表,然后在运行就没有问题了

相关推荐
LaughingZhu1 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
风合星语1 天前
2026 具身智能技术实战(一):VLA 到底怎么控制机器人?——用 LeRobot 跑通 SmolVLA 推理
pytorch·机器人·具身智能·vla·lerobot·smolvla
猎头南楼1 天前
知识社区推荐系统实践:新用户冷启动与长短期兴趣建模的挑战 资深推荐算法工程师
人工智能·深度学习·算法·机器学习
高洁011 天前
未来三年,AI 落地的五个确定性判断一
人工智能·深度学习·机器学习·transformer·知识图谱
Tancenter1 天前
sequeeze()和unsequeeze()
pytorch·tensorr
`流年づ1 天前
人工智能学习笔记 - 补充
人工智能·笔记·深度学习·学习
Thomas.Sir1 天前
第21课:PyTorch|GPU多卡训练与分布式训练基础【让多卡并行成为你的加速引擎】
人工智能·pytorch·分布式
成为深度学习高手1 天前
CrossLinear:即插即用的跨相关嵌入,让线性模型也能用好外生变量
人工智能·python·深度学习·数据挖掘
科技苑1 天前
如何打造一个高效的全栖内容制作生态系统?
深度学习
CODER03041 天前
ubuntu22.04部署完整deepseek局域网web服务全过程(RTX5090安装黑屏+web端多人并发)
pytorch·webui·ubuntu22.04·ollama·deepseek·rtx5090·自然语言模型