技术栈

深度学习token

田园诗人之园
3 小时前
embedding·位置编码·深度学习token
一文搞懂 Token化、Embedding 与位置编码导读:文本进入 Transformer 前要经过三步核心处理——Token化 → Embedding → 位置编码(PE)。本文给出每一步的完整公式、原理推导与 PyTorch 实现,并用 7 组真实实验(RTX 5070 Ti 实测)验证所有结论:Embedding 查表与 one-hot 矩阵乘误差为 0、正弦 PE 的旋转性质误差 ~1e-6、RoPE 内积只依赖相对位置(偏差 4.77e-07)、无 PE 时模型对词序完全无感(变化 1.19e-07)……分词部分使用 Qwen3 官方分词器(词表
我是有底线的