大语言模型 bpe算法 后面对接的是 one-hot吗 nn.Embedding

不是。

BPE 结束后,模型拿到的已经是 整数序列(token id) ,下一跳直接就是 nn.Embedding(即可训练的稠密向量),根本不会再走 one-hot。流程如下:

  1. 文本 → BPE 分词 → token₁, token₂, ...
  2. token → 查表(vocab_size × hidden_dim 的矩阵)→ e₁, e₂, ...
  3. 后续 Transformer 层在稠密向量上运算。

one-hot 只在教学推导 里出现(维度 = vocab_size,1 个 1 其余 0),用来写公式

  output = one_hot @ Embedding_matrix

实际代码里直接用 embedding(idx) 查表,效率更高、内存更省。

相关推荐
Laurie三省14 分钟前
现场版却配上录音室版的歌词?聊聊我给开源 Mac 歌词软件写的多源打分算法
算法·macos·go
对空六课24 分钟前
Vue 组件曝光埋点为什么会重复触发?去重方案与实现思路
服务器·前端·算法·数据分析
丈剑走天涯28 分钟前
rag ollama + qwen3+ embedding + chroma_db 回答content为空
embedding
HZY1618yzh31 分钟前
下一代编程语言出炉
c++·算法
CoderYanger38 分钟前
A.每日一题:856. 括号的分数
java·程序人生·算法·leetcode·面试·职场和发展·学习方法
kiracrimson1 小时前
选择排序与快速排序:一次选极值,一次分区间
算法·排序算法
All for pursuit.1 小时前
【动态规划-8】152.乘积最大子数组
数据结构·c++·算法·leetcode·动态规划
信奥卷王1 小时前
[GESP202512 六级] 路径覆盖
数据结构·算法
Lazionr2 小时前
手撕 unordered_set 和 unordered_map,剖析哈希表底层实现
c++·算法
0+1112 小时前
算法 --归并排序
数据结构·算法·排序算法