大语言模型 bpe算法 后面对接的是 one-hot吗 nn.Embedding

不是。

BPE 结束后,模型拿到的已经是 整数序列(token id) ,下一跳直接就是 nn.Embedding(即可训练的稠密向量),根本不会再走 one-hot。流程如下:

  1. 文本 → BPE 分词 → token₁, token₂, ...
  2. token → 查表(vocab_size × hidden_dim 的矩阵)→ e₁, e₂, ...
  3. 后续 Transformer 层在稠密向量上运算。

one-hot 只在教学推导 里出现(维度 = vocab_size,1 个 1 其余 0),用来写公式

  output = one_hot @ Embedding_matrix

实际代码里直接用 embedding(idx) 查表,效率更高、内存更省。

相关推荐
阡之尘埃11 小时前
Python数据分析案例85——大模型微调全流程(SFT的LoRA微调)
人工智能·python·深度学习·语言模型·llm·微调·千问
裕晟资质规划11 小时前
武器装备科研生产单位保密资质申请方法论:条件模型与流程拆解
人工智能·算法
LadiesAndGentlemen12 小时前
开源地理空间智能项目中的本体思想 4-4:收尾篇——五种做法怎么选,治理之后还剩什么活
人工智能·语言模型·开源·aigc·知识图谱
en.en..13 小时前
C语言 标准输入 / 输出缓冲区
算法
咖啡星人k14 小时前
2026 MCP 模型上下文协议:让 AI 自己动手接工具,告别手写接口(MonkeyCode 实战)
人工智能·深度学习·机器学习·语言模型·自然语言处理
吃好睡好便好14 小时前
查找函数的使用
学习·算法·matlab·生活·查找函数
学习星球14 小时前
单调栈——从“找下一个更大的“到柱状图中的最大矩形
数据库·c++·算法·leetcode·xcode
靠沿16 小时前
贪心算法专题(二)
算法·贪心算法
猎头南楼16 小时前
具身智能模型部署方向的能力要求与技术栈梳理
人工智能·深度学习·算法
慢云智慧空间16 小时前
从单点智能到系统协同,空间大模型如何重塑园区运营逻辑?
语言模型