为什么 Bert 的三个 Embedding 可以进行相加?

Embedding的本质

Embedding的数学本质,就是以one hot为输入的单层全连接。

也就是说,世界上本没什么Embedding,有的只是one hot。

现在我们将token,position,segment三者都用one hot表示,然后concat起来,然后才去过一个单层全连接,等价的效果就是三个Embedding相加。

在这里用一个简单的例子在尝试理解一下:

假设Token Embedding矩阵的维度为4,768,Position Embedding的矩阵维度为3,768,Segment Embedding矩阵维度为2,768

对于一个word来说,假设它的Token one-hot为1,0,0,0 ; 它的Position one-hot为1,0,0,它的segment one-hot为1,0

那么这个字最后的word Embedding,就是上面三种Embedding相加之和。

如此得到的word Embedding,事实上和concat后的特征:1,0,0,0,1,0,0,1,0,在过维度为4+3+2,768=9,768的全连接层,得到的向量其实是一样的。

我们可以再换一个角度进行理解:

不妨直接将三个one-hot特征concat起来得到的1,0,0,0,1,0,0,1,0,虽然形式上不再是one-hot了,但是可以将其映射到三个one-hot组成的特征空间,此时特征空间的维度为432=24,而在这个新的特征空间中,这个字的one-hot就是1,0,0,0... (23个0)。

此时,Embedding的矩阵维度就是24,768,最后得到的word Embedding依然是和上面等效,但是三个小Embedding矩阵的大小会远远小于新特征空间对应的Embedding矩阵大小。

当然,在相同初始化方法的前提下,两种方式得到的word Embedding可能方差会有差别,但是BERT模型还有Layer Norm,会把Embedding结果统一到相同的分布。

所以BERT的三个Embedding相加,本质上可以看做一个特征融合,强大如BERT应该可以学到融合后特征的语义信息的。

转自知乎,侵权删:
https://www.zhihu.com/question/374835153

相关推荐
FII工业富联科技服务几秒前
从灯塔工厂到AI Factory新模式:AI正在重构制造业的四大核心能力
大数据·运维·人工智能·重构·ar·制造
前端开发江鸟1 分钟前
从一个最小 Runtime Demo 看懂:陌生的 599 为什么不能重试
人工智能
AI小白Lin3 分钟前
33 个 AI 专家全票通过?那问题才刚开始
人工智能·架构
Spey_Events5 分钟前
【核心议题发布】聚焦深度维修与 AI 智慧革新!2026中国民用航空维修智造展——议题重磅发布!
大数据·人工智能
中杯可乐多加冰7 分钟前
我把整个机器人足球仓库交给 Doubao-Seed-Evolving,它帮我优化了一套足球战术
人工智能
量化吞吐机7 分钟前
2026年交易想法转Python,中间先补规则转译
人工智能·python
俊哥V9 分钟前
每日 AI 研究简报 · 2026-07-22
人工智能·ai
XMAIPC_Robot12 分钟前
RK3588四路1080P工业MIPI相机视觉网关,同时支持RK3588+FPGA的24路相机同步方案
人工智能·数码相机
决战灬13 分钟前
langgraph之interrupt(事例篇)
人工智能·python·agent
czzxxxxxx14 分钟前
创客匠人AI智能体:知识付费从“重人力”走向“自动化”的拐点
大数据·人工智能