Transformer架构面试题目答:Transformer 相比 RNN/CNN 的核心优势是 self-attention。RNN 需要按时间递归传递信息,长距离依赖路径长且难以并行; CNN 依赖局部卷积,建立全局 attention 关系需要堆叠很多层。 而 Transformer 中任意两个 token 可以通过 attention 直接交互,因此更擅长长距离依赖,并且训练时可以并行计算整段序列。更重要的是,Transformer 提供了统一的 token 接口,文本、图像 patch、机器人 state 等多样化信息都可以放在