认识Transformer:入门知识

视频链接:

https://www.youtube.com/watch?v=ugWDIIOHtPA\&list=PLJV_el3uVTsOK_ZK5L0Iv_EQoL1JefRL4\&index=60

文章目录

      • [Self-Attention layer](#Self-Attention layer)
      • [Multi-head self-attention](#Multi-head self-attention)
      • [Positional encoding](#Positional encoding)
      • [Seq2Seq with Attention](#Seq2Seq with Attention)
      • Transformer
      • [Universal Transformer](#Universal Transformer)

Seq2Seq

RNN不容易被平行化

提出用CNN来代替RNN,CNN 可以平行化,但是需要的层数比较深,才能看完所有的输入内容。

Self-Attention layer

b1 到b4 是可以同时被算出。

可以用来取代RNN。

来源: Attention is all you need

然后用每一个a 去对每个k 做attention



加速的矩阵乘法过程

Multi-head self-attention

不同的head 可以关注不同的内容,达到一个更好的注意力效果。

Positional encoding

self-attention 没有考虑位置信息。

因此需要再ai的同时加ei,表示位置信息,有人工控制。

Seq2Seq with Attention

Transformer

Universal Transformer

相关推荐
for_ever_love__11 分钟前
PyTorch 张量与 autograd——自动求导怎么工作
pytorch·python·深度学习·自动求导
一切皆是因缘际会17 分钟前
掌控信息论:同源星际通信基础理论
人工智能·算法·ai
库拉大叔18 分钟前
知漫剧、豆包、可灵,角色一致性谁更强
人工智能·aigc
飞哥数智坊44 分钟前
AI 帮我把 Mac 下的 3D 鱼缸搬到了 Windows
人工智能·ai编程
飞猫的边缘AI1 小时前
边缘AI为什么加速上车了?
人工智能·自动驾驶·辅助驾驶·vla·noa·边缘ai·ai场景
goujunwe1 小时前
GEO 内容写作标准:4 套可直接复制、更容易被 AI 采信的结构化模板
人工智能
看浪的路人1 小时前
第4讲:数据投毒与模型完整性保护
人工智能
通信瓦工1 小时前
高功率密度AI数据中心的Mega AALC(高级辅助液体冷却)解决方案
大数据·人工智能
u1301301 小时前
GitHub 热榜项目:日榜(2026-10-06)
人工智能·github
DongQiShanRen1 小时前
裁决台账双向互校(中):五向一致性链——②向解读与③向实现
人工智能·深度学习·自然语言处理·集成学习·vllm