技术栈
多层堆叠
a18792721831
2 小时前
深度学习
·
ai
·
transformer
·
token
·
注意力机制
·
deepseek
·
多层堆叠
从一条直线到大模型输出一个token(九):输出矩阵与多层堆叠
建议先看:从一条直线到大模型输出一个token(八):残差连接与前馈网络上一篇走完了单个 Block 的六步。这一篇把 Block 复制 32 份串起来——不同层的 Block 各学什么,2024-2025 各家大模型到底堆了多少层,然后用 6 个 token 实地观察"浅→中→深"到底改了什么——这是理解"下一个 token 如何诞生"的关键一环。
我是有底线的