Transformer 从零开始

资料:

从零开始

环境

bash 复制代码
conda create -n torch python=3.12
conda activate torch

# Install PyTorch (CPU version)
pip install torch torchvision
# Install PyTorch with CUDA (version <= nvidia-smi shown)
#  https://pytorch.org/get-started/locally
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130

运行

bash 复制代码
cd start-deep-learning/practice/Transformer
pip install -r requirements.txt
python build_transformer.py

BATCH_SIZE 4, 可以改 32,如果显存够大。我呢,训不太动 😢

进化线

之后是概括,给一些关键词。基此问一下 AI,能得到更好的回答呢。

例如,DeepSeek 归纳了 5 条核心进化线,

如果把大模型比作一辆车:

  • Attention引擎(GQA/MLA 是省油技术);
  • Normalization底盘悬挂(RMSNorm 保证行驶稳定);
  • 激活函数燃油标号(SwiGLU 是高标号汽油);
  • 位置编码导航系统(RoPE 让你知道该去哪);
  • 架构车身设计(Decode-Only 最终统一了赛道)。

这些进化线相互配合,才有了今天又长、又快、又强的 LLM。

架构进化

Encoder-Decoder: 原始,适合 Seq2Seq 任务

Decoder-only (Causal): 当前,经过 Scaling Laws 验证

Attention 进化

KV Cache 优化,

注意力机制 KV Cache 量级 表达能力 核心思想
MHA (多头注意力) 最大 (H) 最强 每个头独立看世界
MQA (多查询注意力) 最小 (1) 较弱 所有人用同一套记忆
GQA (分组查询注意力) 中等 (G) 可控 分组共享,折中之道
MLA (多头潜在注意力) 极小 (≈1) 压缩记忆,解耦计算

计算模式优化,

  • Sliding Window Attention (滑动窗口注意力)
  • FlashAttention: 改进 GPU 的访存算法
  • Sparse Attention (稀疏注意力)

位置编码进化

让模型理解顺序,

  • 绝对位置编码
  • 相对位置编码
  • RoPE (旋转位置编码): 当前主流,更好的长度外推
  • ALiBi

激活函数进化

增强非线性,

  • ReLU
  • GeLU
  • SwiGLU

结语

开篇的资料 ① 适合入门,资料 ② 适合实践,都是超级棒的文章,值得学习 👍

相关推荐
薛定谔的猫3697 小时前
LLM Agents: 从大语言模型到自主智能体的演进与架构解析
ai·llm·agent·machine learning·architecture
冬奇Lab7 小时前
RAG 系列(一):大模型为什么需要「外挂记忆」
人工智能·llm
冬奇Lab7 小时前
一天一个开源项目(第86篇):VibeVoice —— 微软开源的前沿语音 AI,单次处理 90 分钟多说话人音频
人工智能·llm
Flynt12 小时前
微软OpenAI终止独家合作:多云部署背后的技术架构变化
llm
量子位12 小时前
银河通用LDA定义全域数据利用范式,跨本体世界动作大模型开启具身GPT-2时刻
llm
带娃的IT创业者13 小时前
深度解析:从零构建高性能 LLM API 中转网关与成本优化实战
开发语言·gpt·llm·php·高性能·成本优化·api网关
DigitalOcean13 小时前
DigitalOcean 打造 AI 原生云,帮助 AI 应用大幅降低成本与运维复杂度
llm·agent
熊猫钓鱼>_>14 小时前
大型复杂远程AI Agent应用:从架构困局到进化突围
人工智能·ai·架构·开源·大模型·llm·agent
bryant_meng14 小时前
【Hung-yi Lee】《Introduction to Generative Artificial Intelligence》(11)
人工智能·深度学习·llm·speculative·预言家
白熊18816 小时前
【大模型Agent】基于LangGraph搭建 多轮对话客户支持机器人 项目示例
人工智能·大模型·llm·agent·langgraph