机器学习与模式识别 第十七章 Transformers & LLMs 考点压缩

第十七章:Transformers & LLMs --- 知识点笔记

综合来源:Lecture 17 PDF(35页)、课堂笔记(CSDN)


占位图

17.1 LLM概述

什么是LLM

  • Large:参数量巨大(数十亿→万亿级)
  • Language Model:预测语言(下一词)
  • 预测下一个词 = 回答问题 + 讲故事 + 完成任务 = 生成式AI

17.2 Tokenization ⭐

Token vs Word

  • Token = 词、词缀、标点、特殊字符
  • "The smallest tokenizer!" → "The", " small", "est", " token", "izer", "!"
  • 优势:允许处理新词/拼写错误/数字

BPE(Byte Pair Encoding)⭐

  1. 初始token集=所有字符+数字+特殊字符
  2. 统计语料中最高频的token对→合并为新token
  3. 重复→直到达到目标词汇量
  4. 例:Llama-2: 32K → Llama-3: 128K tokens

17.3 因果语言建模 ⭐⭐

Causal Language Modeling

P(next token∣context tokens)P(\text{next token} | \text{context tokens})P(next token∣context tokens)

  • 条件于之前的所有token(有序上下文)
  • 一次生成一个token
  • "The best class at SDU is ___" → 模型输出下一个token的概率分布→采样/选最大

自回归解码(Auto-Regressive Decoding)

  1. 计算下一token的概率分布
  2. 选择下一token(最大概率/采样top-k)
  3. 将选中token追加到上下文
  4. 重复→直到<stop> token

一次一个token→逐步生成完整文本!


17.4 Decoder Transformer ⭐⭐

Encoder的问题

  • 标准Self-Attention→所有token互相可见→生成时"偷看"答案
  • 不适合因果(自回归)生成

Masked Attention(因果掩码)

  • 只允许关注当前及之前的token(不能看到未来)
  • 上三角掩码→−∞-\infty−∞→Softmax后权重为0
    α=SoftMax(QKTDk+M)\boldsymbol{\alpha} = \text{SoftMax}\left(\frac{\mathbf{Q}\mathbf{K}^T}{\sqrt{D_k}} + \mathbf{M}\right)α=SoftMax(Dk QKT+M)

Mij={0i≥j−∞i<j\mathbf{M}_{ij} = \begin{cases} 0 & i \geq j \\ -\infty & i < j \end{cases}Mij={0−∞i≥ji<j

Decoder展开

  • 每次新token加入→整个序列重新计算
  • 但可缓存之前的K,V→KV Cache加速
  • 最后一个token计算量最大(需attend所有历史)

17.5 Llama-3架构 ⭐

复制代码
RMSNorm → Grouped Query Attention (+RoPE) → +残差 → 
RMSNorm → FFN with SwiGLU → +残差
组件 说明
RMSNorm LayerNorm的简化版→训练稳定
GQA Grouped Query Attention→效率+表达力
RoPE Rotary Position Embedding→融入Q,K的旋转位置编码
SwiGLU 门控FFN激活函数
残差连接 梯度直通

规模(Llama-3 70B)

  • Hidden size: 8192 | 层数: 80 | Query heads: 64 | KV heads: 8

17.6 Encoder-Decoder vs Decoder-Only

架构 结构 代表模型
Encoder-Only 双向Attention BERT
Encoder-Decoder 编码+解码+Cross-Attention 原版Transformer, T5, BART
Decoder-Only 仅Masked Attention GPT系列, Llama (现代主流)

LLM演进时间线

复制代码
2018: Word2Vec, GloVe, GPT-1, BERT
2019: GPT-2, RoBERTa, XLNet
2020: GPT-3, T5, DeBERTa
2021-22: GPT-J, OPT, BLOOM
2023-: Llama-2, Llama-3, GPT-4 (Decoder-Only主导)

笔记中的图片索引

序号 图片内容描述 来源位置
图1 BPE构建过程 Lecture 17 第7页
图2 自回归解码逐步生成 Lecture 17 第13-18页
图3 Masked Attention因果掩码 Lecture 17 第24-25页
图4 Llama-3架构图 Lecture 17 第31页
图5 Encoder-Decoder结构 Lecture 17 第33页
图6 LLM演进时间线 Lecture 17 第34页

笔记整理时间:2026年6月30日

相关推荐
知识分享小能手2 小时前
高等数学学习教程,从入门到精通,定积分 — 知识点全面总结(10)
学习·机器学习·概率论
只是甲7 小时前
Text2SQL 系列博客 02:技术原理深度剖析 - 从自然语言到 SQL 的完整链路
人工智能·text2sql·nl2sql·ai agent·自助数据分析·data agent·agentic 数据洞察
懷淰メ7 小时前
【AI赋能】基于PyQt+YOLO+DeepSeek水上漂浮物检测系统(详细介绍)
人工智能·yolo·目标检测·计算机视觉·pyqt·漂浮物·水上漂浮物
EQUINOX17 小时前
【论文精读】| CLIP精读
大数据·人工智能
PC2005-cloud7 小时前
博文已索引但不展示:一次 Bing SEO 问题排查记录
服务器·人工智能
weixin_408099677 小时前
2026 图片去文字 API 实战:AI一键去除图片文字(附 Python / Java / PHP / JS 完整代码)
人工智能·api接口·图片去水印·石榴智能·ai图像修复·图片去文字
greenbbLV8 小时前
2026节日慰问品政策解读:合规标准升级与福利行业新趋势
人工智能·节日
奈斯先生Vector8 小时前
告别工具碎片化:基于 Nano Banana 全模态 AI 聚合架构搭建“文本-图像-视频”自动化协同生产线
运维·数据库·人工智能·架构·自动化·aigc·音视频
领麦微红外8 小时前
国产MEMS红外测温传感器:传感器+算法+产品级出厂标定一站式交付模式深度解读
人工智能·硬件工程·产品经理
mingo_敏9 小时前
DeepAgents : 检索(Retrieval)
人工智能·深度学习·langchain