摘要
本文解读 TMLR 2024 论文《Efficient Large Language Models: A Survey》。该综述提出模型、数据、框架三重视角的统一分类法 ,系统梳理模型压缩 、高效预训练/微调/推理 与高效架构 ,覆盖 379 篇文献 ,其特别之处在于配套持续维护的 GitHub 仓库作为社区基础设施。综述表明量化到 4-bit 近乎无损、剪枝达 60% 稀疏、MoE 以 1T 参数解耦规模与算力,为高效大语言模型研究提供了系统化地图。
视频讲解 :点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 模型压缩:量化是主力
- [高效微调:PEFT 与 MEFT 互补](#高效微调:PEFT 与 MEFT 互补)
- [高效推理:算法级 + 系统级](#高效推理:算法级 + 系统级)
- [高效架构:注意力、MoE 与长上下文](#高效架构:注意力、MoE 与长上下文)
- 数据为中心:数据选择与提示工程
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- [什么是高效 LLM 研究?](#什么是高效 LLM 研究?)
- [为什么 4-bit 是量化甜点?](#为什么 4-bit 是量化甜点?)
- [PEFT 和 MEFT 有什么区别?](#PEFT 和 MEFT 有什么区别?)
- [MoE 为什么能兼顾规模与效率?](#MoE 为什么能兼顾规模与效率?)
- [vLLM 的 PagedAttention 解决了什么问题?](#vLLM 的 PagedAttention 解决了什么问题?)
- [这篇综述与其它 LLM 综述有何不同?](#这篇综述与其它 LLM 综述有何不同?)
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Efficient Large Language Models: A Survey |
| 标题(中文) | 高效大语言模型综述:模型、数据与框架三重视角 |
| 作者 | Zhongwei Wan, Xin Wang, Che Liu, Samiul Alam, Yu Zheng, Jiachen Liu, Zhongnan Qu, Shen Yan, Yi Zhu, Quanlu Zhang, Mosharaf Chowdhury, Mi Zhang |
| 机构 | The Ohio State University · Imperial College London · University of Michigan · Amazon AWS AI · Google Research · Microsoft Research Asia |
| 会议 | TMLR 2024 |
| arXiv | 2312.03863 |
| 项目网站 | AIoT-MLSys-Lab/Efficient-LLMs-Survey |
背景与动机
大语言模型(LLM)的能力与参数量、数据规模强相关:GPT-3 拥有 1750 亿参数 ,预训练消耗约 335 GPU-years 的算力;PaLM 更是达到 5400 亿参数 。训练 GPU 时数随模型规模指数级增长,而推理吞吐反而随规模下降------部署成本成为大模型普惠化的最大障碍。
此前综述各有局限:泛化 LLM 综述(Zhao et al. 2023、chang et al. 2023)覆盖模型、任务与对齐,效率只零星提及;高效 Transformer 综述(Tay et al. 2020)未面向十亿参数级模型;专项压缩综述(Zhu et al. 2023)只覆盖单一方向。本文首次以模型 / 数据 / 框架三视角系统化组织效率文献,聚焦十亿参数以上模型的独特挑战(涌现能力、显存瓶颈),并配套持续维护的 GitHub 仓库。
一个关键反例说明了效率设计的可行性:Mistral-7B 采用分组查询注意力(GQA)与滑动窗口注意力,性能接近 LLaMA-1-33B,吞吐却显著更高。
图 1:模型性能与训练 GPU 时数的关系 ------ 训练成本指数级上升,效率优化势在必行
图 2:性能与推理吞吐的权衡 ------ 模型越大吞吐越低,效率设计空间巨大
研究主线:从问题到结论
图 11:研究主线 ------ 从规模竞赛到效率质量兼得(Mermaid 流程图)
基准/方法设计
综述的组织协议:三视角分解为若干子方向,逐类综述代表方法、关键结论与量化收益。
- 模型为中心:压缩(量化 / 剪枝 / 低秩 / 蒸馏)、高效预训练、高效微调(PEFT / MEFT)、高效推理(投机解码 / KV-Cache / 系统加速)、高效架构(注意力 / MoE / 长上下文 / Transformer 替代)。
- 数据为中心:数据选择(预训练侧 DSIR、DoReMi;微调侧 AlpaGasus、LIMA)、提示工程(少样本 / 压缩 / 生成)。
- 框架为中心:DeepSpeed、Megatron、vLLM、TensorRT-LLM、MLC-LLM 等训练与推理框架。
三视角互补:模型效率 × 数据效率 × 系统效率共同决定端到端成本。
分类全景
图 12:三视角分类法 ------ 模型 / 数据 / 框架为中心(Mermaid 分类树)
方法细节
模型压缩:量化是主力
高效预训练是成本最高的环节:混合精度(FP16/BF16 前反向 + FP32 主权重)可在现代 GPU 上提速 2--3 倍,缩放律指导参数-数据配比,初始化与优化器改进加速收敛,系统级三维并行与激活重计算进一步降低显存。
图 3:高效预训练 ------ 混合精度、缩放、初始化与系统级优化
量化把高精度权重映射到低精度表示。后训练量化(PTQ)中:LLM.int8() 首次支持多十亿级 INT8 推理;GPTQ 用 Hessian 加权把权重压到 3--4 bit,175B 模型约 4 GPU 时完成且几乎无损;AWQ 保护显著权重;QuIP 用非相干处理做到 2 bit;SpQR 保留离群值高精度。量化感知训练的代表是 BitNet (1-bit 权重 + 量化激活)。剪枝方面,SparseGPT 在 OPT-135B 上达到 60% 稀疏度且困惑度几乎不降,Wanda 无需重训练;低秩近似如 SVD-LLM 可与量化组合;知识蒸馏分白盒(logit/中间层)与黑盒(仅输出)两条路线。
图 4:模型压缩四路径 ------ 量化、剪枝、低秩近似与知识蒸馏
高效微调:PEFT 与 MEFT 互补
PEFT (参数高效微调)冻结主干、只训练新增参数:LoRA 低秩适配、Adapter、Prefix Tuning、Prompt Tuning。MEFT (记忆高效微调)解决显存瓶颈:QLoRA 用 4-bit NormalFloat + LoRA,单卡可微调 65B 模型且性能不降;LOMO 把梯度显存降到 O(1);选择性微调只保留非零梯度激活,仅需 1/3 GPU 显存。混合精度预训练在 FP16/BF16 前反向 + FP32 主权重下可提速 2--3 倍。
图 5:PEFT 与 MEFT 两条互补的微调路线
高效推理:算法级 + 系统级
算法级:投机解码 用小草稿模型(通常小 10 倍)并行生成候选,大模型一次性验证 ------ LLMA 提速 2 倍以上,Medusa 冻结主干 + 多头并行;KV-Cache 优化 中 KIVI 用 2-bit 量化减少 2.6 倍峰值显存,H2O / Scissorhands 驱逐不重要的缓存,StreamingLLM 用滑动窗口保证恒定显存。系统级:vLLM PagedAttention 用块表管理消除显存碎片,FlashDecoding++ 最高加速 4.86 倍(Nvidia)/ 2.18 倍(AMD),DeepSpeed-Inference 支持 CPU/NVMe 混合推理。
图 6:算法级(投机解码 / KV-Cache)与系统级推理加速
高效架构:注意力、MoE 与长上下文
高效注意力包括共享型(GQA / MQA)、核化低秩、固定模式(Longformer)、可学习模式(Reformer LSH)与硬件辅助(FlashAttention 用 tiling 减少 HBM-SRAM 访存实现 IO 感知精确注意力)。MoE 方面,Switch Transformer 达 1T 参数、2048 专家,预训练提速 4 倍;GShard 1.1T 参数性能优于需 2 倍算力的稠密模型;系统侧 FasterMoE 提速 1.37--17.87 倍,MegaBlocks 训练时间缩短 40%,Tutel 单 MoE 层提速 5.75 倍。长上下文用外推/插值、循环、滑动窗口、检索增强四类策略。
图 7:MoE 路由与长上下文处理策略
图 8:FlashAttention 通过分块与重计算最小化 HBM-SRAM 访存
数据为中心:数据选择与提示工程
数据选择在预训练侧(SSPT、DSIR、DoReMi)与微调侧(Instruction Mining、AlpaGasus、LIMA、TS-DShapley)用更少、更高质量的数据达到同等效果。提示工程覆盖少样本示例选择与排序、模板格式化、指令生成、多步推理(CoT),以及提示压缩(LLMLingua 降低输入 token)与提示生成。
图 9:预训练与微调阶段的数据筛选策略
图 10:少样本、模板、推理链与提示压缩 / 生成
实验设计与结果
综述本身不做实验,而是汇总各效率技术的代表数据(表 1)与框架能力对比(表 2)。
| 技术 | 路线 | 压缩/加速 | 效果 |
|---|---|---|---|
| GPTQ | 量化 PTQ | 3--4 bit | 175B 模型约 4 GPU 时,几乎无损 |
| SparseGPT | 剪枝 | 60% 稀疏 | OPT-135B 困惑度微降 |
| QLoRA | 微调 | 4-bit NF | 单卡微调 65B,性能不降 |
| KIVI | KV-Cache | 2-bit | 峰值显存减少 2.6 倍 |
| FlashDecoding++ | 推理 | 内核优化 | 最高 4.86 倍加速 |
表 1:主流效率技术的代表性量化收益
| 框架 | 类型 | 代表性特性 |
|---|---|---|
| DeepSpeed | 训练 + 推理 | ZeRO、DeepSpeed-Chat RLHF、INT4 量化 |
| Megatron | 训练 + 推理 | 3D / 序列并行、激活重计算、FasterTransformer |
| vLLM | 推理服务 | PagedAttention、连续批处理、多 LoRA |
| TensorRT-LLM | 推理服务 | 图优化、GPTQ / AWQ / SmoothQuant |
| MLC-LLM | 边缘推理 | TVM 编译加速、手机等端侧部署 |
表 2:LLM 框架对比(节选)
结果对比总结
图 13:从稠密缩放到 4-bit 量化与 MoE 的结果对比(Mermaid 流程图)
关键发现
- 量化甜点在 4-bit:3--4 bit 权重量化(GPTQ)对 175B 模型几乎无损;低于 4 bit 要么精度显著下降,要么需要昂贵的重训练。
- 一次性剪枝可行:SparseGPT / Wanda 无需重训练即达 50--60% 稀疏度,但非结构化稀疏只在 Ampere 系 GPU 上高效。
- MoE 解耦规模与算力:1T 参数稀疏模型(GShard)性能优于需 2 倍计算量的稠密模型;FasterMoE 提速最高 17.87 倍。
- 推理成为主导成本:投机解码提速 2 倍以上、KV-Cache 量化省 2.6 倍显存,算法 + 系统协同才可落地。
- 框架分工成型:训练用 DeepSpeed/Megatron(ZeRO、3D 并行),推理用 vLLM/TensorRT-LLM(PagedAttention、连续批处理)。
- 数据效率正交可叠加:AlpaGasus、LIMA 等数据选择方法可与模型侧优化叠加,进一步降低训练成本。
局限性
- 领域演进极快:新方法层出不穷,静态综述难以完全覆盖,依赖 GitHub 仓库持续更新缓解。
- 缺乏统一效率基准:吞吐 / 显存 / 能耗 / 质量的多维权衡缺少标准化评测平台与指标。
- 多模态效率覆盖有限:高效多模态 LLM 仅被提及,未系统展开跨模态融合优化。
常见问题(FAQ)
什么是高效 LLM 研究?
研究如何在不显著牺牲性能的前提下降低 LLM 的训练、微调、推理与部署成本,包括模型压缩、高效架构、数据优化与系统框架四个层面。
为什么 4-bit 是量化甜点?
3--4 bit 权重量化(GPTQ、AWQ)在 175B 级模型上近乎无损且成本可控;低于 4 bit 时精度显著下降,或需要 BitNet 这类昂贵的量化感知重训练。
PEFT 和 MEFT 有什么区别?
PEFT(LoRA、Adapter)冻结主干只训练新增参数,解决参数规模问题;MEFT(QLoRA、LOMO)专注降低微调显存占用,二者可组合使用。
MoE 为什么能兼顾规模与效率?
MoE 用路由网络把每个 token 分配给少量专家,参数量大但激活稀疏,计算量与同性能稠密模型相比可减半,实现规模与算力解耦。
vLLM 的 PagedAttention 解决了什么问题?
把 KV-Cache 分成固定大小的块并用块表管理,类似操作系统的分页,消除显存碎片并支持跨请求共享,大幅提升推理吞吐。
这篇综述与其它 LLM 综述有何不同?
它是首个以模型 / 数据 / 框架三视角组织效率文献的综述,聚焦十亿参数以上模型,并配套持续维护的 GitHub 仓库作为社区基础设施。
参考链接
- arXiv:2312.03863 --- Efficient Large Language Models: A Survey
- GitHub --- AIoT-MLSys-Lab/Efficient-LLMs-Survey(持续维护的论文清单)
- GPT-3: Language Models are Few-Shot Learners (NeurIPS 2020)
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness (NeurIPS 2022)
- QLoRA: Efficient Finetuning of Quantized LLMs (NeurIPS 2023)
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群 :白拾的小屋 (750365700)
⭐B站账号 :白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页 :YhbCode000(工程文件)