【TMLR 2024】Efficient LLM:高效大语言模型综述,模型、数据与框架三重视角|从大模型系统优化视角

摘要

本文解读 TMLR 2024 论文《Efficient Large Language Models: A Survey》。该综述提出模型、数据、框架三重视角的统一分类法 ,系统梳理模型压缩高效预训练/微调/推理高效架构 ,覆盖 379 篇文献 ,其特别之处在于配套持续维护的 GitHub 仓库作为社区基础设施。综述表明量化到 4-bit 近乎无损、剪枝达 60% 稀疏、MoE 以 1T 参数解耦规模与算力,为高效大语言模型研究提供了系统化地图。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Efficient Large Language Models: A Survey
标题(中文) 高效大语言模型综述:模型、数据与框架三重视角
作者 Zhongwei Wan, Xin Wang, Che Liu, Samiul Alam, Yu Zheng, Jiachen Liu, Zhongnan Qu, Shen Yan, Yi Zhu, Quanlu Zhang, Mosharaf Chowdhury, Mi Zhang
机构 The Ohio State University · Imperial College London · University of Michigan · Amazon AWS AI · Google Research · Microsoft Research Asia
会议 TMLR 2024
arXiv 2312.03863
项目网站 AIoT-MLSys-Lab/Efficient-LLMs-Survey

背景与动机

大语言模型(LLM)的能力与参数量、数据规模强相关:GPT-3 拥有 1750 亿参数 ,预训练消耗约 335 GPU-years 的算力;PaLM 更是达到 5400 亿参数 。训练 GPU 时数随模型规模指数级增长,而推理吞吐反而随规模下降------部署成本成为大模型普惠化的最大障碍。

此前综述各有局限:泛化 LLM 综述(Zhao et al. 2023、chang et al. 2023)覆盖模型、任务与对齐,效率只零星提及;高效 Transformer 综述(Tay et al. 2020)未面向十亿参数级模型;专项压缩综述(Zhu et al. 2023)只覆盖单一方向。本文首次以模型 / 数据 / 框架三视角系统化组织效率文献,聚焦十亿参数以上模型的独特挑战(涌现能力、显存瓶颈),并配套持续维护的 GitHub 仓库。

一个关键反例说明了效率设计的可行性:Mistral-7B 采用分组查询注意力(GQA)与滑动窗口注意力,性能接近 LLaMA-1-33B,吞吐却显著更高。

图 1:模型性能与训练 GPU 时数的关系 ------ 训练成本指数级上升,效率优化势在必行

图 2:性能与推理吞吐的权衡 ------ 模型越大吞吐越低,效率设计空间巨大

研究主线:从问题到结论

图 11:研究主线 ------ 从规模竞赛到效率质量兼得(Mermaid 流程图)

基准/方法设计

综述的组织协议:三视角分解为若干子方向,逐类综述代表方法、关键结论与量化收益

  • 模型为中心:压缩(量化 / 剪枝 / 低秩 / 蒸馏)、高效预训练、高效微调(PEFT / MEFT)、高效推理(投机解码 / KV-Cache / 系统加速)、高效架构(注意力 / MoE / 长上下文 / Transformer 替代)。
  • 数据为中心:数据选择(预训练侧 DSIR、DoReMi;微调侧 AlpaGasus、LIMA)、提示工程(少样本 / 压缩 / 生成)。
  • 框架为中心:DeepSpeed、Megatron、vLLM、TensorRT-LLM、MLC-LLM 等训练与推理框架。

三视角互补:模型效率 × 数据效率 × 系统效率共同决定端到端成本。

分类全景

图 12:三视角分类法 ------ 模型 / 数据 / 框架为中心(Mermaid 分类树)

方法细节

模型压缩:量化是主力

高效预训练是成本最高的环节:混合精度(FP16/BF16 前反向 + FP32 主权重)可在现代 GPU 上提速 2--3 倍,缩放律指导参数-数据配比,初始化与优化器改进加速收敛,系统级三维并行与激活重计算进一步降低显存。

图 3:高效预训练 ------ 混合精度、缩放、初始化与系统级优化

量化把高精度权重映射到低精度表示。后训练量化(PTQ)中:LLM.int8() 首次支持多十亿级 INT8 推理;GPTQ 用 Hessian 加权把权重压到 3--4 bit,175B 模型约 4 GPU 时完成且几乎无损;AWQ 保护显著权重;QuIP 用非相干处理做到 2 bit;SpQR 保留离群值高精度。量化感知训练的代表是 BitNet (1-bit 权重 + 量化激活)。剪枝方面,SparseGPT 在 OPT-135B 上达到 60% 稀疏度且困惑度几乎不降,Wanda 无需重训练;低秩近似如 SVD-LLM 可与量化组合;知识蒸馏分白盒(logit/中间层)与黑盒(仅输出)两条路线。

图 4:模型压缩四路径 ------ 量化、剪枝、低秩近似与知识蒸馏

高效微调:PEFT 与 MEFT 互补

PEFT (参数高效微调)冻结主干、只训练新增参数:LoRA 低秩适配、Adapter、Prefix Tuning、Prompt Tuning。MEFT (记忆高效微调)解决显存瓶颈:QLoRA 用 4-bit NormalFloat + LoRA,单卡可微调 65B 模型且性能不降;LOMO 把梯度显存降到 O(1);选择性微调只保留非零梯度激活,仅需 1/3 GPU 显存。混合精度预训练在 FP16/BF16 前反向 + FP32 主权重下可提速 2--3 倍。

图 5:PEFT 与 MEFT 两条互补的微调路线

高效推理:算法级 + 系统级

算法级:投机解码 用小草稿模型(通常小 10 倍)并行生成候选,大模型一次性验证 ------ LLMA 提速 2 倍以上,Medusa 冻结主干 + 多头并行;KV-Cache 优化 中 KIVI 用 2-bit 量化减少 2.6 倍峰值显存,H2O / Scissorhands 驱逐不重要的缓存,StreamingLLM 用滑动窗口保证恒定显存。系统级:vLLM PagedAttention 用块表管理消除显存碎片,FlashDecoding++ 最高加速 4.86 倍(Nvidia)/ 2.18 倍(AMD),DeepSpeed-Inference 支持 CPU/NVMe 混合推理。

图 6:算法级(投机解码 / KV-Cache)与系统级推理加速

高效架构:注意力、MoE 与长上下文

高效注意力包括共享型(GQA / MQA)、核化低秩、固定模式(Longformer)、可学习模式(Reformer LSH)与硬件辅助(FlashAttention 用 tiling 减少 HBM-SRAM 访存实现 IO 感知精确注意力)。MoE 方面,Switch Transformer 达 1T 参数、2048 专家,预训练提速 4 倍;GShard 1.1T 参数性能优于需 2 倍算力的稠密模型;系统侧 FasterMoE 提速 1.37--17.87 倍,MegaBlocks 训练时间缩短 40%,Tutel 单 MoE 层提速 5.75 倍。长上下文用外推/插值、循环、滑动窗口、检索增强四类策略。

图 7:MoE 路由与长上下文处理策略

图 8:FlashAttention 通过分块与重计算最小化 HBM-SRAM 访存

数据为中心:数据选择与提示工程

数据选择在预训练侧(SSPT、DSIR、DoReMi)与微调侧(Instruction Mining、AlpaGasus、LIMA、TS-DShapley)用更少、更高质量的数据达到同等效果。提示工程覆盖少样本示例选择与排序、模板格式化、指令生成、多步推理(CoT),以及提示压缩(LLMLingua 降低输入 token)与提示生成。

图 9:预训练与微调阶段的数据筛选策略

图 10:少样本、模板、推理链与提示压缩 / 生成

实验设计与结果

综述本身不做实验,而是汇总各效率技术的代表数据(表 1)与框架能力对比(表 2)。

技术 路线 压缩/加速 效果
GPTQ 量化 PTQ 3--4 bit 175B 模型约 4 GPU 时,几乎无损
SparseGPT 剪枝 60% 稀疏 OPT-135B 困惑度微降
QLoRA 微调 4-bit NF 单卡微调 65B,性能不降
KIVI KV-Cache 2-bit 峰值显存减少 2.6 倍
FlashDecoding++ 推理 内核优化 最高 4.86 倍加速

表 1:主流效率技术的代表性量化收益

框架 类型 代表性特性
DeepSpeed 训练 + 推理 ZeRO、DeepSpeed-Chat RLHF、INT4 量化
Megatron 训练 + 推理 3D / 序列并行、激活重计算、FasterTransformer
vLLM 推理服务 PagedAttention、连续批处理、多 LoRA
TensorRT-LLM 推理服务 图优化、GPTQ / AWQ / SmoothQuant
MLC-LLM 边缘推理 TVM 编译加速、手机等端侧部署

表 2:LLM 框架对比(节选)

结果对比总结

图 13:从稠密缩放到 4-bit 量化与 MoE 的结果对比(Mermaid 流程图)

关键发现

  • 量化甜点在 4-bit:3--4 bit 权重量化(GPTQ)对 175B 模型几乎无损;低于 4 bit 要么精度显著下降,要么需要昂贵的重训练。
  • 一次性剪枝可行:SparseGPT / Wanda 无需重训练即达 50--60% 稀疏度,但非结构化稀疏只在 Ampere 系 GPU 上高效。
  • MoE 解耦规模与算力:1T 参数稀疏模型(GShard)性能优于需 2 倍计算量的稠密模型;FasterMoE 提速最高 17.87 倍。
  • 推理成为主导成本:投机解码提速 2 倍以上、KV-Cache 量化省 2.6 倍显存,算法 + 系统协同才可落地。
  • 框架分工成型:训练用 DeepSpeed/Megatron(ZeRO、3D 并行),推理用 vLLM/TensorRT-LLM(PagedAttention、连续批处理)。
  • 数据效率正交可叠加:AlpaGasus、LIMA 等数据选择方法可与模型侧优化叠加,进一步降低训练成本。

局限性

  • 领域演进极快:新方法层出不穷,静态综述难以完全覆盖,依赖 GitHub 仓库持续更新缓解。
  • 缺乏统一效率基准:吞吐 / 显存 / 能耗 / 质量的多维权衡缺少标准化评测平台与指标。
  • 多模态效率覆盖有限:高效多模态 LLM 仅被提及,未系统展开跨模态融合优化。

常见问题(FAQ)

什么是高效 LLM 研究?

研究如何在不显著牺牲性能的前提下降低 LLM 的训练、微调、推理与部署成本,包括模型压缩、高效架构、数据优化与系统框架四个层面。

为什么 4-bit 是量化甜点?

3--4 bit 权重量化(GPTQ、AWQ)在 175B 级模型上近乎无损且成本可控;低于 4 bit 时精度显著下降,或需要 BitNet 这类昂贵的量化感知重训练。

PEFT 和 MEFT 有什么区别?

PEFT(LoRA、Adapter)冻结主干只训练新增参数,解决参数规模问题;MEFT(QLoRA、LOMO)专注降低微调显存占用,二者可组合使用。

MoE 为什么能兼顾规模与效率?

MoE 用路由网络把每个 token 分配给少量专家,参数量大但激活稀疏,计算量与同性能稠密模型相比可减半,实现规模与算力解耦。

vLLM 的 PagedAttention 解决了什么问题?

把 KV-Cache 分成固定大小的块并用块表管理,类似操作系统的分页,消除显存碎片并支持跨请求共享,大幅提升推理吞吐。

这篇综述与其它 LLM 综述有何不同?

它是首个以模型 / 数据 / 框架三视角组织效率文献的综述,聚焦十亿参数以上模型,并配套持续维护的 GitHub 仓库作为社区基础设施。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
墨心@2 天前
阶段 4:事件总线
人工智能·语言模型·大语言模型·agent·codex·harness
白拾4 天前
【arXiv 2024】DeepSeek-V2 论文解读:经济训练与高效推理的 MoE 大语言模型|从稀疏架构降本增效视角
大语言模型·高效推理·mla·deepseek-v2 论文分享·moe 稀疏架构·arxiv 2024
白拾4 天前
【NeurIPS 2023】H2O:重型命中者预言机——大模型高效生成式推理的 KV Cache 驱逐策略|从大模型推理系统优化视角
大模型推理·高效推理·kv cache·稀疏注意力·h2o 论文分享·neurips 2023
夏文强4 天前
多模态 AI Agent 前沿全景:2026 年从「能回答」到「能干活」的跃迁
人工智能·大语言模型·多模态·前沿技术·ai agent
夏文强4 天前
AI 技术全景架构科普:从算法到应用的一整套技术栈
人工智能·深度学习·机器学习·大语言模型·技术架构
美人胖八分5 天前
大模型常见微调框架对比
lora·大语言模型·deepspeed·qlora
艺杯羹7 天前
LLM越狱与安全护栏攻防大演进:从奶奶漏洞到输入输出双重检测模型
网络·安全·网络安全·ai·llm·大语言模型·ai安全
还是奇怪7 天前
Agent 安全事件成为本周核心风险信号,从三起越界评测到 Hugging Face 入侵
人工智能·web安全·大语言模型·anthropic
prog_610314 天前
【笔记】用cursor手搓cursor(八)
笔记·llm·大语言模型·agent