LLM 量化与剪枝完全指南:从比特级数学到生产级内核

LLM 量化与剪枝完全指南:从比特级数学到生产级内核

元信息

  • 最后更新 :2026-08-12 | 内容范围:截至本文发布日的全部主流方法与最新进展
  • 覆盖主题:量化数学原理 · 数值格式演进 · 权重仅量化(GPTQ/AWQ)· 旋转范式与 2-bit 向量量化 · QAT 与原生低比特(BitNet)· KV Cache 量化(KIVI → TurboQuant)· 内核与格式生态 · 非结构化/结构化剪枝(SparseGPT/Wanda/ShortGPT/Minitron)· 选型决策 · 评估方法论
  • 适合读者:有 Transformer 基础、希望系统掌握模型压缩的算法工程师与架构师
  • 一句话摘要:量化通过降低每个参数的比特数换取内存与带宽,剪枝通过删除冗余参数换取计算量;前者主导了 2023--2026 年的部署实践,后者正以"剪枝+蒸馏造小模型"和"KV/层冗余裁剪"两种形态回归。理解二者的数学本质、硬件约束与组合方式,是低成本部署 LLM 的唯一正途。

目录

  • [第 0 部分 · 认知框架](#第 0 部分 · 认知框架)
    • [0.1 为什么需要压缩:三堵墙与两个阶段](#0.1 为什么需要压缩:三堵墙与两个阶段)
    • [0.2 压缩技术全景分类](#0.2 压缩技术全景分类)
  • [第 I 部分 · 量化](#第 I 部分 · 量化)
    • [1. 量化的数学基础](#1. 量化的数学基础)
    • [2. 数值格式演进:从 INT8 到 NVFP4 与三值权重](#2. 数值格式演进:从 INT8 到 NVFP4 与三值权重)
    • [3. 权重仅量化(Weight-Only PTQ)深度剖析](#3. 权重仅量化(Weight-Only PTQ)深度剖析)
    • [4. 激活的战争:SmoothQuant 与旋转范式](#4. 激活的战争:SmoothQuant 与旋转范式)
    • [5. 2-bit 前沿:向量量化与格编码](#5. 2-bit 前沿:向量量化与格编码)
    • [6. QAT 与原生低比特训练:BitNet 革命](#6. QAT 与原生低比特训练:BitNet 革命)
    • [7. KV Cache 量化:长上下文时代的真正瓶颈](#7. KV Cache 量化:长上下文时代的真正瓶颈)
    • [8. 内核、格式与推理框架生态](#8. 内核、格式与推理框架生态)
    • [9. 量化工程实战](#9. 量化工程实战)
  • [第 II 部分 · 剪枝](#第 II 部分 · 剪枝)
    • [10. 剪枝基础:稀疏性从何而来](#10. 剪枝基础:稀疏性从何而来)
    • [11. 一次性非结构化剪枝:SparseGPT 与 Wanda](#11. 一次性非结构化剪枝:SparseGPT 与 Wanda)
    • [12. 结构化剪枝:宽度、深度与注意力头](#12. 结构化剪枝:宽度、深度与注意力头)
    • [13. 剪枝 + 蒸馏:Minitron 范式与"大模型造小模型"](#13. 剪枝 + 蒸馏:Minitron 范式与"大模型造小模型")
    • [14. MoE 与半结构化:架构级稀疏](#14. MoE 与半结构化:架构级稀疏)
  • [第 III 部分 · 融合与决策](#第 III 部分 · 融合与决策)
    • [15. 量化 × 剪枝 × 蒸馏的组合艺术](#15. 量化 × 剪枝 × 蒸馏的组合艺术)
    • [16. 选型决策矩阵](#16. 选型决策矩阵)
    • [17. 评估方法论与深坑清单](#17. 评估方法论与深坑清单)
    • [18. 前沿展望(2026 → 2028)](#18. 前沿展望(2026 → 2028))
    • [19. FAQ:高频问题直达](#19. FAQ:高频问题直达)
    • [20. 参考文献](#20. 参考文献)

第 0 部分 · 认知框架

0.1 为什么需要压缩:三堵墙与两个阶段

定义 :模型压缩(Model Compression)指在不显著损害模型能力的前提下,降低模型的存储占用、计算量或能耗的技术总称,核心手段包括量化、剪枝、知识蒸馏与架构改良。

先看三组真实数字,建立量级直觉:

事实 数字 含义
70B 模型 FP16 权重 ≈ 140 GB 单张 A100-80G 装不下,必须多卡张量并行
7B 模型 + 8K 上下文 KV Cache(FP16) ≈ 10 GB+,随序列线性增长 长上下文下 KV Cache 超过权重本身
30B 模型,batch=128、seq=1024 的 KV Cache ≈ 180 GB 推理服务的第一内存瓶颈

LLM 推理分两个物理性质完全不同的阶段(理解这一点是理解一切优化技术的钥匙):

复制代码
Prefill(预填充):一次处理整个 prompt
  ├─ 计算密集(Compute-Bound)
  ├─ 瓶颈:FLOPs → 低比特"计算"(FP8/FP4、稀疏GEMM)有用
  └─ 指标:TTFT(首 token 延迟)

Decode(解码):逐 token 自回归生成
  ├─ 访存密集(Memory-Bound):每生成 1 token 就要把全部权重读一遍
  ├─ 算术强度 ≈ batch_size,batch=1 时远低于 GPU 屋脊点
  ├─ 瓶颈:HBM 带宽 → 权重比特数减半 ≈ 速度近乎翻倍
  └─ 指标:TPOT / tokens/s

核心推论

  1. Decode 阶段,量化不仅省显存,还直接提速------因为推理速度≈带宽÷权重体积。这就是 W4A16(权重 4-bit、激活 16-bit)成为消费级部署默认选项的根本原因。
  2. Prefill 阶段,剪枝(减少 FLOPs)与低比特计算格式(FP8/NVFP4)才有用武之地
  3. KV Cache 是第三个独立战场------它既不是权重也不是激活,随序列长度线性膨胀,催生了 KIVI、TurboQuant 等专门技术(见第 7 节)。

三堵墙:内存墙 (容量)、带宽墙 (速度)、功耗墙(能源)。量化同时缓解三者;剪枝主要缓解计算与功耗,非结构化剪枝若不配合稀疏硬件则对带宽帮助有限------这个认知差异决定了两个领域完全不同的工程命运。

0.2 压缩技术全景分类

复制代码
                     LLM 压缩
        ┌──────────────┼──────────────┬──────────────┐
      量化          剪枝           知识蒸馏        架构改良
   (降低比特)    (删除参数)      (迁移知识)    (GQA/MoE/MLA)
        │              │
   ┌────┴────┐    ┌────┴─────┐
 PTQ      QAT   非结构化   结构化
(GPTQ/AWQ)(BitNet)(SparseGPT)(宽度/深度/头)
                  (Wanda)   (LLM-Pruner/
                            ShortGPT/Minitron)
维度 量化 剪枝 蒸馏
压缩对象 每个参数的表示精度 参数的存在性 模型的函数本身
典型压缩率 2--8×(按比特) 1.2--2×(结构化)/ 理论 20×(非结构化) 任意(重造小模型)
是否需要训练数据 PTQ 仅需少量校准数据 一次性方法无需训练 需要大量算力再训练
硬件红利兑现难度 低(格式+内核即可) 高(依赖稀疏算子) 无(小模型天然快)
2026 工业地位 部署标配 回归中(造小模型、KV/层裁剪) 与剪枝合流

本文主线:量化是"每个参数变便宜",剪枝是"参数变少"。前者在 2023--2026 主导了部署实践,后者以新形态复兴。


第 I 部分 · 量化

1. 量化的数学基础

1.1 均匀量化的基本公式

定义 :量化(Quantization)是将高精度数值 x x x 映射到有限离散集合的映射 Q : R → Q Q: \mathbb{R} \to \mathcal{Q} Q:R→Q,其中 ∣ Q ∣ = 2 b |\mathcal{Q}| = 2^b ∣Q∣=2b( b b b 为比特数)。

b b b-bit 均匀量化的编码与解码(quantize / dequantize)为:

Q ( x ) = c l a m p ( r o u n d ( x Δ ) + z , 0 , 2 b − 1 ) Q(x) = \mathrm{clamp}\Big(\mathrm{round}\Big(\frac{x}{\Delta}\Big) + z,\ 0,\ 2^b-1\Big) Q(x)=clamp(round(Δx)+z, 0, 2b−1)

x ^ = Δ ⋅ ( q − z ) \hat{x} = \Delta \cdot (q - z) x^=Δ⋅(q−z)

其中 Δ \Delta Δ 为缩放因子(scale) , z z z 为零点(zero-point) 。给定校准范围 α , β \\alpha, \\beta α,β

  • 非对称量化 : Δ = β − α 2 b − 1 , z = r o u n d ( − α Δ ) \Delta = \dfrac{\beta - \alpha}{2^b - 1},\quad z = \mathrm{round}\Big(-\dfrac{\alpha}{\Delta}\Big) Δ=2b−1β−α,z=round(−Δα)
  • 对称量化 (LLM 权重常用,权重分布近似零均值): Δ = max ⁡ ∣ x ∣ 2 b − 1 − 1 , z = 2 b − 1 \Delta = \dfrac{\max|x|}{2^{b-1} - 1},\quad z = 2^{b-1} Δ=2b−1−1max∣x∣,z=2b−1

反量化后的 x ^ \hat{x} x^ 用于后续计算。注意一个关键工程细节:真正的低比特 GEMM 用整数完成 ( X ^ W ^ = Δ x Δ w ( q x q w ⊤ ) \hat{X}\hat{W} = \Delta_x \Delta_w (q_x q_w^\top) X^W^=ΔxΔw(qxqw⊤)),或者在 W4A16 场景下反量化回 FP16 再做矩阵乘------这两条路线决定了完全不同的内核设计(见第 8 节)。

1.2 量化粒度:per-tensor → per-channel → per-group
粒度 共享 scale 的范围 精度 元数据开销 典型应用
per-tensor 整个矩阵 可忽略 INT8 激活、FP8
per-channel 每行/每列 很小 SmoothQuant 权重
per-group 每 g g g 个连续元素(常取 128) b + 16 / g b + 16/g b+16/g bit/参数 GPTQ/AWQ INT4 标配
per-block + 两级缩放 每 16 个元素 + 全局 略高 NVFP4/MXFP4

以 group=128 的 INT4 为例:每 128 个权重配一个 FP16 scale,等效位宽 4 + 16 / 128 = 4.125 4 + 16/128 = 4.125 4+16/128=4.125 bit。粒度越细,对离群值越鲁棒,但 scale 存储与内核取数开销越大------这是贯穿全文的核心权衡。

1.3 误差分析:为什么"四舍五入"会杀人

单个权重的量化误差 ϵ = x ^ − x \epsilon = \hat{x} - x ϵ=x^−x 在舍入到最近时满足 ∣ ϵ ∣ ≤ Δ / 2 |\epsilon| \le \Delta/2 ∣ϵ∣≤Δ/2。但对线性层输出:

∥ W X − W ^ X ∥ F 2 ≈ ∑ i , j ϵ i j 2 ⋅ ∥ X : , j ∥ 2 2 \| W X - \hat{W} X \|F^2 \approx \sum{i,j} \epsilon_{ij}^2 \cdot \|X_{:,j}\|_2^2 ∥WX−W^X∥F2≈i,j∑ϵij2⋅∥X:,j∥22

关键洞察 :误差会按对应输入通道的激活能量 ∥ X : , j ∥ 2 \|X_{:,j}\|^2 ∥X:,j∥2 加权放大。这一条公式同时解释了三件事:

  1. 为什么 AWQ 用激活幅度衡量权重重要性(第 3.2 节);
  2. 为什么 Wanda 用 ∣ W i j ∣ ⋅ ∥ X : , j ∥ |W_{ij}|\cdot\|X_{:,j}\| ∣Wij∣⋅∥X:,j∥ 做剪枝判据(第 11.2 节);
  3. 为什么 LLM 在 6.7B 规模后激活出现离群通道(outlier channels),让朴素 W8A8 直接崩溃(第 4.1 节)。
1.4 Weight-Only vs Weight-Activation:两条路线的本质区别
方案 记法 计算方式 收益来源 典型代表
权重仅量化 W4A16 / W8A16 反量化回 FP16 做 GEMM 内存与带宽(decode 提速) GPTQ、AWQ、GGUF
权重+激活量化 W8A8 / W4A8 / W4A4 整数或 FP8 GEMM 内存 + FLOPs(prefill 提速) SmoothQuant、FP8、QuaRot

经验法则:batch 小、延迟敏感的在线服务 → W4A16;batch 大、吞吐优先的数据中心 → W8A8/FP8;两者都要 → 低比特权重 + FP8 激活的混合方案(2025 年后 Blackwell 上的主流玩法)。

2. 数值格式演进:从 INT8 到 NVFP4 与三值权重

2.1 格式全家福
格式 位构成 动态范围 特点
FP16 1+5+10 ±65504 基线
BF16 1+8+7 ≈FP32 训练默认,尾数精度差
FP8 E4M3 1+4+3 ±448 前向/权重,Hopper 原生
FP8 E5M2 1+5+2 ±57344 梯度/激活大动态场景
INT8 整数 依赖 scale 最成熟的推理格式
NF4 4-bit 非均匀 信息论最优 针对正态分布权重设计,QLoRA 专用
INT4 整数 依赖 group scale W4A16 主力
FP4 (E2M1) 1+2+1 ±6 必须配合块级缩放(MXFP4/NVFP4)
三值 {-1,0,1} ≈1.58 bit BitNet b1.58,乘法退化为加法

关键历史节点 :2022 年 10 月 NVIDIA/ARM/Intel 联合发布 FP8 标准;2023 年 OCP(开放计算项目,Meta/微软主导)发布 MX 规范(MXFP8/MXFP4,每 32 元素共享一个 E8M0 缩放);2025 年 NVIDIA Blackwell 推出 NVFP4;2025--2026 年 FP4 训练框架与 FP4 注意力(SageAttention3,清华)相继落地。

2.2 为什么极低比特下"浮点反杀整数"

INT4 只有 16 个等间距量化点,一旦某个 group 内出现离群值, Δ \Delta Δ 被撑大,其余 15 个点的分辨率全部浪费。FP4/MX/NF4 的共同思想是"把动态范围还给数值本身"

  • NF4 (Dettmers,QLoRA):预训练权重近似 N ( 0 , σ 2 ) N(0,\sigma^2) N(0,σ2),按分位数放置 16 个量化点------信息论意义上对正态分布最优;
  • NVFP4 (Blackwell): 4 -bit E2M1 值 × 每 16 元素的 E4M3 块缩放 × 每 tensor 的 FP32 全局缩放 4\text{-bit E2M1 值} \times \text{每 16 元素的 E4M3 块缩放} \times \text{每 tensor 的 FP32 全局缩放} 4-bit E2M1 值×每 16 元素的 E4M3 块缩放×每 tensor 的 FP32 全局缩放。两级缩放既保精度,又让 Tensor Core 直接以 2× FP8 的吞吐执行。NVIDIA 官方数据显示 NVFP4 在超低精度下显著优于朴素 FP4,接近 FP8 的精度、翻倍的吞吐;MLPerf Inference v4.1 中 Blackwell 平台正是靠 FP4 Transformer Engine 刷新了 LLM 推理纪录。

硬件精度演进规律 (Volta→Hopper→Blackwell):精度每降一半,算力翻倍,每一代架构都在向更低精度、更高算力方向演进。算法必须跟着硬件走:2024 年的最佳实践是 FP8,2026 年的新宠是 NVFP4/MXFP4。

3. 权重仅量化(Weight-Only PTQ)深度剖析

PTQ(Post-Training Quantization)只需几百条校准文本、一次前向统计,是把 70B 塞进单卡的主力技术。

3.1 GPTQ:二阶信息的层间重构(ICLR 2023)

核心问题:逐权重独立舍入忽略了权重间的耦合。GPTQ 将每层的量化建模为重构问题:

arg ⁡ min ⁡ W ^ ∥ W X − W ^ X ∥ F 2 \arg\min_{\hat{W}} \ \big\| WX - \hat{W}X \big\|_F^2 argW^min WX−W^X F2

其中 X X X 是该层的校准输入。这继承了 Optimal Brain Surgeon(OBS)谱系:用近似 Hessian H = 2 X X ⊤ H = 2XX^\top H=2XX⊤ 度量"动一个权重,输出变多少"。GPTQ 的三个工程化关键:

  1. 贪心逐列量化 + 误差补偿 :按列顺序量化 w q w_q wq 后,用 Hessian 逆把误差分摊给尚未量化的列:
    W F ← W F − ( W q − W ^ q )   H q q − 1 H q F W_{F} \leftarrow W_{F} - (W_q - \hat{W}q)\,H_{qq}^{-1} H{qF} WF←WF−(Wq−W^q)Hqq−1HqF
  2. 延迟批量更新(lazy batch updates):以 128 列为一块,用 Cholesky 分解批量执行,避免逐列的矩阵运算,把复杂度压到可行范围;
  3. 阻尼项(dampening) : H ← H + λ I H \leftarrow H + \lambda I H←H+λI 防止 Hessian 病态。

效果:3--4 bit 下 LLM 困惑度几乎无损(175B OPT 首次实现 4-bit);代价是需要逐层二阶计算,70B 模型约需 1--4 GPU 小时。GPTQ 至今仍是"精度天花板基准"。

3.2 AWQ:激活感知的等价缩放(MLSys 2024)

AWQ 的观察改变了行业:LLM 中只有 0.1%--1% 的"显著通道" 对应大激活值,保护它们就能保住精度。由 1.3 节误差公式,与其混合精度保存这些权重(硬件不友好),不如对显著通道做等价缩放

W X = ( W   d i a g ( s ) ) ( d i a g ( s ) − 1 X ) , s j = ( ∣ X j ∣ ‾ ) α WX = (W\,\mathrm{diag}(s))\big(\mathrm{diag}(s)^{-1}X\big), \qquad s_j = \big(\overline{|X_j|}\big)^{\alpha} WX=(Wdiag(s))(diag(s)−1X),sj=(∣Xj∣)α

把 s s s 折叠进上一层(LayerNorm/Linear),运行时零开销;然后全网络统一 INT4 per-group 量化 ,只需搜索一个超参 α ∈ 0 , 1 \alpha \in 0,1 α∈0,1

为什么 AWQ 赢了生产部署 :无二阶计算(分钟级完成)、无稀疏混合精度、对分布漂移鲁棒(跨域校准不掉点)、配合 Marlin 内核 获得接近理想的加速(实测 batch≤32 时相对 FP16 约 3.8× GEMM 加速,端到端多倍提速,社区评测中 AWQ+Marlin 组合可达 10× 量级)。截至 2026 年,"AWQ + Marlin" 仍是 vLLM/SGLang 生产部署的甜点方案。

3.3 SqueezeLLM:非均匀量化 + 稠密-稀疏分解(ICML 2024)

两个思想:

  1. 基于敏感度的非均匀量化 :用 k k k-means 在敏感度加权下学习量化表(LUT 查表反量化),比等间距 INT4 更贴合权重实际分布;
  2. Dense-and-Sparse:把极少数离群权重抠出来存成 CSR 稀疏矩阵(SpMM 计算),剩余权重以 3-bit 稠密量化------用 0.45% 的稀疏开销换来 3-bit 下接近 4-bit 的精度。

这个"离群值单独伺候"的思想后来被 KVQuant 等广泛继承。

3.4 OmniQuant 与 HQQ:可学习裁剪与免校准
  • OmniQuant(ICLR 2024) :把 AWQ 的手工缩放升级为可学习的等价变换(LET) + 可学习权重裁剪(LWC),端到端反向传播(直通估计器),几 GPU 小时即可在 W4A4/W2A16 等激进配置下超越 GPTQ/AWQ;
  • HQQ(2023) :半二次分裂(Half-Quadratic Splitting)求解,完全不需要校准数据,秒级完成,成为快速实验与 torchao 工具链的常用选项。
3.5 小结与选型
方法 比特 校准需求 耗时(70B) 精度 适用
GPTQ 4/3 128--512 条 1--4 h ★★★★★ 追精度
AWQ 4 少量 ~分钟 ★★★★☆ 生产首选
SqueezeLLM 3 校准 小时级 ★★★★ 极限压缩
OmniQuant 4/2 校准 数小时 ★★★★★ 激进配置
HQQ 4/3/2 秒级 ★★★☆ 快速迭代

4. 激活的战争:SmoothQuant 与旋转范式

权重好量化,激活难量化------这是 LLM 量化与 CNN 量化的最大分野。

4.1 问题起源:激活离群值

Dettmers 的 LLM.int8() (NeurIPS 2022)首次系统揭示:模型 ≥6.7B 后,约 0.1% 的隐藏维度在几乎所有 token 上出现幅度 >6 的离群值,且高度系统化。直接 INT8 激活量化会让困惑度爆炸。LLM.int8() 用混合精度分解(离群维度走 FP16,其余走 INT8)解决了可用性问题,但稀疏分解拖慢了速度------启发了后续所有工作。

4.2 SmoothQuant:把量化难度从激活搬给权重(ICML 2023)

Y = X W = ( X   d i a g ( s ) − 1 ) ⏟ X ~ ⋅ ( d i a g ( s )   W ) ⏟ W ~ , s j = max ⁡ ( ∣ X j ∣ ) α max ⁡ ( ∣ W j ∣ ) 1 − α Y = XW = \underbrace{\big(X\,\mathrm{diag}(s)^{-1}\big)}{\tilde{X}} \cdot \underbrace{\big(\mathrm{diag}(s)\,W\big)}{\tilde{W}}, \qquad s_j = \frac{\max(|X_j|)^\alpha}{\max(|W_j|)^{1-\alpha}} Y=XW=X~ (Xdiag(s)−1)⋅W~ (diag(s)W),sj=max(∣Wj∣)1−αmax(∣Xj∣)α

对激活逐通道除、对权重逐通道乘,数学上完全等价。 α = 0.5 \alpha=0.5 α=0.5 时激活离群性被"平滑"到权重侧,W8A8 纯整数 GEMM 首次可行:内存减半、prefill 计算加速,是 vLLM/TensorRT-LLM 中 INT8 路线的理论基石。

4.3 旋转范式:QuaRot / SpinQuant(2024)

更彻底的思想:用正交变换把离群值"旋没" 。对 Y = X W Y=XW Y=XW 插入 R R ⊤ = I RR^\top = I RR⊤=I:

Y = ( X R ) ( R ⊤ W ) Y = (XR)(R^\top W) Y=(XR)(R⊤W)

若 R R R 选为(随机)Hadamard 矩阵,旋转后的激活能量在各维度上趋于均匀("去相干/incoherence"),离群值消失,W4A4 甚至 KV4 都变得可行

  • QuaRot(ETH,2024):Hadamard 旋转 + 离群值吸收进权重,W4A4KV4 在 LLaMA 上几乎无损,Hadamard 可与线性层权重离线融合,运行时无额外开销;
  • SpinQuant(Meta,2024) :旋转矩阵不固定为 Hadamard,而是在 Cayley 参数化下学习 最优 R R R,进一步压低 W4A4 损失。

旋转范式在 2025--2026 持续发酵:KV Cache 量化(OSCAR)、FP4 训练稳定化中都出现了它的身影。记住这条主线:量化领域的进步史,就是一部"与离群值斗争"的历史------从回避(混合精度)、搬家(SmoothQuant)、抹平(旋转)到从训练源头杜绝(BitNet / 压缩性感知训练)。

5. 2-bit 前沿:向量量化与格编码

标量量化在 2-bit 下只有 4 个量化点,必然崩溃。出路是向量量化 :把 d d d 维权块整体映射到码本。

5.1 QuIP / QuIP#:随机旋转 + 格码本(NeurIPS 2023 / 2024)

QuIP 给出了极低比特量化的首个理论保证:先做随机正交(incoherence processing)使权重与 Hessian "互不相干",此时格量化误差有界。QuIP# 落地为:

  • 随机 Hadamard 旋转;
  • E8 格(E8P lattice)向量码本,2-bit 表示 8 维块;
  • 量化后做轻量微调与投影回格。

结果:70B 模型压到 2-bit(≈19 GB,单张消费级 GPU)仍接近 FP16 困惑度------这是"大模型单卡化"的关键一步。

5.2 AQLM:加性量化(ICML 2024)

把权重块表示为多个码本之和 : W ^ ≈ C 1 + C 2 + ⋯ \hat{W} \approx C_1 + C_2 + \cdots W^≈C1+C2+⋯,逐码本交替优化 + beam search。AQLM 把有效比特压到 ≈1--2 bit(2B 模型 1-bit 级),是信息论意义上的极致压缩,代价是量化过程本身需要数天 GPU 时间与专门工程(Yandex 团队后续把量化时间大幅压缩)。

5.3 冷静剂:量化损伤是乘性的(2026-08 arXiv 新证)

2026 年 8 月 10 日 arXiv 上的新论文 《Quantization Damage Is Multiplicative, Not Additive》 给出了重要理论警示:低于 4-bit 时,逐层量化误差并非独立相加,而是沿深度乘性放大 ------这解释了为什么 PPL 随比特下降呈非线性恶化,也解释了"每层量化后再修复"类方法(GPTQ 谱系)为何天然优于一次性全局量化。对实践者的含义:比特数越低,逐层二阶补偿与层间联合优化越不可省略。

6. QAT 与原生低比特训练:BitNet 革命

6.1 QAT 基本机制

QAT 在训练/微调的前向中插入伪量化节点(round 不可导,反向用 STE 直通估计器 ∂ Q / ∂ x ≈ 1 \partial Q/\partial x \approx 1 ∂Q/∂x≈1),让模型"学会在噪声中生存"。

  • LLM-QAT(Meta,ICLR 2024) :大模型 QAT 开山之作。两大创新:① 无数据蒸馏------用教师模型自己生成的文本做训练信号,无需原始训练语料即可把 LLaMA 压到 W4A4KV4;② 首次把 KV Cache 纳入 QAT。低比特下显著优于 PTQ;
  • EfficientQAT(2024):把"块重构"与"端到端蒸馏"分层解耦(Tier-1/Tier-2 训练),用极小算力达到 LLM-QAT 级效果,使 QAT 平民化;
  • 工具链:TorchAO/torchtune 已把 QAT 做成一行 API,与 LoRA 结合(QAT+LoRA)成为 2025 年后端侧模型的常见配方。
6.2 BitNet:从"训练后压"到"天生就是 1.58-bit"

定义 :BitNet b1.58(微软研究院,2024)是权重仅取 { − 1 , 0 , + 1 } \{-1, 0, +1\} {−1,0,+1} 三值(每参数平均 log ⁡ 2 3 ≈ 1.58 \log_2 3 \approx 1.58 log23≈1.58 bit)、激活 INT8(W1.58A8)的原生预训练架构,而非训练后量化的产物。

技术要点:

  • BitLinear :权重三值化(absmean 量化)+ 激活 int8 absmax 量化,配合均值中心化(weight/activation mean-centering)稳定训练;
  • 与同规模 FP16 LLaMA 相比,困惑度与下游任务持平甚至更好,同时能耗降低、内存缩小 ~10×;
  • 矩阵乘法退化为加减与移位------这是"计算范式"级别的改变,而非精度妥协。

产业落地时间线(2025--2026 是 BitNet 从论文走向生产的两年):

时间 事件 意义
2024.02 BitNet b1.58 论文 证明 1.58-bit 预训练可行
2024.10 BitNet a4.8 激活降至 4-bit(absmax 动态量化),进一步降算力
2025.04 BitNet b1.58 2B4T 开源 (2B 参数/4T token)+ bitnet.cpp 推理框架 首个公开原生 1-bit LLM;CPU 上相对 llama.cpp 提速 2.65×、能耗降 55%--82%,2B 模型内存仅 ~0.4 GB
2025.10 BitDistill(微软) 用 FP16 教师(LLaMA 3.1-8B)蒸馏 1.58-bit 学生:部分基准超越 FP16 教师,内存省 10×、提速 2.65×、能耗降 ~73%------"蒸馏 + 原生低比特"成为免从零预训练的新配方
2026.05 BitCPM-CANN(面壁智能 × 清华 × OpenBMB,昇腾 KADC 2026 发布) 中国首个基于华为昇腾端到端训练并开源的三值大模型,任务能力保留率 >90%(最高 97.2%),验证国产算力全链路

判断 :BitNet 路线的真正意义不在"又一个量化技巧",而在于模型表示与硬件内核的协同设计------当权重是 ±1 时,CPU/NPU/ASIC 都不再需要乘法器。2026 年端侧 AI 的爆发(手机、眼镜、无 GPU 服务器)与此直接相关。

7. KV Cache 量化:长上下文时代的真正瓶颈

定义:KV Cache 量化是对注意力机制缓存的 Key/Value 张量做低比特压缩,以缓解显存与带宽压力的技术。

显存账本:每 token KV 占用 = 2 × L × H k v × d h e a d × bytes = 2 \times L \times H_{kv} \times d_{head} \times \text{bytes} =2×L×Hkv×dhead×bytes。以 7B(GQA,32 层,8 KV 头)为例,8K 上下文 KV Cache 已 ≈10 GB;30B 模型 batch=128、seq=1024 时 KV 高达 180 GB------在长上下文与高并发服务中,KV Cache 已超过权重成为第一内存瓶颈

技术演进:

方法 时间 核心机制 效果
KIVI(ICML 2024) 2024 免调优 2-bit:Key 逐通道、Value 逐 token 的非对称量化(源于 K 离群在通道维、V 离群在 token 维的分布规律) 峰值显存降 2.35--3.47×,batch 可放大 ~4×
KVQuant(NeurIPS 2024) 2024 per-channel key 量化 + 非均匀量化 + dense-and-sparse 离群分离 + 量化后校准 3-bit 下 128k 上下文 PPL 增量 <0.1
离群 token 追踪(ACL 2025,华为云) 2025 定位并特殊处理少数离群 token 的 KV 高精度 KV 量化
TurboQuant (Google Research,arXiv 2025.04,ICLR 2026 2026.03 引爆关注 在线向量量化,逼近理论最优失真率(near-optimal distortion rate),免训练、免校准 长上下文 KV 内存压缩 ~6× 级别;2026 年 3 月官方博客发布当日引发存储板块股票波动------足见业界对 KV 压缩经济价值的定价
OSCAR(2026.06) 2026 离线谱协方差感知旋转(spectral covariance-aware rotation)后的真 2-bit KV,SGLang 开箱集成 对标并超越 TurboQuant 的 2-bit 系统级方案
压缩性感知训练(Oxford × NVIDIA,2026.06) 2026 Training Transformers for KV Cache Compressibility:训练阶段就让模型学会"可压缩的记忆" 代表趋势:从"事后压缩"走向"天生可压缩"

实践要点 :K/V 分布特性不同,务必用非对称粒度;KV 量化与 KV 逐出(H2O、SnapKV 等 token 淘汰)正交可叠加------先逐出冗余 token、再量化保留 token 是 2026 年长上下文服务的标准组合拳。

8. 内核、格式与推理框架生态

行业共识:量化算法只占一半,内核优化才是决胜关键。

8.1 内核层
  • Marlin(IST-DASLab):W4A16 混合精度 GEMM 的里程碑内核------异步流水线、双缓冲流水、L2 感知的分块,使 4-bit 权重在 batch=1--32 全区间接近理想加速(相对 FP16 ≈3.8×,GEMM 层面)。vLLM 中 GPTQ/AWQ 默认走 Marlin 变体;
  • FP8 内核:Hopper/Blackwell 原生 FP8 Tensor Core,TensorRT-LLM/vLLM 提供 FP8 权重+动态激活量化,几乎是"免费"的 2× 吞吐(精度损失通常 <1%);
  • NVFP4 内核:Blackwell 的 block-scaled GEMM(FP32 累加、BF16 输出保数值稳定),配合 TensorRT Model Optimizer 的 QAT/PTQ 管线;
  • 稀疏内核:NVIDIA 2:4 Tensor Core(2× 稀疏 GEMM)、Neural Magic DeepSparse(CPU 上按块稀疏执行,50% 稀疏 BERT 级模型 ~1.8× 加速)。
8.2 格式生态
格式 归属 特点
GGUF llama.cpp CPU/Apple/混合推理事实标准。丰富的量化类型:Q4_0/Q4_1、K-quants(Q4_K_M 混合 ≈4.83 bit,精度-体积最佳平衡)、i-quants(IQ2_XXS/IQ2_XS,2-bit 超块量化);量化依赖 imatrix 校准
safetensors + 量化 config HF GPTQ/AWQ/Fp8 的存储载体,GPU 生态通用
EXL2 ExLlamaV2 混合 bpw:按层敏感度分配不同位宽(如注意力层 5-bit、MLP 3-bit),同体积精度最优之一
MLX 量化 Apple Apple Silicon 端侧 4/8-bit
bitsandbytes NF4 HF QLoRA 微调专用(NF4 + 双重量化 + 分页优化器)
8.3 框架支持矩阵(2026-08)
框架 GPTQ AWQ FP8 INT4 FP4 稀疏 场景
vLLM / SGLang ✅(Marlin) ✅(Marlin) 部分 云端高并发服务
TensorRT-LLM ✅ NVFP4 2:4 极致延迟、企业级
llama.cpp / Ollama GGUF 全系 --- --- --- --- CPU/端侧/混合
torchao ✅ GPTQ/HQQ --- --- PyTorch 原生研究/训练侧
bitnet.cpp --- --- --- 三值专用 --- CPU 原生 1.58-bit

9. 量化工程实战

校准三要素 :数据(128--512 条,C4/Pile/RedPajama,务必贴近目标域)、长度(覆盖实际上下文,2048+)、评估(PPL + 下游任务双轨,见第 17 节)。

bash 复制代码
# ① AWQ 量化(AutoAWQ)------生产甜点
from awq import AutoAWQForCausalLM
model = AutoAWQForCausalLM.from_pretrained("meta-llama/Llama-3.1-70B")
model.quantize(tokenizer, quant_config={"w_bit": 4, "q_group_size": 128, "zero_point": True})
model.save_quantized("Llama-3.1-70B-AWQ")

# ② GPTQ 量化(AutoGPTQ / llmcompressor)
from transformers import AutoModelForCausalLM
from llmcompressor.modifiers.quantization import GPTQModifier
recipe = GPTQModifier(targets="Linear", scheme="W4A16", ignore=["lm_head"])
# oneshot(model=model, dataset=calib, recipe=recipe)

# ③ vLLM 部署(自动选择 Marlin 内核)
# vllm serve Llama-3.1-70B-AWQ --quantization awq_marlin --max-model-len 32768

# ④ llama.cpp 量化(CPU/端侧)
# ./llama-quantize model-f16.gguf model-Q4_K_M.gguf Q4_K_M

# ⑤ QAT + LoRA(torchAO/torchtune 风格)
from torchao.quantization import quantize_, Int8DynActInt4WeightLinearQuantizer
# 先 QAT 伪量化微调 → 再真实量化导出

第 II 部分 · 剪枝

10. 剪枝基础:稀疏性从何而来

定义:剪枝(Pruning)是通过识别并移除模型中不重要或冗余的权重、神经元、层乃至整个结构,以减小体积与计算量的技术。

三种粒度决定三种命运:

类型 对象 硬件红利 精度风险 现状
非结构化 单个权重置零 需稀疏算子(2:4/DeepSparse),通用 GPU 上常常不加速 高(>50% 后陡降) 研究价值 > 部署价值
半结构化 2:4 每 4 个权重剪 2 个 Ampere+ Tensor Core 原生 2× 与量化叠加有实用价值
结构化 头/通道/层/专家整体删除 直接变快,无需特殊内核 中-高,可恢复 工业主流(造小模型)

重要性度量谱系:幅值 ∣ W i j ∣ |W_{ij}| ∣Wij∣(Mag)→ 梯度/运动量(IMP)→ Hessian(OBS/SparseGPT)→ 激活感知 ∣ W i j ∣ ⋅ ∥ X : , j ∥ |W_{ij}|\cdot\|X_{:,j}\| ∣Wij∣⋅∥X:,j∥(Wanda) → 层间冗余度(ShortGPT BI)。历史再次押韵:1.3 节的误差加权公式,既是 AWQ 的起点,也是 Wanda 的起点。

11. 一次性非结构化剪枝:SparseGPT 与 Wanda

11.1 SparseGPT(ICML 2023):把 OBS 搬上千亿参数

与 GPTQ 同源(同一作者群、同一年、同一数学骨架------剪枝与量化在二阶方法上本是同根生):逐块求解

arg ⁡ min ⁡ W ^ ∥ W X − W ^ X ∥ F 2 s.t. 被剪位置为 0 \arg\min_{\hat{W}} \|WX - \hat{W}X\|_F^2 \quad \text{s.t. 被剪位置为 0} argW^min∥WX−W^X∥F2s.t. 被剪位置为 0

剪掉某权重后,用 Hessian 逆把误差补偿到剩余权重。成就:OPT-175B/BLOOM-176B 在完全不微调的情况下一次性剪到 50%--60% 稀疏度,困惑度损失极小------证明超大模型存在惊人冗余。

11.2 Wanda(ICLR 2024):一行公式击败二阶方法

W eights AND A ctivations 的判据简单到惊人------按行剪除 ∣ W i j ∣ ⋅ ∥ X : , j ∥ 2 |W_{ij}| \cdot \|X_{:,j}\|_2 ∣Wij∣⋅∥X:,j∥2 最小者:

  • 不做任何权重更新、不需要微调,单 GPU 小时级完成 LLaMA-7B;
  • 在零样本任务上系统优于 SparseGPT;稀疏掩码可直接迁移到不同上下文长度。
11.3 变体与组合
  • LoRAPrune(2023):先 LoRA 微调再剪,用 LoRA 梯度指导重要性;
  • RIA(2024):跨行相对重要性比较,改善逐行独立剪枝的尺度偏差;
  • 二阶免更新变体(2026 arXiv 持续涌现):在受限设定下超越激活感知基线;
  • 剪枝+量化级联:Wanda 稀疏掩码 + AWQ/GPTQ 量化,配合稀疏 Marlin 类内核,在 batch=1 解码上可叠加收益。

清醒认知:非结构化剪枝在通用 GPU 上难以兑现加速(稀疏 GEMM 效率低),其真正价值在于:① 理解模型冗余的科学工具;② 与 2:4 硬件/专用内核结合的 niche 场景;③ 作为结构化剪枝前的"探路"。

12. 结构化剪枝:宽度、深度与注意力头

12.1 宽度剪枝
  • LLM-Pruner(NeurIPS 2023) :用依赖图 识别结构耦合组(保证剪完仍是合法网络),梯度重要性排序 + LoRA 恢复微调。LLaMA-7B 剪 20% 仅需 ~3 小时恢复;后续工作将其推到 50% 压缩;
  • Sheared-LLaMA(ICLR 2024) :把 LLaMA-2 定向剪成 1.3B/2.7B(同时剪头、维度、层、中间层),配合动态批加载 (按域损失分配数据)继续预训练。仅需从头训练 ~3% 的算力,超越同规模从头训练模型------"大模型剪出小模型"路线的奠基之作。
12.2 深度剪枝(层剪枝)
  • ShortGPT(2024) :提出 Block Influence(BI) 度量 BI l = ∥ x l − x l + 1 ∥ \text{BI}l = \|x_l - x{l+1}\| BIl=∥xl−xl+1∥------输入输出越相似的层越冗余。13B 模型可移除最多 ~25% 的层而困惑度损失很小;
  • 层相似度视角:相邻层输入输出余弦相似度高 → 残差分支近似恒等映射 → 可安全删除。中间层(尤其中后部)冗余最高,首尾层绝不可动;
  • LaCo(2024):不删层而是"坍缩层"------把相邻层经残差 shortcut 合并,保持序列维度兼容,可迭代进行。
12.3 注意力头剪枝与架构回声

按头对损失的贡献度剪除冗余头。有趣的是,GQA/MQA 本质上是架构级的头剪枝------KV 头数从 32 减到 8/1,正是"结构化剪枝思想被写进架构"的明证;MLA(DeepSeek)则把 KV 本身低秩压缩。架构进化与剪枝研究在这里合流。

12.4 SliceGPT(ICLR 2024):切片式宽度剪枝

利用计算不变性 (残差结构允许吸收正交变换):对权重做 PCA/正交分解后,直接切掉行/列的一部分。无需重训即可在 OPT/LLaMA 上删 20%+ 参数且困惑度损失极小,且剪后网络保持稠密------天然硬件友好。

13. 剪枝 + 蒸馏:Minitron 范式与"大模型造小模型"

定义:Minitron 是 NVIDIA(2024)提出的"结构化剪枝 + 知识蒸馏"小模型制造流水线:先用激活/重要性度量做深度与宽度剪枝,再用教师 logits 蒸馏 + 少量数据再训练恢复精度。

战绩:

  • Llama 3.1 8B → Minitron-4B / Minitron-1B;Nemotron-4 15B → Minitron-8B/4B;
  • 相比从头训练,训练算力节省高达 40×,同尺寸下基准(MMLU 等)最强;
  • 衍生 Nemotron-Mini-4B-Instruct(面向 RAG/函数调用/端侧)。

为什么这个范式在 2025--2026 成为大厂标配

  1. 小模型(1B--8B)需求爆发(端侧、Agent 低成本路由、蒸馏数据生成);
  2. 从头训练小模型的算力/数据成本仍然高昂,而剪枝+蒸馏复用了大模型的全部预训练投资;
  3. 与量化正交可叠加:Minitron-4B 再 INT4/NVFP4 量化,端侧全链路打通。

完整配方(当前工业最佳实践):

复制代码
大教师模型(≥70B 或自有旗舰)
   → 结构化剪枝(深度优先:BI 选层;宽度:激活重要性选头/通道)
   → 蒸馏再训练(教师 logits KL + 少量高质量语料,算力 ≈ 从头训练的 2--5%)
   → 量化(AWQ/NVFP4)
   → 端侧/边缘部署

14. MoE 与半结构化:架构级稀疏

  • MoE = 动态结构化剪枝 :每 token 只激活 2%--3% 参数(如 GPT-4 传闻 1.8T 总参、每 token 激活 ~37B)。注意常见误读------激活参数少≠等效小稠密模型:所有专家权重仍需驻留内存,MoE 省的是 FLOPs 与延迟,不是内存。这正是"量化(省内存)× MoE(省算力)"天然互补的原因;
  • 专家剪枝/合并(2024--2025):按路由频率或功能相似度删除/合并冗余专家,进一步压缩 MoE 部署体积;
  • 2:4 半结构化:NVIDIA Ampere 起硬件原生支持,常与 INT8/FP8 叠加获得 ~4× 综合收益,但 LLM 上 2:4 精度损失比 CNN 时代明显,通常需配合微调或感知性训练。

第 III 部分 · 融合与决策

15. 量化 × 剪枝 × 蒸馏的组合艺术

三大技术正交且可级联,但顺序有讲究:

组合 效果 注意事项
剪枝 → 恢复微调 → 量化 先物理瘦身再压比特,压缩率相乘 恢复训练后再做 PTQ,避免二次损伤叠加
Wanda 稀疏 + GPTQ/AWQ 同一 Hessian/激活感知框架下联合求解 需稀疏量化内核支持(如稀疏 Marlin)
Minitron(剪枝+蒸馏)→ INT4/FP4 小模型 + 低比特 = 端侧全链路 蒸馏阶段可直接用量化感知目标(QAT-aware distillation)
量化 + KV 量化 + 投机解码 权重、缓存、解码三战场同时优化 小 draft 模型可更激进量化
BitDistill 式蒸馏 → 原生三值 跳过从零预训练,直达 1.58-bit 需 BitNet 架构支持

反面教训:不要在没有恢复训练的情况下叠加多重激进压缩------乘性误差(第 5.3 节)会让长尾能力(数学、代码、工具调用)先于 PPL 崩溃。

16. 选型决策矩阵(2026-08 版)

场景 首选方案 次选/叠加 理由
云端高吞吐服务(H100/H200) FP8 W8A8 + KV INT8/FP8 投机解码 近免费精度换 2× 吞吐
云端极致吞吐(B200) NVFP4/MXFP4(QAT 校准)+ 2-bit KV(OSCAR/KIVI) 长上下文逐出 Blackwell 原生算力
单卡消费级(24 GB) AWQ W4A16 + Marlin EXL2 混合 bpw 精度-速度-生态最佳平衡
极限单卡(70B→24 GB) QuIP#/AQLM 2-bit i-quants GGUF 向量量化唯一可行
CPU/无 GPU 边缘 GGUF Q4_K_M (llama.cpp)或 BitNet b1.58 + bitnet.cpp MLX(Apple) CPU 友好,三值权重免乘法
自研小模型(1B--8B) Minitron:剪枝+蒸馏 再 QAT/NVFP4 40× 算力节省
微调场景显存不足 QLoRA(NF4) QAT+LoRA 训练侧事实标准
长上下文 RAG 服务 KIVI/TurboQuant 类 KV 量化 SnapKV 逐出 KV 是第一瓶颈

17. 评估方法论与深坑清单

评估三层金字塔

  1. 困惑度(PPL):廉价灵敏,但只测分布拟合,会漏掉能力退化;
  2. 标准基准(MMLU/GSM8K/HumanEval 等):必测,但注意校准集泄漏与基准饱和;
  3. 业务长尾 :工具调用、多轮指令遵循、代码执行成功率------量化损伤最先出现在这里。社区实测显示:4-bit 量化的模型在复杂推理与 tool calling 上可能明显降级,本地 Agent 场景建议 ≥5--6 bit 或选择 BitDistill/QAT 级产物。

深坑清单

  1. 校准集偏置:用英文维基百科校准、部署中文客服 → 显著掉点。校准数据必须代表生产流量;
  2. 只看均值不看方差:PPL 平均掉 0.1 可能掩盖特定领域掉 2.0;
  3. lm_head/embedding 量化:几乎总是应该保持高精度(ignore list);
  4. KV 量化与权重量化独立评估:二者损伤叠加非加性;
  5. 忽略 prefill/decode 差异:W4A16 提速 decode 但不提速 prefill,长 prompt 场景要配 FP8;
  6. 格式 ≠ 精度:同为"4-bit",Q4_K_M、EXL2 4.0bpw、AWQ g128 的精度差异可达 1 个 PPL;
  7. 温度/采样交互:低比特模型的采样分布更尖锐,评测时保持与基线相同的解码配置。

18. 前沿展望(2026 → 2028)

  1. 原生低比特成为一等公民:BitNet 路线 + BitDistill 式蒸馏 + 昇腾/ARM/国产 NPU 的协同落地(BitCPM-CANN 已证明全链路可行),"乘法器消失"的 CPU 时代正在到来;
  2. FP4/NVFP4 标准化竞速:OCP MX 格式与 NVIDIA 私有格式的生态博弈,训练侧 FP4(微软框架、SageAttention3)将从推理扩展到预训练;
  3. 压缩性感知预训练:TurboQuant/Oxford-NVIDIA 路线预示"训练时就为 KV/权重可压缩而设计"将成为下一代架构的默认目标,而非事后补救;
  4. 量化理论的成熟:乘性损伤模型(2026.08)将催生更精细的逐层比特分配理论,混合位宽分配从启发式走向最优化;
  5. 自动化压缩:AlphaEvolve 类演化搜索 + LLM 自动设计量化/剪枝策略的初步尝试已出现,压缩方案本身正在被 AI 优化;
  6. 剪枝的第二次复兴:随着推理成本占模型全生命周期 60%--75% 成为共识,"大模型→剪枝+蒸馏→专用小模型"将取代部分从头训练需求,深度冗余(层剪枝)与 MoE 专家剪枝是最富矿的两处。

19. FAQ:高频问题直达

Q1:GPTQ 和 AWQ 怎么选?

A:追极限精度选 GPTQ(二阶补偿更精细);生产部署选 AWQ------分钟级完成、对数据分布漂移更鲁棒,配合 Marlin 内核速度最优。截至 2026 年,AWQ 是云端 4-bit 部署的事实标准。

Q2:为什么 70B 模型量化成 4-bit 就能塞进单张 24GB 显卡?

A: 70 × 10 9 × 0.5 B ≈ 35 GB + scale 开销 ≈ 36 -- 38 GB 70 \times 10^9 \times 0.5\text{B} \approx 35\text{ GB} + \text{scale 开销} \approx 36\text{--}38\text{ GB} 70×109×0.5B≈35 GB+scale 开销≈36--38 GB,仍超 24 GB;实际常见做法是 W4 + offload 或双卡。单卡 24 GB 跑 70B 需要 2-bit(QuIP#/AQLM ≈18 GB)或 EXL2 低 bpw 混合。网传"24 GB 跑千亿"指 MoE 激活参数或极限 i-quants,需甄别。

Q3:INT4 和 FP8 哪个更好?

A:维度不同。INT4(W4A16)是权重存储 格式,优化内存带宽,适合小 batch decode;FP8 是计算格式,优化 FLOPs,适合大 batch 与 prefill。数据中心常见组合:FP8 激活 × 低比特权重。

Q4:量化后模型"变笨"了,是错觉吗?

A:不是。低于 4-bit 时损伤沿层乘性放大(见 5.3),最先牺牲的是长尾能力(数学、工具调用、长链推理)。对策:提升比特、换 QAT/BitDistill 产物、或对该能力做量化后 LoRA 恢复。

Q5:剪枝为什么没有量化流行?

A:非结构化剪枝在通用 GPU 上兑不了速度(稀疏算子效率低),结构化剪枝又必须再训练。直到 Minitron 范式把剪枝重新定位为"制造小模型的廉价路径",以及层/KV 冗余裁剪在长上下文场景变现,剪枝才重新具备工业价值。

Q6:KV Cache 量化从哪下手?

A:免调优直接用 KIVI(2-bit,K 逐通道/V 逐 token);追求极限看 TurboQuant/OSCAR;同时叠加 SnapKV 类逐出。长上下文服务中这通常比权重量化收益更大。

Q7:QLoRA 的 NF4 能直接用于部署吗?

A:NF4 是训练期内存格式,推理生态支持弱。微调后建议反量化再走 AWQ/GPTQ 标准流程。

Q8:BitNet 1.58-bit 模型能替代 FP16 模型吗?

A:在 2B--3B 规模,BitNet b1.58 2B4T 已达到同规模 FP16 LLaMA 的水平且能耗/内存优势巨大;但当前模型矩阵小、多语言支持有限、不适合 GPU 大 batch 高吞吐场景------它是端侧与 CPU 时代的答案,不是云端的答案。

Q9:压缩顺序的最佳实践?

A:(若剪枝)结构化剪枝 → 蒸馏/恢复训练 → 权重量化 → KV 量化 → 内核选择。每步之间都要过完整评估闸门。

Q10:2026 年最值得跟进的三件事?

A:① NVFP4/MXFP4 在 Blackwell 上的生态成熟度;② TurboQuant 系 2-bit KV 量化的服务化集成;③ BitNet 系原生三值模型的硬件协同(尤其国产算力)。

20. 参考文献(按主题分组)

量化基础与 PTQ :Frantar et al., GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers , ICLR 2023 | Lin et al., AWQ: Activation-aware Weight Quantization , MLSys 2024 | Xiao et al., SmoothQuant , ICML 2023 | Dettmers et al., LLM.int8() , NeurIPS 2022 | Kim et al., SqueezeLLM , ICML 2024 | Shao et al., OmniQuant , ICLR 2024 | Badri & Shaji, HQQ, 2023

旋转与极低比特 :Chee et al., QuIP , NeurIPS 2023 | Tseng et al., QuIP# , 2024 | Egiazarian et al., AQLM , ICML 2024 | Ashkboos et al., QuaRot , 2024 | Liu et al., SpinQuant , 2024 | Quantization Damage Is Multiplicative, Not Additive, arXiv cs.LG, 2026-08

QAT 与原生低比特 :Liu et al., LLM-QAT , ICLR 2024 | EfficientQAT , 2024 | Ma et al., The Era of 1-bit LLMs (BitNet b1.58) , 2024;BitNet , JMLR 26(125), 2025 | BitNet b1.58 2B4T & bitnet.cpp , Microsoft, 2025-04 | BitDistill , Microsoft, 2025-10 | BitCPM-CANN, 面壁智能/清华/OpenBMB, 昇腾 KADC, 2026-05

KV Cache :Liu et al., KIVI , ICML 2024 | Hooper et al., KVQuant , NeurIPS 2024 | Zandev et al., TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate , arXiv:2504.19874, ICLR 2026 | OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache , 2026 | Training Transformers for KV Cache Compressibility, Oxford × NVIDIA, 2026

格式与硬件 :NVIDIA/ARM/Intel, FP8 Format Standardization , 2022 | OCP, Microscaling (MX) Formats Specification , 2023 | NVIDIA, Introducing NVFP4 for Efficient and Accurate Low-Precision Inference , 2025 | NVIDIA, MLPerf Inference v4.1 Blackwell Results , 2024 | Frantar et al., Marlin: Mixed-Precision GEMM Kernel, IST-DASLab

剪枝 :Frantar & Alistarh, SparseGPT , ICML 2023 | Sun et al., Wanda: Pruning by Weights and Activations , ICLR 2024 | Ma et al., LLM-Pruner , NeurIPS 2023 | Xia et al., Sheared-LLaMA , ICLR 2024 | Men et al., ShortGPT: Layers in LLMs are More Redundant Than You Expect , 2024 | Ashkboos et al., SliceGPT , ICLR 2024 | LaCo: Layer Collapse , 2024 | Muralidharan et al., Compact Language Models via Pruning and Knowledge Distillation (Minitron) , NVIDIA, 2024 | Dettmers et al., QLoRA, NeurIPS 2023

综述 :Chen et al., A Survey of Quantization in LLM: Unlocking Potential Hardware Efficiency , JCST, 2026 | Zhang et al., A Survey of Low-bit Large Language Models: Basics, Systems, and Algorithms, arXiv:2409.16694


写在最后 :从 2022 年 LLM.int8() 与离群值的初次遭遇,到 2023 年 GPTQ/AWQ/SparseGPT/Wanda 的四箭齐发,到 2024 年旋转范式与 2-bit 向量量化,再到 2025--2026 年 BitNet 原生三值、NVFP4 硬件原生与 TurboQuant 引爆的 KV 革命------模型压缩的十年演进揭示了一条清晰的主线:真正的突破从不发生在"压得更狠",而发生在"算法、格式、内核、硬件、训练范式"五位一体的协同重构之中。 掌握这条主线,比记住任何单个方法的名字都重要。


本文最后更新于 2026-08-12。量化与剪枝领域迭代极快,建议每季度核对 NVFP4 生态、2-bit KV 服务化与 BitNet 硬件协同三个方向的最新进展。


相关推荐
XGeFei1 小时前
【AI应用/Agent智能体搭建平台2】Dify——自部署
人工智能·笔记·学习
hans汉斯1 小时前
《软件工程与应用》期刊推荐&10月版面征稿中
图像处理·人工智能·深度学习·算法·音视频·软件工程
前端开发江鸟1 小时前
为了实现“小说自由”,我搭了一套 AI 小说工作流,结果却不如回家种田
人工智能
叠层归一研究院1 小时前
AGI 系统(八):符号范畴嵌入函子 — SymCat ↪ C_M107 严格化
c语言·开发语言·人工智能·算法·transformer·agi
2601_964840271 小时前
4G云门禁普惠化技术实践:基于边缘计算破解成本、隐私、部署三大行业瓶颈
大数据·人工智能·边缘计算
祈禾1 小时前
Redis三大缓存问题与分布式锁
运维·数据库·redis·笔记·分布式·缓存
明朝百晓生2 小时前
Deep RL learning[2026/8]
开发语言·javascript·人工智能
具身智能进化论2 小时前
国产协作机器人品牌如何选择,企业长期使用更看重什么
大数据·人工智能·机器人·工厂方法模式
AKAMAI2 小时前
2026年Gartner Peer Insights 边缘分布平台客户之声将Akamai评为客户之选
人工智能·云计算
pjj198542 小时前
opencv-轮廓特征和轮廓近似
人工智能·opencv·计算机视觉