技术栈

int4

thesky123456
3 小时前
大模型·模型量化·gptq·awq·kv cache·smoothquant·int4
27届大模型面试准备(十九):模型量化全攻略——INT8/INT4、GPTQ、AWQ、SmoothQuant 与 KV Cache 量化上一篇《LoRA 与 PEFT 全攻略》讲的是"怎么用最少的可训练参数把模型调好",属于训练侧省显存。这一篇转到部署侧的省显存主线——量化(Quantization)。它和第十五篇《高效推理全攻略》是一对:那篇讲的是"调度和算子怎么快",这篇讲的是"数字表示怎么小"。量化几乎是所有推理面试的必问题,因为它同时牵扯数值分析、硬件指令集和工程权衡三层。本文按"为什么要量化 → 量化的数学 → PTQ 三大流派(GPTQ / AWQ / SmoothQuant)→ QAT → KV Cache 量化 → 落地选
我是有底线的