技术栈

flexgen 论文分享

白拾
3 小时前
系统优化·llm推理·高吞吐·量化压缩·flexgen 论文分享·模型卸载·icml 2023
【ICML 2023】FlexGen:单 GPU 上的大语言模型高吞吐生成推理|从大模型推理系统优化视角本文解读 ICML 2023 论文《FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU》。该论文提出 FlexGen 高吞吐生成推理引擎,通过融合GPU/CPU/磁盘三级内存聚合、线性规划卸载策略搜索与4-bit 权重与 KV cache 压缩,让 1750 亿参数的 OPT-175B 模型在一张 16GB 消费级显卡上完成高吞吐生成,其特别之处在于把「在哪存、何时算、谁来算」形式
我是有底线的