技术栈

h2o 论文分享

白拾
5 小时前
大模型推理·高效推理·kv cache·稀疏注意力·h2o 论文分享·neurips 2023
【NeurIPS 2023】H2O:重型命中者预言机——大模型高效生成式推理的 KV Cache 驱逐策略|从大模型推理系统优化视角本文解读 NeurIPS 2023 论文《H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models》。该论文提出H2O(重型命中者预言机)KV Cache 驱逐策略,通过融合注意力稀疏性观测、累加注意力分数幂律分布与动态子模最大化理论,只保留重型命中者和最近 token,即可用 20% 的 KV 缓存预算实现 5–10 倍内存缩减、最高 29 倍吞吐提升,且精度与全缓存持平甚至反超。实验覆盖 O
我是有底线的