稀疏注意力

白拾8 天前
大模型推理·高效推理·kv cache·稀疏注意力·h2o 论文分享·neurips 2023
【NeurIPS 2023】H2O:重型命中者预言机——大模型高效生成式推理的 KV Cache 驱逐策略|从大模型推理系统优化视角本文解读 NeurIPS 2023 论文《H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models》。该论文提出H2O(重型命中者预言机)KV Cache 驱逐策略,通过融合注意力稀疏性观测、累加注意力分数幂律分布与动态子模最大化理论,只保留重型命中者和最近 token,即可用 20% 的 KV 缓存预算实现 5–10 倍内存缩减、最高 29 倍吞吐提升,且精度与全缓存持平甚至反超。实验覆盖 O
thesky1234569 天前
大模型·面试准备·flashattention·推理优化·稀疏注意力·长文本推理·长度外推
27届大模型面试准备(二十九):长文本推理与高效注意力——FlashAttention、稀疏/线性注意力与推理侧长度外推前面我们讲过长上下文的"位置编码与长度外推"(A24,那是训练侧怎么让模型学会更长位置),也讲过推理服务化与投机解码(A25)。但把模型真正跑在 128K、甚至 1M token 的上下文上,最大的拦路虎不是"模型理不理解长序列",而是"注意力算不动、显存放不下、钱烧不起"。这一篇把视角切到推理工程:为什么注意力是长文本的成本黑洞,FlashAttention 凭什么把显存从 O(n²) 打到接近 O(n),稀疏与线性注意力又是怎么在效果和成本之间找平衡,以及当你手里只有一个短上下文模型时,推理侧能做哪些
minhuan7 个月前
滑动窗口·大模型应用·稀疏注意力·大模型扩窗技术
大模型应用:稀疏注意力 vs 滑动窗口:大模型扩窗技术完全解析.58我们应该也遇到过这样的情况,在和模型应用沟通的过程中,聊着聊着它就忘了开头的要求;或者让模型工具分析一本几百页的电子书,它只记住了最后几页的内容?我们也反复讨论过,这不是大模型记性差,而是它的注意力范围有限,原始的大模型注意力机制,看的文本越长,计算量就会像滚雪球一样爆炸式增长,普通电脑根本扛不住。
deephub1 年前
人工智能·深度学习·transformer·deepseek·稀疏注意力
NSA稀疏注意力深度解析:DeepSeek如何将Transformer复杂度从O(N²)降至线性,实现9倍训练加速当前人工智能模型在处理长序列任务时面临着根本性的计算瓶颈。无论是分析完整的法律文档、处理大型代码仓库,还是进行长篇对话,现有模型都受到Transformer架构中注意力机制的限制——其计算复杂度随序列长度呈二次增长(
我是有底线的