kv cache

I Am a robert girl8 天前
深度学习·模型部署·量化·kv cache·线性注意力·显存优化·循环状态
STEPQuant:Delta-Rule 循环状态量化中,误差何时何地才真正致命从今天觉醒,技术赋予每一个人数字生命当你把一个聊天模型部署成服务时,最先撞上的墙往往不是算力,而是显存。传统 Transformer 的注意力机制需要一个随序列长度线性增长的 KV Cache——上下文越长,缓存越大。线性注意力(Linear Attention)及其变体用固定大小的**循环状态(recurrent state)**替代了这份不断膨胀的缓存,把内存占用从 O(n) 压到 O(1),这在长上下文并发服务场景里几乎是救命稻草。
小马92610 天前
大模型·moe·kv cache·deepseek·推理优化·ai基础设施
KV Cache 瘦身 437 倍:DeepSeek V4.1-Flash 的推理效率革命2026 年 9 月,大模型行业迎来史上最密集的发布季:OpenAI、Anthropic、Google、xAI 接连甩出旗舰模型。但比"谁又刷了榜"更值得关注的是评价标准的换轨——从裸跑分转向"单位成本下的交付能力"。在这一轮竞赛中,DeepSeek 用一款 V4.1-Flash 给出了自己的答案:不堆参数、不打嘴仗,而是在推理效率和显存占用上做了一次教科书级的手术。
Together_CZ19 天前
缓存·llm·compression·kv cache·deepseek·v4.1-flash·推动 kv 缓存压缩的极限
DeepSeek-V4.1-Flash:Pushing the Limits of KV Cache Compression——推动 KV 缓存压缩的极限长时程智能体(long-horizon agents)的广泛应用,使模型工作负载越来越“输入密集”。虽然稀疏注意力等先前工作已经大幅降低了长上下文计算成本,但真正的瓶颈转移到了:
晨欣1 个月前
qwen·moe·gqa·kv cache·deepseek·mla·llm架构
LLM Architecture Gallery 是什么:新开源模型出来后,先对照架构再决定要不要部署新开源模型一出来,开发者最容易先去看跑分、看参数量、看别人说好不好用。但真正决定你能不能部署、长上下文贵不贵、MoE 是否划算的,往往是结构本身。Sebastian Raschka 做的 LLM Architecture Gallery 把 100 多个现代 LLM 的结构图、注意力机制、decoder 类型、每 token KV cache 和 config.json 链接放到同一页,适合当作日常对照表,而不是又一个榜单。
weixin_440213291 个月前
微调·数据集·sft·预训练·模型量化·gptq·kv cache
大模型训练、微调、对齐、推理、量化、优化、数据集等本文汇总了大模型从预训练、持续预训练、后训练微调、RLHF对齐、主动学习、注意力优化、KV缓存、量化、归一化、数据集范式、评测体系等知识。
weixin_440213292 个月前
vllm·大模型推理·decode·kv cache·prefill·llm 部署
大模型推理核心原理:KV Cache、Prefill、Decode、TTFT、vLLM、算子在大模型落地部署、推理优化中,KV Cache、Prefill/Decode、TTFT/TPOT、GPU算子、vLLM 是一套高度关联的核心体系。本文将系统性地讲解大模型自回归推理的核心原理、推理阶段特性、性能瓶颈与工程优化方案,梳理完整的底层落地逻辑。
thesky1234562 个月前
大模型·注意力机制·mha·gqa·mqa·kv cache·mla
27届大模型面试准备(三十六):注意力机制演进与 KV Cache 优化——从 MHA 到 MLA 的显存之战本篇是 A 系列第 36 篇(A12–A35 已覆盖 RAG、长上下文、VLM、高效推理、后训练、分布式训练、LoRA、量化、评测、MoE、推理时扩展、数据工程、位置编码、推理服务化、幻觉、蒸馏、安全、长文本推理、推理优化、多模态推理、RAG 进阶、解码策略、端侧部署、小模型蒸馏)。A29 讲了高效注意力(FlashAttention、稀疏、线性注意力),A30 讲了推理性能优化全栈。本文聚焦推理侧最贵的那块内存——KV Cache,从注意力机制的演进(MHA→MQA→GQA→MLA)一路讲到 KV Ca
白拾2 个月前
大模型推理·高效推理·kv cache·稀疏注意力·h2o 论文分享·neurips 2023
【NeurIPS 2023】H2O:重型命中者预言机——大模型高效生成式推理的 KV Cache 驱逐策略|从大模型推理系统优化视角本文解读 NeurIPS 2023 论文《H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models》。该论文提出H2O(重型命中者预言机)KV Cache 驱逐策略,通过融合注意力稀疏性观测、累加注意力分数幂律分布与动态子模最大化理论,只保留重型命中者和最近 token,即可用 20% 的 KV 缓存预算实现 5–10 倍内存缩减、最高 29 倍吞吐提升,且精度与全缓存持平甚至反超。实验覆盖 O
thesky1234562 个月前
大模型·模型量化·gptq·awq·kv cache·smoothquant·int4
27届大模型面试准备(十九):模型量化全攻略——INT8/INT4、GPTQ、AWQ、SmoothQuant 与 KV Cache 量化上一篇《LoRA 与 PEFT 全攻略》讲的是"怎么用最少的可训练参数把模型调好",属于训练侧省显存。这一篇转到部署侧的省显存主线——量化(Quantization)。它和第十五篇《高效推理全攻略》是一对:那篇讲的是"调度和算子怎么快",这篇讲的是"数字表示怎么小"。量化几乎是所有推理面试的必问题,因为它同时牵扯数值分析、硬件指令集和工程权衡三层。本文按"为什么要量化 → 量化的数学 → PTQ 三大流派(GPTQ / AWQ / SmoothQuant)→ QAT → KV Cache 量化 → 落地选
Token炼金师3 个月前
人工智能·系统架构·llm·负载均衡·容灾·kv cache·prefix cache
服务的骨架:网关、负载均衡、容灾、弹性与多机房 —— 推理系统架构五柱推理系统架构决定服务可用性与扩展性。本文从网关设计、负载均衡策略、高可用容灾、弹性伸缩、多机房部署五个切口,给出源码级实现与企业级推理服务架构决策框架。
Token炼金师3 个月前
人工智能·深度学习·大模型架构·kv cache·scaling laws
幂律的预言:Kaplan 与 Chinchilla 的算力账本 —— Scaling Laws 与最优配比Scaling Laws 揭示大模型损失随参数、数据、算力的幂律关系,是预训练资源规划的基石。本文从 Kaplan 与 Chinchilla 两大定律的数学形式、争议根源、最优配比、涌现现象、μP 跨尺度迁移五个切口,给出源码级拟合实现与企业级算力规划决策框架。
Soonyang Zhang4 个月前
vllm·推理框架·kv cache
vllm分析(八)——deepseek v4 Attention (SWA + CSA + HCA)DeepseekV4Attention DeepseekV4MultiHeadLatentAttentionWrapper
Soonyang Zhang4 个月前
推理框架·kv cache
FlexKV 分析(三)——缓存的异步读写操作KVTaskEngine 继承自 KVTaskManager,负责管理 KV 缓存的异步读写操作。 KVTaskEngine 中实现的缓存操作相关接口:
zyw20024 个月前
kv cache
KV Cache 详解KV Cache(键值缓存)是 Transformer 解码器在自回归推理阶段普遍采用的一种工程优化。它通过缓存每一层注意力计算中历史 token 的 Key 和 Value 矩阵,避免每一步都重复计算,显著降低推理延迟,是 LLM 高性能服务的基础组件。
AI精钢5 个月前
大模型·llm推理·kv cache·deepseek·ai工程
DeepSeek KV Cache 入门解读:98% 命中率背后的工程逻辑最近 Reddit 上有一个帖子引发了不少关注:一位开发者用 Claude 的 developer mode 对接 DeepSeek API 做 Web 开发,单日消耗了约 8900 万 tokens,总费用只有 4.39 元人民币(约 $0.64),缓存命中率高达 98.07%。
Luchang-Li6 个月前
kv cache
不同架构模型KV Cache大小计算kv cache采用BF16存储时,每个token KV cache大小:layer_num * 2 * head_num * head_dim *2
阿杰学AI6 个月前
人工智能·ai·语言模型·自然语言处理·aigc·kv cache·键值缓存
AI核心知识123—大语言模型之 KV CacheKV Cache (Key-Value Cache,键值缓存) 是大语言模型在推理(生成回答)阶段最核心的加速黑科技,同时也是吞噬显卡内存(VRAM)的头号杀手。
handsomestWei6 个月前
vllm·推理框架·kv cache·sglang
KV Cache与vLLM、SGLang推理框架全文链接 KV Cache与vLLM、SGLang推理框架本文介绍 KV Cache 在大模型推理中的地位与资源估算、vLLM 与 SGLang 的异同、二者对 KV Cache 的利用方式、使用策略与首字延迟的关系,以及基于两者部署小模型并进行对话验证的步骤。
lin_dec+6 个月前
nlp·transformer·vllm·大模型推理·kv cache
KV Cache:大模型推理加速的关键技术目录1、为什么需要 KV Cache?先搞懂大模型的文本生成模式2、不使用 KV Cache 时,到底有多少冗余计算?
一顿能吃五大海碗啊啊啊6 个月前
mha·gqa·mqa·kv cache
大模型推理加速 KV cache目录一、Attention 计算Attention 计算详解备注:1. Mask 的核心作用2. 两种主要的 Mask 类型