kv cache

weixin_440213292 天前
微调·数据集·sft·预训练·模型量化·gptq·kv cache
大模型训练、微调、对齐、推理、量化、优化、数据集等本文汇总了大模型从预训练、持续预训练、后训练微调、RLHF对齐、主动学习、注意力优化、KV缓存、量化、归一化、数据集范式、评测体系等知识。
weixin_440213297 天前
vllm·大模型推理·decode·kv cache·prefill·llm 部署
大模型推理核心原理:KV Cache、Prefill、Decode、TTFT、vLLM、算子在大模型落地部署、推理优化中,KV Cache、Prefill/Decode、TTFT/TPOT、GPU算子、vLLM 是一套高度关联的核心体系。本文将系统性地讲解大模型自回归推理的核心原理、推理阶段特性、性能瓶颈与工程优化方案,梳理完整的底层落地逻辑。
thesky12345614 天前
大模型·注意力机制·mha·gqa·mqa·kv cache·mla
27届大模型面试准备(三十六):注意力机制演进与 KV Cache 优化——从 MHA 到 MLA 的显存之战本篇是 A 系列第 36 篇(A12–A35 已覆盖 RAG、长上下文、VLM、高效推理、后训练、分布式训练、LoRA、量化、评测、MoE、推理时扩展、数据工程、位置编码、推理服务化、幻觉、蒸馏、安全、长文本推理、推理优化、多模态推理、RAG 进阶、解码策略、端侧部署、小模型蒸馏)。A29 讲了高效注意力(FlashAttention、稀疏、线性注意力),A30 讲了推理性能优化全栈。本文聚焦推理侧最贵的那块内存——KV Cache,从注意力机制的演进(MHA→MQA→GQA→MLA)一路讲到 KV Ca
白拾16 天前
大模型推理·高效推理·kv cache·稀疏注意力·h2o 论文分享·neurips 2023
【NeurIPS 2023】H2O:重型命中者预言机——大模型高效生成式推理的 KV Cache 驱逐策略|从大模型推理系统优化视角本文解读 NeurIPS 2023 论文《H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models》。该论文提出H2O(重型命中者预言机)KV Cache 驱逐策略,通过融合注意力稀疏性观测、累加注意力分数幂律分布与动态子模最大化理论,只保留重型命中者和最近 token,即可用 20% 的 KV 缓存预算实现 5–10 倍内存缩减、最高 29 倍吞吐提升,且精度与全缓存持平甚至反超。实验覆盖 O
thesky12345622 天前
大模型·模型量化·gptq·awq·kv cache·smoothquant·int4
27届大模型面试准备(十九):模型量化全攻略——INT8/INT4、GPTQ、AWQ、SmoothQuant 与 KV Cache 量化上一篇《LoRA 与 PEFT 全攻略》讲的是"怎么用最少的可训练参数把模型调好",属于训练侧省显存。这一篇转到部署侧的省显存主线——量化(Quantization)。它和第十五篇《高效推理全攻略》是一对:那篇讲的是"调度和算子怎么快",这篇讲的是"数字表示怎么小"。量化几乎是所有推理面试的必问题,因为它同时牵扯数值分析、硬件指令集和工程权衡三层。本文按"为什么要量化 → 量化的数学 → PTQ 三大流派(GPTQ / AWQ / SmoothQuant)→ QAT → KV Cache 量化 → 落地选
Token炼金师2 个月前
人工智能·系统架构·llm·负载均衡·容灾·kv cache·prefix cache
服务的骨架:网关、负载均衡、容灾、弹性与多机房 —— 推理系统架构五柱推理系统架构决定服务可用性与扩展性。本文从网关设计、负载均衡策略、高可用容灾、弹性伸缩、多机房部署五个切口,给出源码级实现与企业级推理服务架构决策框架。
Token炼金师2 个月前
人工智能·深度学习·大模型架构·kv cache·scaling laws
幂律的预言:Kaplan 与 Chinchilla 的算力账本 —— Scaling Laws 与最优配比Scaling Laws 揭示大模型损失随参数、数据、算力的幂律关系,是预训练资源规划的基石。本文从 Kaplan 与 Chinchilla 两大定律的数学形式、争议根源、最优配比、涌现现象、μP 跨尺度迁移五个切口,给出源码级拟合实现与企业级算力规划决策框架。
Soonyang Zhang3 个月前
vllm·推理框架·kv cache
vllm分析(八)——deepseek v4 Attention (SWA + CSA + HCA)DeepseekV4Attention DeepseekV4MultiHeadLatentAttentionWrapper
Soonyang Zhang3 个月前
推理框架·kv cache
FlexKV 分析(三)——缓存的异步读写操作KVTaskEngine 继承自 KVTaskManager,负责管理 KV 缓存的异步读写操作。 KVTaskEngine 中实现的缓存操作相关接口:
zyw20023 个月前
kv cache
KV Cache 详解KV Cache(键值缓存)是 Transformer 解码器在自回归推理阶段普遍采用的一种工程优化。它通过缓存每一层注意力计算中历史 token 的 Key 和 Value 矩阵,避免每一步都重复计算,显著降低推理延迟,是 LLM 高性能服务的基础组件。
AI精钢4 个月前
大模型·llm推理·kv cache·deepseek·ai工程
DeepSeek KV Cache 入门解读:98% 命中率背后的工程逻辑最近 Reddit 上有一个帖子引发了不少关注:一位开发者用 Claude 的 developer mode 对接 DeepSeek API 做 Web 开发,单日消耗了约 8900 万 tokens,总费用只有 4.39 元人民币(约 $0.64),缓存命中率高达 98.07%。
Luchang-Li4 个月前
kv cache
不同架构模型KV Cache大小计算kv cache采用BF16存储时,每个token KV cache大小:layer_num * 2 * head_num * head_dim *2
阿杰学AI4 个月前
人工智能·ai·语言模型·自然语言处理·aigc·kv cache·键值缓存
AI核心知识123—大语言模型之 KV CacheKV Cache (Key-Value Cache,键值缓存) 是大语言模型在推理(生成回答)阶段最核心的加速黑科技,同时也是吞噬显卡内存(VRAM)的头号杀手。
handsomestWei5 个月前
vllm·推理框架·kv cache·sglang
KV Cache与vLLM、SGLang推理框架全文链接 KV Cache与vLLM、SGLang推理框架本文介绍 KV Cache 在大模型推理中的地位与资源估算、vLLM 与 SGLang 的异同、二者对 KV Cache 的利用方式、使用策略与首字延迟的关系,以及基于两者部署小模型并进行对话验证的步骤。
lin_dec+5 个月前
nlp·transformer·vllm·大模型推理·kv cache
KV Cache:大模型推理加速的关键技术目录1、为什么需要 KV Cache?先搞懂大模型的文本生成模式2、不使用 KV Cache 时,到底有多少冗余计算?
一顿能吃五大海碗啊啊啊5 个月前
mha·gqa·mqa·kv cache
大模型推理加速 KV cache目录一、Attention 计算Attention 计算详解备注:1. Mask 的核心作用2. 两种主要的 Mask 类型
dawdo2227 个月前
缓存·llm·transformer·qwen·kv cache
自己动手从头开始编写LLM推理引擎(9)-KV缓存实现和优化在大语言模型的推理过程中,生成每个token都需要计算之前所有token的注意力权重。如果不使用缓存,每次生成都需要重新计算所有历史token的Key和Value,这会导致巨大的计算开销。KV缓存(Key-Value Cache)技术通过缓存历史token的K和V,在后续生成中只计算新token的K和V,从而大幅提升推理性能。
被制作时长两年半的个人练习生7 个月前
kv cache
KV Cache这里贴一张经典的图(ref:https://infrasys-ai.github.io/aiinfra-docs/05Infer02InferSpeedUp/01KVCache.html) 但我个人觉得这个图不能体现KV Cache减少计算的情况,因为看起来Attention的结果在前后也有优化,但实际上左边的Q也可以改成单个的,关键的是不需要重复计算K和V了。 数学推理参考https://datahonor.com/blog/2025/06/03/llm_kv_cache/
enjoy编程8 个月前
注意力机制·flashattention·kv cache·pd分离·pagedattention·epd分离·radixattention
Spring AI 大模型工程核心:效率的极限博弈大模型工程实践,本质是算力、显存与通信的极限优化。其核心在于四大支柱:总结:现代大模型工程已进化为“算子+并行+调度+缓存”的综合体系,掌握这些核心技术,是构建高性能、低成本服务的关键。
每天都要写算法(努力版)8 个月前
llm·vllm·kv cache
【混合注意力模型的 KV Cache 设计与统一管理实践解析】近年来,大模型结构快速演进,从传统自注意力(Standard Attention)走向更高效的混合注意力(Hybrid Attention)。例如: