什么是前缀缓存,缓存命中

在使用deepseek V4时,我们会发现调用API时的价格描述中分为了缓存命中和未命中两类,那么什么是缓存命中呢?

1. 基本概念

前缀缓存(Prefix Caching / KV Cache Reuse)

大模型推理时,每个token都要计算Key和Value向量,存入KV Cache。当多次请求共享相同的输入前缀(如system prompt、few-shot示例),这些前缀对应的KV Cache可以被复用,不必重复计算。

缓存命中(Cache Hit)

当新请求的前缀与缓存中已有的前缀匹配时,称为"命中",直接加载已有的KV Cache,跳过这部分的计算。未匹配则"未命中"(Cache Miss),需要重新计算。

2. 工作原理

请求A: systemcontext问题A → 计算全部KV Cache

请求B: systemcontext问题Bsystemcontext部分命中,只计算问题B

关键细节:

  • 缓存以 1 分钟 TTL 过期,5 分钟内未被访问则失效

  • 前缀必须 从开头完全匹配,中间插入或修改任何 token 都会导致缓存断裂

  • 请求间前缀越长、越稳定,命中率越高

3. 典型应用场景

  • 多轮对话:每轮共享之前的对话历史

  • 批量推理:相同的system prompt + 不同问题

  • RAG系统:相同检索上下文 + 不同查询

  • Agent循环:同一prompt模板反复调用

相关推荐
doiito8 小时前
【AI 应用】从“外国人味”到地道中文:kokoroi-rs v0.1.2 架构升级深度解析
ai·rust·系统设计
吳所畏惧8 小时前
宝塔面板Redis密码修改指南:SSH命令修改 vs 面板UI界面修改,哪个更靠谱?
运维·服务器·数据库·redis·缓存·ssh
GPUStack9 小时前
怎么优雅地在GPUStack上使用minerU?
ai·大模型·llm·gpu·vllm·gpu集群·gpustack
CIO_Alliance12 小时前
企业AI化转型如何用AI+iPaaS实现降本增效?
人工智能·低代码·机器学习·ai·ipaas·系统集成·企业级ai化转型
小阿鑫13 小时前
一个 AI 应用开发程序员的一天,都在屏幕前忙些什么?
ai·程序员·agent·rd270q·明基rd270q
Y38153266213 小时前
SERP API + Redis 缓存层:4 种方案对比与选型
数据库·redis·缓存
我才是银古14 小时前
OpenCode × DeepSeek V4:多 Agent 上下文管理的两层优化实战
deepseek·ai平台·opencode·vibecodeing
猿的天空14 小时前
机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能
网络·人工智能·计算机·ai·程序员·机器人·编程
imbackneverdie15 小时前
知网官宣:禁止 AI 列为论文署名作者,标注 Gemini、DeepSeek 等 AI 为作者的稿件统一下架
大数据·人工智能·ai·职场和发展·aigc·科研·高校
海兰15 小时前
【高速缓存】RedisVL 高级查询(全文搜索、混合搜索和 多向量搜索)
数据库·人工智能·redis·缓存