什么是前缀缓存,缓存命中

在使用deepseek V4时,我们会发现调用API时的价格描述中分为了缓存命中和未命中两类,那么什么是缓存命中呢?

1. 基本概念

前缀缓存(Prefix Caching / KV Cache Reuse)

大模型推理时,每个token都要计算Key和Value向量,存入KV Cache。当多次请求共享相同的输入前缀(如system prompt、few-shot示例),这些前缀对应的KV Cache可以被复用,不必重复计算。

缓存命中(Cache Hit)

当新请求的前缀与缓存中已有的前缀匹配时,称为"命中",直接加载已有的KV Cache,跳过这部分的计算。未匹配则"未命中"(Cache Miss),需要重新计算。

2. 工作原理

请求A: systemcontext问题A → 计算全部KV Cache

请求B: systemcontext问题Bsystemcontext部分命中,只计算问题B

关键细节:

  • 缓存以 1 分钟 TTL 过期,5 分钟内未被访问则失效

  • 前缀必须 从开头完全匹配,中间插入或修改任何 token 都会导致缓存断裂

  • 请求间前缀越长、越稳定,命中率越高

3. 典型应用场景

  • 多轮对话:每轮共享之前的对话历史

  • 批量推理:相同的system prompt + 不同问题

  • RAG系统:相同检索上下文 + 不同查询

  • Agent循环:同一prompt模板反复调用

相关推荐
catoop17 小时前
Agent 流式交互技术选型
ai·agent
Seraphina3620 小时前
记一次实验:利用路径分隔符进行网页缓存欺骗
经验分享·笔记·安全·网络安全·缓存
小七-七牛开发者1 天前
拆解 dsh 系列:从源码和版本变化看 DeepSeek Harness 的设计取舍
ai·大模型·claude·token·工作流·skill·claudecode·ai coding
InfinitePlus1 天前
redis数据持久化
数据库·redis·缓存
Ai-_Man1 天前
千问能否电脑批量导出?深度拆解「AI导出鸭」如何让这件事从“反人性”变成“优雅”
人工智能·ai·小程序
cuguanren1 天前
Agent 框架的会话记忆管理机制
人工智能·ai·大模型·llm·agent·上下文管理·会话记忆管理
TechEdu2026061 天前
[人工智能]GPT(OpenAI):模型体系、智能体与企业工程实践
人工智能·ai
quarter_day1 天前
DeepSeek Harness (DSH) 中配置 Google Gemini 与避坑实践
agent·deepseek
weixin_440730501 天前
数据库缓存、索引、缓存命中率的理解
数据库·缓存
Bruce_Liuxiaowei1 天前
机器人的自由意志:约翰·麦卡锡《Free Will—Even for Robots》论文解读
人工智能·ai