技术栈

缓存命中

peijiping
14 小时前
ai agent·claude code·缓存命中
大模型 API 缓存命中率深度解析:OpenAI / DeepSeek / Anthropic 三家机制对比与智能体端实践 (学习笔记)在大模型应用的账单里,input token 往往占总成本的绝对大头,而长上下文应用(RAG、Agent、多轮对话)中,大部分 input token 是重复发送的——同一个 system prompt、同一批工具定义、同一段历史消息,每一轮都要重新传给服务端。
我是有底线的