小白的RAG缓存

RAG流程:

  1. 用户提问(q

  2. q做处理(重写 \ 查询扩展 \ 向量化)

  3. 向量库检索(向量相似度匹配)

  4. q+选出的文档片段组合成prompt

  5. 调用大模型回答a

1.完整问答缓存(qa cache

将每个q标准化以后,与对应的a做匹配后存入缓存,当用户再问同样的问题后直接返回与其对应的a

key : q问题(标准化后的问题)

value :模型返回的答案

2. 近似问题缓存

3. 检索结果缓存

相关推荐
艺杯羹1 小时前
双轨大模型路由实战:从端侧Ollama边缘推理到云端大模型容灾降级架构深度拆解
开发语言·人工智能·ai·架构·php
知了一笑1 小时前
AI生产力:从效率到工作流重构
人工智能·ai·ai工作流
苏灵凯1 小时前
Codex 官网前端可以抄吗?从设计到实现的技术拆解
笔记·ai·agent·codex·deepseek
苏子寒4 小时前
Nano-VLLM全代码解析笔记(10)-GemmaRMSNorm和MRoPE
笔记·机器学习·ai·nlp·vllm
yiwanbin9 小时前
Codex 企业级安装教程
ai
知了一笑9 小时前
个体看衰AI,企业加速转型
人工智能·ai
杨杨杨大侠14 小时前
Harness 怎么适配不同模型:上下文、Token 计算与缓存
aigc·openai·ai编程
杨杨杨大侠15 小时前
Agent 是怎么被组织起来的:六种编排方式与选择
aigc·openai·ai编程
ServBay15 小时前
OpenClaw 2.0 意外更新,龙虾协同能力更强了
aigc·ai编程
全栈弄潮儿17 小时前
真实案例:用 AI 重构一段难维护的旧代码
aigc·openai·ai编程