RAG 不是新概念,本质就是"向量检索 + 拼 prompt",后端闭眼能接。

RAG 召回低?别急着换 embedding 模型
八成问题出在更前面,换模型是最后一步。排查顺序:
- 分块策略(chunk size / overlap 调一下,别切太碎)
- embedding 模型(最后才换)
- 加重排序(rerank,召回质量立马上来)
- top-k(调数量)
- 混合检索(BM25 + 向量)

幻觉压不住?别靠"多说几遍 / 调温度"
治标不治本。正解四件套:
- Prompt 强制"无依据就说不知道"
- 要求输出引用来源
- RAG 锚定(答案必须来自检索片段)
- 量化监控幻觉率(上线后持续看)

Agent 落地:把后端接口封装成工具
你已有的订单/用户/库存接口,包一层 function calling 描述,Agent 就能自己调。这一步后端优势最大,别外包。
完整《后端转AI落地避坑清单》8 坑 PDF(含每个坑的真相 + 做法)已上传,点击本文资源免费下载。