RAG评测指标实战:忠实度、上下文精确率/召回率从原理到CI落地RAG系统上线三个月后最常见的困境:用户反馈"答得还行",但你不知道是检索对了还是模型硬编的。传统QA只管功能跑通,RAG的质量问题出在两层——检索层拿没拿到对的资料,生成层有没有照着资料说。评测必须拆开打:检索层看上下文精确率(Context Precision)和上下文召回率(Context Recall),生成层看忠实度(Faithfulness)和答案相关性(Answer Relevancy)。工具直接用 Ragas 或 DeepEval,别自己造轮子,但指标的计算逻辑必须吃透,否则阈值怎么定、分