RAG应用评测:从指标体系到LLM-as-a-Judge的自动化落地RAG 上线后最常见的困境是"感觉答得还行",但产品、测试、老板问"到底行不行"时拿不出数字。这套评测方案把 RAG 质量拆成两层可量化指标:检索层(hit rate、MRR、context precision/recall)衡量"有没有把对的东西捞上来",生成层(faithfulness 忠实度、answer relevancy、噪声敏感度)衡量"有没有基于捞上来的东西好好回答",统一交给 LLM-as-a-Judge 打分,配一个 200 条左右的 golden set 做回归。选型上指标计算用 ra