RAG 能跑≠能用:用 EDD 把 Eval 做成基础设施 (附源码)RAG 调参后“看起来更好”无法支撑工程决策:没有固定样本、不可追溯的索引和中间过程,任何结论都可能来自样本漂移或偶然输出。EDD(Eval-Driven Development)把改动放进可重复的 prepare -> index -> run -> compare 循环。本文基于本项目的 eval/、app/rag.py 和实际工件,搭建一套离线 RAG eval 系统,先测真实 pipeline,再用 Judge 评估最终答案。