AI 智能体问答 Ragas 自动化评测内部流程图

Ragas自动化评测内部流程,如下图所示:


📈 输出结果
📐 Ragas 四大指标计算
📊 输入数据
Faithfulness (答案忠诚度)
Context Precision (上下文精确率)
Context Recall (上下文召回率)
Answer Correctness (答案正确性)
Question

(用户问题)
Answer

(RAG系统输出)
Contexts

(检索召回文档)
Ground Truth

(人工标注标准)
语义相似度

🤖 Embedding模型

余弦相似度
事实准确度

🤖 LLM评委

观点提取+比对
加权求和

0.25*语义 + 0.75*事实
GT观点分解

🤖 LLM评委
逐观点验证

Contexts支撑?
得分=支撑观点/GT总观点
逐Context相关性判断

🤖 LLM评委
计算Precision@K
平均Precision
Answer观点提取

🤖 LLM评委
逐观点核实

Contexts溯源
得分=可支撑观点/总观点
各项分数

0-1标准化
明细数据

失败案例标注
聚合报告

趋势对比


指标 概述 含义说明
Answer Correctness (答案正确性) 生成答案有多"对" 衡量RAG生成的答案与标准答案的整体正确程度,兼顾语义相近和事实准确
Context Recall (上下文召回率) 检索有多"全" 衡量检索召回的文档是否覆盖了回答问题所需的全部信息(查全率)
Context Precision (上下文精确率) 检索有多"准" 衡量检索召回的文档中有多少比例是真正相关的(查准率),相关内容排序越靠前得分越高
Faithfulness (答案忠实度) 生成有多"真" 衡量生成的答案内容是否忠实于检索文档,检测幻觉/编造内容

(END)

相关推荐
一航jason1 小时前
Android平台推理框架及试用场景模型对比
android·人工智能·ai·架构·ai编程·llama
一航jason1 小时前
Android 端侧大模型推理框架对比
android·人工智能·ai·ai编程·llama·ai-native
科技每日热闻1 小时前
创业公司需要弹性可伸缩的 GPU 算力,如何规避大额前期硬件投入?
ai
武汉大学-王浩宇1 小时前
Autodl配置claude code教程
ai
VIP_CQCRE3 小时前
Claude Code 接入 NanoBanana MCP:让 AI 编程助手直接完成图片生成与编辑
ai·mcp·claude code·ace data cloud
小白跃升坊4 小时前
大模型推理入门:从原理到实践
ai·大模型·llm·推理优化
腾视科技-AIoT4 小时前
超低功耗 性能卓越|腾视科技重磅推出TS-SG-SM9系列AI算力模组,引领边缘智能计算新篇章
人工智能·科技·ai·算力模组·ai算力模组·ai模组·腾视科技
张忠琳4 小时前
【deepseek-harness】DeepSeek Harness Agent Loop 模块深度架构分析之一
ai·agent·deepseek·harness·dsh