基于 Ragas 的 RAG 问答系统迭代评测流程

基于Ragas的RAG系统迭代评测流程,如下图所示:


Ragas框架 RAG系统 评测程序/脚本 原始知识库 Ragas框架 RAG系统 评测程序/脚本 原始知识库 阶段一:评测集构建 阶段二:批量自动化评测 loop 并行推理 loop Ragas多指标- 计算 阶段三:结果决策与优化 alt 知识库问题 算法优化 模型升级 alt 指标达标 需优化 业务专家 开发人员 线上日志采集+清洗筛选 1 候选问题集 2 人工抽样复核 3 查询原始资料验证 4 编写Ground Truth 👤 业务专家:输出(Question, GT) 5 交付评测集 6 基于评测集触发评测 👤 开发人员:加载并执行 7 批量提交Questions 8 检索+生成 9 返回(Answer, Contexts) 10 提交评测数据 11 Context Recall 12 Context Precision 13 Faithfulness 14 Answer Correctness 15 返回指标分数 16 返回评测报告 17 交付报告 👤 开发人员:人工交付或内部流转 18 审阅报告决策 19 决策:通过发布 20 反馈Bad Case 21 技术分析根因 22 补充修正知识 23 调整检索/Prompt 24 更换Embedding/LLM 25 重新触发评测 26 业务专家 开发人员


上图中,关于第 ① 和第 ② 步,如果是新系统没有历史数据问题的情况下,则由业务专家直接编写问题清单,也可以使用 LLM 基于原材料和按照一定的要求生成一批问题。


(END)

相关推荐
学习星球4 分钟前
OpenHarness 全面配置教学——从游戏开发工作流引入
c++·游戏·ai·ai编程
catchadmin13 分钟前
NativePHP v4 让 Blade 构建原生 iOS 与 Android 界面
android·ios·ai·php
进阶的小名36 分钟前
Spring AI 2.0 探索:多 OpenAI-Compatible 模型接入,以及下一代 Session 记忆管理
java·人工智能·后端·gpt·spring·ai·chatgpt
玫瑰互动GEO1 小时前
海外GEO优化案例-ChatGPT搜索关键词排名GEO优化案例详解(含RAG机制与Tokenization技术拆解)
人工智能·ai·chatgpt·geo优化
温暖的苹果5 小时前
opencode 配置完全指南:配置文件、目录与字段详解
ai·llm·agent·vibecoding·opencode
_Narcissus_6 小时前
链表算法题和静态链表
数据结构·c++·笔记·算法·链表·ai·力扣
小七-七牛开发者7 小时前
61 亿次请求背后:LLM Serving 的 Cache 与调度难题
ai·大模型·agent·token·工作流·claudecode·ai coding
DS随心转APP8 小时前
实测 AI 导出鸭实操效果,依托 AI 直接生成 word 功能横向比对五类导出办法,梳理办公文档转换最优路径
人工智能·ai·word·deepseek·ai导出鸭
前沿在线8 小时前
2026 WRC世界机器人大会| 黑芝麻智能展台亮点
人工智能·ai·大模型
Sherotree9 小时前
理解 JWT:三段分别是什么
前端·ai·开源