RAG知识库专项测试用例通用版

文章目录

    • [1. 文档概述](#1. 文档概述)
      • [1.1 适用范围](#1.1 适用范围)
      • [1.2 测试核心目标](#1.2 测试核心目标)
    • [2. 基础信息准确性测试(核心必测)](#2. 基础信息准确性测试(核心必测))
    • [3. 检索召回能力测试(RAG 特有核心)](#3. 检索召回能力测试(RAG 特有核心))
    • [4. AI 幻觉抑制测试(高危重点)](#4. AI 幻觉抑制测试(高危重点))
    • [5. 多文档 / 长文本综合推理测试](#5. 多文档 / 长文本综合推理测试)
    • [6. 稳定性与边界场景测试](#6. 稳定性与边界场景测试)
    • [7. 缺陷分级标准(用于提 BUG / 验收)](#7. 缺陷分级标准(用于提 BUG / 验收))
    • [8. RAG 测试核心指标(可用于输出测试报告)](#8. RAG 测试核心指标(可用于输出测试报告))

1. 文档概述

1.1 适用范围

私有知识库、企业文档、PDF/Word/网页导入知识库、问答机器人、智能客服 RAG 系统。

1.2 测试核心目标

校验检索准确性、回答忠实度、幻觉抑制、边界场景、多文档整合能力。

2. 基础信息准确性测试(核心必测)

测试目的:验证 RAG 能精准提取知识库中明确存在的文本、数字、时间、规则、专有名词,不篡改、不写错。

用例 ID 测试场景 测试问题(可通用) 预期结果 通过标准
001 文本精准抽取 请说明文档中【某核心定义 / 规则】的完整内容 完整引用知识库原文关键信息,无增删、无改写错误 关键信息 100% 匹配,无错字、漏字
002 数字 / 参数准确性 文档中规定的对应数值、限额、时长、数量是多少 准确输出知识库内数字,不四舍五入、不替换、不脑补 数字完全一致,无偏差
003 时间 / 版本信息准确性 该制度 / 文档的生效时间、更新时间、版本号是什么 严格按照知识库内容输出,不使用模型固有时间知识 时间、版本完全匹配文档

3. 检索召回能力测试(RAG 特有核心)

测试目的:验证系统能够在模糊匹配、同义匹配、关键词不全场景下正确召回对应文档片段,不误召、不漏召。

用例 ID 测试场景 测试问题 预期结果 通过标准
004 同义句提问(换话术不换意思) 用和文档标题不一样的通俗话术提问相同问题 成功召回对应知识点,回答内容正确 召回片段对应正确,答案无误
005 关键词缺失 / 简写提问 删减专业关键词、使用简称提问 可模糊匹配到对应文档,不失效 能正常命中正确知识
006 干扰文档共存场景 知识库存在大量无关文档,提问精准问题 只召回相关片段,不混入无关内容 无无关召回,无答非所问
007 精准单点召回 针对文档小众、细节条款提问 可精准定位小众细节内容 细节信息无遗漏

4. AI 幻觉抑制测试(高危重点)

测试目的:知识库没有的内容,禁止编造、禁止套用外网通用知识、禁止自创规则。

用例 ID 测试场景 测试问题 预期结果 通过标准
008 知识库无对应问题(空白场景) 提问文档中完全不存在的规则、数据、流程 明确回复:知识库暂无相关信息,不编造答案 无幻觉、无自创内容
009 模型固有知识干扰测试 通用常识类问题,但以内部文档规则为准 优先使用知识库内容,不使用外网通用答案 回答完全贴合内部文档,不套用通用知识
010 信息冲突场景 多篇文档存在新旧版本、冲突内容 优先最新版本 / 明确说明差异,不混答 无冲突拼接,逻辑正确

5. 多文档 / 长文本综合推理测试

测试目的:验证 RAG 具备多片段汇总、归纳、梳理流程的能力,不是只能回答单句内容。

用例 ID 测试场景 测试问题 预期结果 通过标准
011 多文档汇总问答 汇总多篇文档信息,说明完整流程 / 条件 / 要求 整合所有相关片段,信息完整无缺失 覆盖全部关键要点,无遗漏
012 长文档理解归纳 请总结该文档的核心要点、适用范围、注意事项 归纳精准,不跑偏、不删减关键规则 总结贴合原文,无主观臆断
013 条件推理问答 根据文档规则,判断某场景是否合规 / 符合条件 基于文档规则推理,判断正确 推理结果与文档一致

6. 稳定性与边界场景测试

表格

用例 ID 测试场景 测试内容 预期结果
014 重复提问稳定性 同一问题连续提问 5 次 答案稳定一致,不随机乱变
015 乱序、口语化提问 语序混乱、口语化、啰嗦式提问 正常理解并正确回答
016 文档更新热更新校验 更新知识库文档内容后再次提问 回答同步最新内容,不缓存旧答案

7. 缺陷分级标准(用于提 BUG / 验收)

  • 严重 BUG:出现幻觉编造、关键数据错误、规则解释相反、答非所问
  • 一般 BUG:信息不全、遗漏部分要点、语句啰嗦、轻微语序问题
  • 优化项:回答不够简洁、排版差、召回速度慢

8. RAG 测试核心指标(可用于输出测试报告)

  • 答案准确率:正确回答数 / 总用例数
  • 幻觉率:出现编造内容的用例占比
  • 召回精准率:召回片段无无关内容
  • 召回覆盖率:不遗漏相关知识点
  • 稳定性:多次回答一致性
相关推荐
BullSmall2 个月前
大模型测试:按产品形态区分完整测试方案
大模型测试
BullSmall2 个月前
大模型测试通用工具完整清单
大模型测试
BullSmall2 个月前
大模型完整运行链路通俗拆解(从输入到输出全流程)
大模型测试
twc8296 个月前
Query 改写 大模型测试的数据倍增器
开发语言·人工智能·python·rag·大模型测试
twc8296 个月前
大模型生成 QA Pairs 提升 RAG 应用测试效率的实践
服务器·数据库·人工智能·windows·rag·大模型测试
多则惑少则明9 个月前
AI测试、大模型测试(九)spring集成大模型(AI4J)
人工智能·ai测试·大模型测试
多则惑少则明9 个月前
AI测试、大模型测试(五)AI测试工具有哪些
人工智能·测试工具·ai测试·大模型测试
多则惑少则明9 个月前
AI测试、大模型测试(四)AI测试分类&AI测试岗位分工
人工智能·ai测试·大模型测试·算法测试
多则惑少则明9 个月前
AI测试、大模型测试(一)
人工智能·ai测试·大模型测试