
目录
[1. 基础正确性测试](#1. 基础正确性测试)
[2. 检索召回测试](#2. 检索召回测试)
[3. 幻觉测试(重点)](#3. 幻觉测试(重点))
[4. 长文本 / 多文档综合问答](#4. 长文本 / 多文档综合问答)
[5. 稳定性、性能指标](#5. 稳定性、性能指标)
RAG = Retrieval-Augmented Generation,检索增强生成
RAG 知识库专项测试,就是专门用来验证一套 RAG 系统,能不能正确读取、理解、调用你上传的私有知识库文档,并且准确回答问题的专项评测,不是普通大模型问答测试。
简单一句话:测大模型会不会 "看你给的资料说话",而不是瞎编、用它自己的旧知识。
核心目标
- 检索能力:用户提问后,系统能不能从知识库里面召回最相关的片段(有没有召回错、漏召回、召回无关内容)
- 生成能力:模型是不是基于召回的文档来回答,而不是模型幻觉编造
- 边界能力:知识库没有的内容,能不能识别 "不知道",不乱回答
一般会测哪些项目
1. 基础正确性测试
- 文档里明确写的信息,提问能不能准确提取
- 数字、编号、时间、专有名词、规则有没有抄错
2. 检索召回测试
- 同义提问:换一种话术问同一个问题,能不能找到对应文档
- 模糊提问:关键词不全、简写,能不能匹配
- 干扰文档:知识库混入很多无关内容,会不会抓错材料
3. 幻觉测试(重点)
- 问知识库不存在的信息:看模型会不会编造答案
- 信息冲突:知识库 A 文档和 B 文档内容冲突,看是否正确处理
4. 长文本 / 多文档综合问答
- 答案分散在多篇文档里,能不能汇总、推理,而不是只看一小段
- 长文档抽取,会不会截断丢失关键信息
5. 稳定性、性能指标
- 召回耗时、回答耗时
- 重复提问是否稳定输出
- 文档更新后,RAG 是否读取到最新版本
常见评测指标
- 召回率 Recall:相关的参考片段有没有被找出来
- 精确率 Precision:找出来的片段是不是真的相关
- 答案准确率:最终回答是否符合知识库原文
- 幻觉率:回答里出现知识库不存在的错误信息占比
和普通大模型测试的区别
- 普通大模型测试:测模型本身知识、对话能力
- RAG 知识库专项测试 :重点测【知识库 + 检索链路 + 模型】整套组合,核心是验证私有资料生效
举个场景例子: 你上传一份公司内部制度文档到 RAG 知识库。 专项测试就是批量出题:"报销流程是什么?""出差住宿标准?",验证 RAG 回答完全来自这份制度,而不是网上通用的报销规则。