RAG 知识库专项测试

目录

核心目标

一般会测哪些项目

[1. 基础正确性测试](#1. 基础正确性测试)

[2. 检索召回测试](#2. 检索召回测试)

[3. 幻觉测试(重点)](#3. 幻觉测试(重点))

[4. 长文本 / 多文档综合问答](#4. 长文本 / 多文档综合问答)

[5. 稳定性、性能指标](#5. 稳定性、性能指标)

常见评测指标

和普通大模型测试的区别


RAG = Retrieval-Augmented Generation,检索增强生成

RAG 知识库专项测试,就是专门用来验证一套 RAG 系统,能不能正确读取、理解、调用你上传的私有知识库文档,并且准确回答问题的专项评测,不是普通大模型问答测试。

简单一句话:测大模型会不会 "看你给的资料说话",而不是瞎编、用它自己的旧知识。

核心目标

  1. 检索能力:用户提问后,系统能不能从知识库里面召回最相关的片段(有没有召回错、漏召回、召回无关内容)
  2. 生成能力:模型是不是基于召回的文档来回答,而不是模型幻觉编造
  3. 边界能力:知识库没有的内容,能不能识别 "不知道",不乱回答

一般会测哪些项目

1. 基础正确性测试

  • 文档里明确写的信息,提问能不能准确提取
  • 数字、编号、时间、专有名词、规则有没有抄错

2. 检索召回测试

  • 同义提问:换一种话术问同一个问题,能不能找到对应文档
  • 模糊提问:关键词不全、简写,能不能匹配
  • 干扰文档:知识库混入很多无关内容,会不会抓错材料

3. 幻觉测试(重点)

  • 问知识库不存在的信息:看模型会不会编造答案
  • 信息冲突:知识库 A 文档和 B 文档内容冲突,看是否正确处理

4. 长文本 / 多文档综合问答

  • 答案分散在多篇文档里,能不能汇总、推理,而不是只看一小段
  • 长文档抽取,会不会截断丢失关键信息

5. 稳定性、性能指标

  • 召回耗时、回答耗时
  • 重复提问是否稳定输出
  • 文档更新后,RAG 是否读取到最新版本

常见评测指标

  • 召回率 Recall:相关的参考片段有没有被找出来
  • 精确率 Precision:找出来的片段是不是真的相关
  • 答案准确率:最终回答是否符合知识库原文
  • 幻觉率:回答里出现知识库不存在的错误信息占比

和普通大模型测试的区别

  • 普通大模型测试:测模型本身知识、对话能力
  • RAG 知识库专项测试 :重点测【知识库 + 检索链路 + 模型】整套组合,核心是验证私有资料生效

举个场景例子: 你上传一份公司内部制度文档到 RAG 知识库。 专项测试就是批量出题:"报销流程是什么?""出差住宿标准?",验证 RAG 回答完全来自这份制度,而不是网上通用的报销规则。

相关推荐
遇码1 小时前
system prompt 里拼了时间和知识大纲,每轮缓存都被击穿:静态/动态分离的提示词装配方法
人工智能·ai·大模型
Zelman1 小时前
测试层级与测试类型
后端·面试·测试
Anhty2 小时前
3 款手机音频剪辑 APP 横评,短视频配音后期,免费工具怎么选?
功能测试·ffmpeg·音视频
weixin_419658313 小时前
CANoe 使用指南:从输出窗口到数据回放的完整实战教程
开发语言·功能测试·车载系统·自动化·汽车
寻道模式3 小时前
【开发心得】大模型背后的“隐形毒药”
大模型·标签·数据·注入·投毒
Ikalus19884 小时前
预注册的答案表把正控判成「通过」,盲测判成「不通过」——而两个都不对
测试
北京地铁1号线4 小时前
为大模型创建一个简单的skill:在12306网站查询车次(仅作查询,不提供购票功能,仅作学习使用)
自然语言处理·大模型·agent·技能·skill
小元同学5 小时前
一个大三测试实习生的自白:实习重不重要?我在往测开的路上找到了答案
测试
前沿在线5 小时前
破解 AI 推理效率困局,详解华为 OceanStor M900 AI记忆存储新基建
人工智能·ai·大模型
MicrosoftReactor7 小时前
技术速递|从 Jev 到你的笔记本电脑:使用 Mobius 在 ONNX 中构建“System One”决策模型
人工智能·ai·大模型·onnx