RAG 知识库专项测试

目录

核心目标

一般会测哪些项目

[1. 基础正确性测试](#1. 基础正确性测试)

[2. 检索召回测试](#2. 检索召回测试)

[3. 幻觉测试(重点)](#3. 幻觉测试(重点))

[4. 长文本 / 多文档综合问答](#4. 长文本 / 多文档综合问答)

[5. 稳定性、性能指标](#5. 稳定性、性能指标)

常见评测指标

和普通大模型测试的区别


RAG = Retrieval-Augmented Generation,检索增强生成

RAG 知识库专项测试,就是专门用来验证一套 RAG 系统,能不能正确读取、理解、调用你上传的私有知识库文档,并且准确回答问题的专项评测,不是普通大模型问答测试。

简单一句话:测大模型会不会 "看你给的资料说话",而不是瞎编、用它自己的旧知识。

核心目标

  1. 检索能力:用户提问后,系统能不能从知识库里面召回最相关的片段(有没有召回错、漏召回、召回无关内容)
  2. 生成能力:模型是不是基于召回的文档来回答,而不是模型幻觉编造
  3. 边界能力:知识库没有的内容,能不能识别 "不知道",不乱回答

一般会测哪些项目

1. 基础正确性测试

  • 文档里明确写的信息,提问能不能准确提取
  • 数字、编号、时间、专有名词、规则有没有抄错

2. 检索召回测试

  • 同义提问:换一种话术问同一个问题,能不能找到对应文档
  • 模糊提问:关键词不全、简写,能不能匹配
  • 干扰文档:知识库混入很多无关内容,会不会抓错材料

3. 幻觉测试(重点)

  • 问知识库不存在的信息:看模型会不会编造答案
  • 信息冲突:知识库 A 文档和 B 文档内容冲突,看是否正确处理

4. 长文本 / 多文档综合问答

  • 答案分散在多篇文档里,能不能汇总、推理,而不是只看一小段
  • 长文档抽取,会不会截断丢失关键信息

5. 稳定性、性能指标

  • 召回耗时、回答耗时
  • 重复提问是否稳定输出
  • 文档更新后,RAG 是否读取到最新版本

常见评测指标

  • 召回率 Recall:相关的参考片段有没有被找出来
  • 精确率 Precision:找出来的片段是不是真的相关
  • 答案准确率:最终回答是否符合知识库原文
  • 幻觉率:回答里出现知识库不存在的错误信息占比

和普通大模型测试的区别

  • 普通大模型测试:测模型本身知识、对话能力
  • RAG 知识库专项测试 :重点测【知识库 + 检索链路 + 模型】整套组合,核心是验证私有资料生效

举个场景例子: 你上传一份公司内部制度文档到 RAG 知识库。 专项测试就是批量出题:"报销流程是什么?""出差住宿标准?",验证 RAG 回答完全来自这份制度,而不是网上通用的报销规则。

相关推荐
咕泡科技16 小时前
咕泡科技FDE系列最新产品重磅发布!
人工智能·大模型·ai落地·fde·前沿部署工程师
liulilittle20 小时前
mock 规范总纲
ai·自动化·llm·mock·测试·tools
VIP_CQCRE20 小时前
把 Coze 接入 Ace Data Cloud:用 OpenAI Responses 协议快速扩展你的 AI Agent 模型能力
ai·大模型·agent·coze·acedatacloud
Web3&Basketball1 天前
Agent外传审计实战:3类失准事故拦截脚本
python·大模型·agent·性能调优·推理优化
liulilittle1 天前
麻将结算全链路语义(SETTLE_SEMANTICS)
ai·自动化·llm·mock·lua·测试
浅安的邂逅1 天前
260919-报道称:美军曾因一份 AI 幻觉情报,险些误判并准备拦截一艘中国船只
人工智能·大模型·ai编程·行业动态·ai日报
lie..1 天前
30天从零开始学AI应用开发(Day 3):30 分钟搭好开发环境,Python + VSCode 一次配齐
人工智能·python·大模型
liulilittle1 天前
麻将服务器崩溃补偿与异常处理语义(CRASH_SEMANTICS)
ai·自动化·llm·mock·lua·测试·tools
VIP_CQCRE1 天前
OpenCode IDE 插件接入 Ace Data Cloud:把主流编辑器里的 AI Coding 能力统一到一个模型入口
大模型·ai编程·开发工具·opencode·acedatacloud