大模型测试通用工具完整清单

目录

一、自动化测试框架(核心执行工具)

开源本地框架

商用云端测试平台

二、基准评测数据集(能力打分工具)

[通用基础能力(逻辑 / 知识 / 推理)](#通用基础能力(逻辑 / 知识 / 推理))

[对话 & 生成专项](#对话 & 生成专项)

代码能力

中文专项数据集(国内必备)

[三、安全 & 对齐测试工具(幻觉、偏见、越狱、合规)](#三、安全 & 对齐测试工具(幻觉、偏见、越狱、合规))

安全扫描工具

幻觉检测工具

隐私合规测试

[四、性能压测 & 监控工具(吞吐量、延迟、显存、并发)](#四、性能压测 & 监控工具(吞吐量、延迟、显存、并发))

压测工具

资源监控

[五、RAG 检索增强专项测试工具](#五、RAG 检索增强专项测试工具)

[六、多模态大模型测试工具(图文 / 音视频)](#六、多模态大模型测试工具(图文 / 音视频))

七、人工辅助评测工具(标注、打分平台)

[八、向量 & Embedding 测试工具](#八、向量 & Embedding 测试工具)

[九、开发辅助工具(调试、Prompt 管理)](#九、开发辅助工具(调试、Prompt 管理))

十、测试产出配套工具

精简分类速查表(便于测试人员选型)


按测试维度分类,覆盖功能、性能、安全、对齐、自动化、评测数据集、工程辅助全链路,兼顾开源 / 商用、本地 / 云端工具,适配文本大模型、多模态大模型。

一、自动化测试框架(核心执行工具)

开源本地框架

  1. LM Evaluation Harness 最主流 LLM 评测框架,支持百余种开源大模型、海量评测集,一键跑基准指标(MMLU、GLUE 等),支持 GPT/Qwen/Llama/Mistral 等。
  2. DeepEval LLM 专用自动化测试,支持事实一致性、幻觉、毒性、召回、摘要质量校验,可集成 CI 流水线。
  3. PromptBench 提示词鲁棒性测试框架,自动生成对抗 prompt、扰动文本,测试注入、歧义、边界输入。
  4. EvalAI 多模型对比评测平台,支持自定义评测任务、排行榜输出,适合团队横向对比模型效果。
  5. LLMTest 轻量化自动化用例工具,支持批量 prompt 执行、结果导出、相似度打分。
  6. MT-Bench(配套 FastChat) 对话场景专用评测,多轮对话打分,支持人工 + GPT4 自动判分,测对话流畅度、逻辑。

商用云端测试平台

  1. 阿里 ModelScope 评测平台 国内一站式大模型评测,内置中文专项数据集,支持通义千问、Qwen、本地私有化模型接入。
  2. 腾讯混元评测平台 侧重业务场景评测:客服、文案、代码、知识问答,可视化报告。
  3. 百度千帆评测中心 中文合规、行业场景自动化测试,内置安全风险扫描工具。
  4. OpenAI Evals OpenAI 官方评测框架,适配 OpenAI 系列模型,自定义评估器、自动化打分。
  5. HumanLoop / LangSmith LLM 全链路观测 + 测试,追踪 prompt、输出、幻觉、延迟,适合 RAG 应用测试。

二、基准评测数据集(能力打分工具)

通用基础能力(逻辑 / 知识 / 推理)

  • MMLU:多学科知识问答
  • GLUE / SuperGLUE:语言理解、语义、句法
  • GSM8K / Math:数学推理、计算题
  • C-Eval(中文核心):国内初高中、公考、文史理科中文评测集
  • CMMLU:多语言混合知识测试
  • ARC:科学常识推理
  • TruthfulQA:幻觉、事实虚假专项测试

对话 & 生成专项

  • MT-Bench:多轮对话质量
  • ShareGPT:真实用户对话样本集
  • DSTC:对话任务、意图识别、槽位填充
  • CNN/DailyMail:摘要生成评测

代码能力

  • HumanEval、MBPP:代码生成、语法正确性、单元测试通过率
  • CodeLlama Eval 套件

中文专项数据集(国内必备)

  • C3、CMRC2018:阅读理解
  • LCSTS:中文短文本摘要
  • ChID:成语填空
  • OCNLI:中文自然语言推理
  • DuEE:事件抽取

三、安全 & 对齐测试工具(幻觉、偏见、越狱、合规)

安全扫描工具

  1. Garak LLM 漏洞扫描开源工具,自动构造越狱 prompt、隐私泄露、有害内容、偏见测试用例。
  2. Llama Guard / Qwen Guard 大模型内置安全判别器,检测输出暴力、色情、政治有害、诱导内容。
  3. HarmBench 有害内容标准化评测集,量化模型有害输出概率。
  4. RealToxicityPrompts 毒性、歧视、辱骂内容专项测试。
  5. Jailbreak Eval Suite 各类越狱、诱导破解 prompt 合集,测试安全护栏强度。

幻觉检测工具

  1. FactScore:校验生成内容与参考事实匹配度,量化幻觉率
  2. SelfCheckGPT:模型自校验,重复提问判断前后矛盾
  3. Hallucination Evaluation Dataset:幻觉专用测试集

隐私合规测试

  • Prompt Injection Scanner:提示注入漏洞检测
  • PII Checker:识别姓名、手机号、身份证、地址等隐私泄露
  • GDPR / 等保合规自动化评测脚本

四、性能压测 & 监控工具(吞吐量、延迟、显存、并发)

压测工具

  1. Locust 通用并发压测,自定义用户请求脚本,测 QPS、首字延迟、尾延迟 P95/P99。
  2. VeLLM Bench LLM 专用压测工具,支持动态生成长短文本,统计 token 生成速度、显存占用。
  3. OpenAI Loadtest 适配 API 类大模型压测,批量调用 API 统计性能指标。
  4. k6 轻量云原生压测,可集成 grafana 可视化性能曲线。

资源监控

  • Prometheus + Grafana:GPU 显存、CPU、内存、推理耗时监控看板
  • nvidia-smi /nvtop:本地 GPU 实时资源观测
  • Weights & Biases:训练 / 推理全流程资源、性能日志记录

五、RAG 检索增强专项测试工具

大模型落地知识库必备

  1. RAGAS 行业标准 RAG 评测框架,指标:上下文相关性、答案忠实度、召回率、精准度。
  2. TruLens 追踪检索链路,定位幻觉来源(知识库错误 / 模型编造)。
  3. Haystack Eval 检索器 + 生成器联合测试,对比不同向量库效果。
  4. BEIR 检索基准数据集,测试文本召回精度。

六、多模态大模型测试工具(图文 / 音视频)

  1. MMBench 多模态综合评测,图文问答、OCR、视觉推理、图像理解。
  2. POPE 图像幻觉专项测试,检测模型编造画面不存在物体。
  3. Flickr30k / COCO:图文匹配、图像描述评测集
  4. AudioBench:语音大模型评测(ASR、语音对话)
  5. CLIP Score:图文匹配打分工具

七、人工辅助评测工具(标注、打分平台)

  1. LabelStudio 开源标注平台,自定义评测任务:对话打分、幻觉标注、安全内容标注。
  2. Doccano 轻量化文本标注,适合小规模人工评测样本制作。
  3. Amazon SageMaker GroundTruth / 阿里云 PAI 标注 商用规模化人工评测平台,支持多人协同打分、一致性校验。

八、向量 & Embedding 测试工具

  1. MTEB Embedding 通用评测基准,测试检索、分类、聚类、语义相似度。
  2. Sentence-BERT Eval 句向量相似度打分、精度测试。
  3. VectorDB Bench 向量数据库检索速度、召回率压测。

九、开发辅助工具(调试、Prompt 管理)

  1. LangChain / LlamaIndex Playground 快速调试 prompt、链式调用、RAG 流程,快速构造测试用例。
  2. PromptLayer 记录所有模型调用日志,复现异常案例,批量导出用于回归测试。
  3. ChatUI 开源调试面板 可视化输入输出,单轮 / 多轮对话快速测试,支持切换模型对比。
  4. Jupyter Notebook 批量执行 prompt 脚本,批量导出评测结果,适合定制化测试脚本开发。

十、测试产出配套工具

  1. Allure / ReportPortal:自动化测试可视化报告
  2. Pandas/Matplotlib:评测指标数据分析、对比图表生成
  3. GitLab/GitHub CI:集成自动化评测流水线,提交代码自动跑回归用例

精简分类速查表(便于测试人员选型)

测试类型 首选工具
通用能力基准评测 LM Evaluation Harness、C-Eval
对话效果评测 FastChat MT-Bench
安全 / 越狱 / 幻觉 Garak、FactScore、Llama Guard
并发性能压测 Locust、VeLLM Bench
RAG 知识库测试 RAGAS、TruLens
自动化 CI 测试 DeepEval、LangSmith
多模态图文测试 MMBench、POPE
Embedding 向量评测 MTEB
相关推荐
BullSmall1 天前
大模型完整运行链路通俗拆解(从输入到输出全流程)
大模型测试
twc8294 个月前
Query 改写 大模型测试的数据倍增器
开发语言·人工智能·python·rag·大模型测试
twc8294 个月前
大模型生成 QA Pairs 提升 RAG 应用测试效率的实践
服务器·数据库·人工智能·windows·rag·大模型测试
多则惑少则明7 个月前
AI测试、大模型测试(九)spring集成大模型(AI4J)
人工智能·ai测试·大模型测试
多则惑少则明7 个月前
AI测试、大模型测试(五)AI测试工具有哪些
人工智能·测试工具·ai测试·大模型测试
多则惑少则明7 个月前
AI测试、大模型测试(四)AI测试分类&AI测试岗位分工
人工智能·ai测试·大模型测试·算法测试
多则惑少则明7 个月前
AI测试、大模型测试(一)
人工智能·ai测试·大模型测试