
目录
[通用基础能力(逻辑 / 知识 / 推理)](#通用基础能力(逻辑 / 知识 / 推理))
[对话 & 生成专项](#对话 & 生成专项)
[三、安全 & 对齐测试工具(幻觉、偏见、越狱、合规)](#三、安全 & 对齐测试工具(幻觉、偏见、越狱、合规))
[四、性能压测 & 监控工具(吞吐量、延迟、显存、并发)](#四、性能压测 & 监控工具(吞吐量、延迟、显存、并发))
[五、RAG 检索增强专项测试工具](#五、RAG 检索增强专项测试工具)
[六、多模态大模型测试工具(图文 / 音视频)](#六、多模态大模型测试工具(图文 / 音视频))
[八、向量 & Embedding 测试工具](#八、向量 & Embedding 测试工具)
[九、开发辅助工具(调试、Prompt 管理)](#九、开发辅助工具(调试、Prompt 管理))
按测试维度分类,覆盖功能、性能、安全、对齐、自动化、评测数据集、工程辅助全链路,兼顾开源 / 商用、本地 / 云端工具,适配文本大模型、多模态大模型。
一、自动化测试框架(核心执行工具)
开源本地框架
- LM Evaluation Harness 最主流 LLM 评测框架,支持百余种开源大模型、海量评测集,一键跑基准指标(MMLU、GLUE 等),支持 GPT/Qwen/Llama/Mistral 等。
- DeepEval LLM 专用自动化测试,支持事实一致性、幻觉、毒性、召回、摘要质量校验,可集成 CI 流水线。
- PromptBench 提示词鲁棒性测试框架,自动生成对抗 prompt、扰动文本,测试注入、歧义、边界输入。
- EvalAI 多模型对比评测平台,支持自定义评测任务、排行榜输出,适合团队横向对比模型效果。
- LLMTest 轻量化自动化用例工具,支持批量 prompt 执行、结果导出、相似度打分。
- MT-Bench(配套 FastChat) 对话场景专用评测,多轮对话打分,支持人工 + GPT4 自动判分,测对话流畅度、逻辑。
商用云端测试平台
- 阿里 ModelScope 评测平台 国内一站式大模型评测,内置中文专项数据集,支持通义千问、Qwen、本地私有化模型接入。
- 腾讯混元评测平台 侧重业务场景评测:客服、文案、代码、知识问答,可视化报告。
- 百度千帆评测中心 中文合规、行业场景自动化测试,内置安全风险扫描工具。
- OpenAI Evals OpenAI 官方评测框架,适配 OpenAI 系列模型,自定义评估器、自动化打分。
- HumanLoop / LangSmith LLM 全链路观测 + 测试,追踪 prompt、输出、幻觉、延迟,适合 RAG 应用测试。
二、基准评测数据集(能力打分工具)
通用基础能力(逻辑 / 知识 / 推理)
- MMLU:多学科知识问答
- GLUE / SuperGLUE:语言理解、语义、句法
- GSM8K / Math:数学推理、计算题
- C-Eval(中文核心):国内初高中、公考、文史理科中文评测集
- CMMLU:多语言混合知识测试
- ARC:科学常识推理
- TruthfulQA:幻觉、事实虚假专项测试
对话 & 生成专项
- MT-Bench:多轮对话质量
- ShareGPT:真实用户对话样本集
- DSTC:对话任务、意图识别、槽位填充
- CNN/DailyMail:摘要生成评测
代码能力
- HumanEval、MBPP:代码生成、语法正确性、单元测试通过率
- CodeLlama Eval 套件
中文专项数据集(国内必备)
- C3、CMRC2018:阅读理解
- LCSTS:中文短文本摘要
- ChID:成语填空
- OCNLI:中文自然语言推理
- DuEE:事件抽取
三、安全 & 对齐测试工具(幻觉、偏见、越狱、合规)
安全扫描工具
- Garak LLM 漏洞扫描开源工具,自动构造越狱 prompt、隐私泄露、有害内容、偏见测试用例。
- Llama Guard / Qwen Guard 大模型内置安全判别器,检测输出暴力、色情、政治有害、诱导内容。
- HarmBench 有害内容标准化评测集,量化模型有害输出概率。
- RealToxicityPrompts 毒性、歧视、辱骂内容专项测试。
- Jailbreak Eval Suite 各类越狱、诱导破解 prompt 合集,测试安全护栏强度。
幻觉检测工具
- FactScore:校验生成内容与参考事实匹配度,量化幻觉率
- SelfCheckGPT:模型自校验,重复提问判断前后矛盾
- Hallucination Evaluation Dataset:幻觉专用测试集
隐私合规测试
- Prompt Injection Scanner:提示注入漏洞检测
- PII Checker:识别姓名、手机号、身份证、地址等隐私泄露
- GDPR / 等保合规自动化评测脚本
四、性能压测 & 监控工具(吞吐量、延迟、显存、并发)
压测工具
- Locust 通用并发压测,自定义用户请求脚本,测 QPS、首字延迟、尾延迟 P95/P99。
- VeLLM Bench LLM 专用压测工具,支持动态生成长短文本,统计 token 生成速度、显存占用。
- OpenAI Loadtest 适配 API 类大模型压测,批量调用 API 统计性能指标。
- k6 轻量云原生压测,可集成 grafana 可视化性能曲线。
资源监控
- Prometheus + Grafana:GPU 显存、CPU、内存、推理耗时监控看板
- nvidia-smi /nvtop:本地 GPU 实时资源观测
- Weights & Biases:训练 / 推理全流程资源、性能日志记录
五、RAG 检索增强专项测试工具
大模型落地知识库必备
- RAGAS 行业标准 RAG 评测框架,指标:上下文相关性、答案忠实度、召回率、精准度。
- TruLens 追踪检索链路,定位幻觉来源(知识库错误 / 模型编造)。
- Haystack Eval 检索器 + 生成器联合测试,对比不同向量库效果。
- BEIR 检索基准数据集,测试文本召回精度。
六、多模态大模型测试工具(图文 / 音视频)
- MMBench 多模态综合评测,图文问答、OCR、视觉推理、图像理解。
- POPE 图像幻觉专项测试,检测模型编造画面不存在物体。
- Flickr30k / COCO:图文匹配、图像描述评测集
- AudioBench:语音大模型评测(ASR、语音对话)
- CLIP Score:图文匹配打分工具
七、人工辅助评测工具(标注、打分平台)
- LabelStudio 开源标注平台,自定义评测任务:对话打分、幻觉标注、安全内容标注。
- Doccano 轻量化文本标注,适合小规模人工评测样本制作。
- Amazon SageMaker GroundTruth / 阿里云 PAI 标注 商用规模化人工评测平台,支持多人协同打分、一致性校验。
八、向量 & Embedding 测试工具
- MTEB Embedding 通用评测基准,测试检索、分类、聚类、语义相似度。
- Sentence-BERT Eval 句向量相似度打分、精度测试。
- VectorDB Bench 向量数据库检索速度、召回率压测。
九、开发辅助工具(调试、Prompt 管理)
- LangChain / LlamaIndex Playground 快速调试 prompt、链式调用、RAG 流程,快速构造测试用例。
- PromptLayer 记录所有模型调用日志,复现异常案例,批量导出用于回归测试。
- ChatUI 开源调试面板 可视化输入输出,单轮 / 多轮对话快速测试,支持切换模型对比。
- Jupyter Notebook 批量执行 prompt 脚本,批量导出评测结果,适合定制化测试脚本开发。
十、测试产出配套工具
- Allure / ReportPortal:自动化测试可视化报告
- Pandas/Matplotlib:评测指标数据分析、对比图表生成
- GitLab/GitHub CI:集成自动化评测流水线,提交代码自动跑回归用例
精简分类速查表(便于测试人员选型)
| 测试类型 | 首选工具 |
|---|---|
| 通用能力基准评测 | LM Evaluation Harness、C-Eval |
| 对话效果评测 | FastChat MT-Bench |
| 安全 / 越狱 / 幻觉 | Garak、FactScore、Llama Guard |
| 并发性能压测 | Locust、VeLLM Bench |
| RAG 知识库测试 | RAGAS、TruLens |
| 自动化 CI 测试 | DeepEval、LangSmith |
| 多模态图文测试 | MMBench、POPE |
| Embedding 向量评测 | MTEB |