用于评估大语言模型(LLMs)能力的重要基准任务(Benchmark)

基准任务涵盖了 多领域(如语言理解、数学、推理、编程、医学等)和 多能力维度(如事实检索、计算、代码生成、链式推理、多语言处理)。常用于模型发布时的对比评测,例如 GPT-4、Claude、Gemini、Mistral 等模型的论文或报告中。

Benchmark 简介 用途 地址 许可证
MMLU Massive Multitask Language Understanding 测试模型在多学科考试(如历史、法律、医学等)中的表现 https://arxiv.org/abs/2009.03300, https://github.com/hendrycks/test MIT License
MATH Mathematical Problem Solving 测试模型解决中学和大学级数学问题的能力 https://arxiv.org/abs/2103.03874, https://github.com/hendrycks/math MIT License
GPQA Graduate-level, Google-proof Q&A 高阶、无法通过搜索引擎解答的物理问答题 https://arxiv.org/abs/2311.12022, https://github.com/idavidrein/gpqa/ MIT License
DROP Discrete Reasoning Over Paragraphs 阅读理解测试,侧重数值运算、推理和信息整合 https://arxiv.org/abs/1903.00161, https://allenai.org/data/drop Apache 2.0
MGSM Multilingual Grade School Math 多语言小学数学题,考察链式思维能力 https://arxiv.org/abs/2210.03057, https://github.com/google-research/url-nlp CC-BY 4.0
HumanEval Code Generation and Evaluation 模型在 Python 编程题上的代码生成与准确性测试 https://arxiv.org/abs/2107.03374, https://github.com/openai/human-eval MIT License
SimpleQA Short-form Factuality Benchmark 测试模型对简单事实问答(如"地球离太阳多远?")的准确性 https://openai.com/index/introducing-simpleqa MIT License
BrowseComp Web-based Browsing Agent Task 测试具有浏览网页能力的智能体在任务场景中的能力 https://openai.com/index/browsecomp MIT License
HealthBench Health-related LLM Evaluation 面向医疗健康场景的模型能力评估,强调事实准确性和安全性 https://openai.com/index/healthbench MIT License
相关推荐
禁默2 分钟前
【硬核入门】无需板卡也能造 AI 算子?深度玩转 CANN ops-math 通用数学库
人工智能·aigc·cann
敏叔V5877 分钟前
AI智能体的工具学习进阶:零样本API理解与调用
人工智能·学习
徐小夕@趣谈前端16 分钟前
拒绝重复造轮子?我们偏偏花365天,用Vue3写了款AI协同的Word编辑器
人工智能·编辑器·word
阿里云大数据AI技术16 分钟前
全模态、多引擎、一体化,阿里云DLF3.0构建Data+AI驱动的智能湖仓平台
人工智能·阿里云·云计算
陈天伟教授17 分钟前
人工智能应用- 语言理解:05.大语言模型
人工智能·语言模型·自然语言处理
池央18 分钟前
CANN GE 深度解析:图编译器的核心优化策略、执行流调度与模型下沉技术原理
人工智能·ci/cd·自动化
七月稻草人21 分钟前
CANN ops-nn:AIGC底层神经网络算力的核心优化引擎
人工智能·神经网络·aigc·cann
种时光的人21 分钟前
CANN仓库核心解读:ops-nn打造AIGC模型的神经网络算子核心支撑
人工智能·神经网络·aigc
晚霞的不甘23 分钟前
守护智能边界:CANN 的 AI 安全机制深度解析
人工智能·安全·语言模型·自然语言处理·前端框架
谢璞25 分钟前
中国AI最疯狂的一周:50亿金元肉搏,争夺未来的突围之战
人工智能