OpenCompass 大模型评测实战学习笔记

凌漪_2024-05-16 5:08

大模型开源开放评测体系 "司南" (OpenCompass2.0)，用于为大语言模型、多模态模型等提供一站式评测服务。其主要特点如下：

开源可复现：提供公平、公开、可复现的大模型评测方案

全面的能力维度：五大维度设计，提供 70+ 个数据集约 40 万题的的模型评测方案，全面评估模型能力

丰富的模型支持：已支持 20+ HuggingFace 及 API 模型

分布式高效评测：一行命令实现任务分割和分布式评测，数小时即可完成千亿模型全量评测

多样化评测范式：支持零样本、小样本及思维链评测，结合标准型或对话型提示词模板，轻松激发各种模型最大性能

灵活化拓展：想增加新模型或数据集？想要自定义更高级的任务分割策略，甚至接入新的集群管理系统？OpenCompass 的一切均可轻松扩展

除此之外还有一些工具支持

在opencompass官网中，还可以看到一些教程

支持的评估指标（部分）

感觉用opencompass这个框架进行评测，会比自己写评测脚本方便一点，因为涉及到不同的指标什么的。