OpenCompass 大模型评测实战学习笔记

大模型开源开放评测体系 "司南" (OpenCompass2.0),用于为大语言模型、多模态模型等提供一站式评测服务。其主要特点如下:

开源可复现:提供公平、公开、可复现的大模型评测方案

全面的能力维度:五大维度设计,提供 70+ 个数据集约 40 万题的的模型评测方案,全面评估模型能力

丰富的模型支持:已支持 20+ HuggingFace 及 API 模型

分布式高效评测:一行命令实现任务分割和分布式评测,数小时即可完成千亿模型全量评测

多样化评测范式:支持零样本、小样本及思维链评测,结合标准型或对话型提示词模板,轻松激发各种模型最大性能

灵活化拓展:想增加新模型或数据集?想要自定义更高级的任务分割策略,甚至接入新的集群管理系统?OpenCompass 的一切均可轻松扩展

除此之外还有一些工具支持

在opencompass官网中,还可以看到一些教程

支持的评估指标(部分)

感觉用opencompass这个框架进行评测,会比自己写评测脚本方便一点,因为涉及到不同的指标什么的。

相关推荐
woodykissme13 分钟前
倒圆角问题解决思路分享
笔记·学习·工艺
laplace012315 分钟前
Clawdbot 部署到飞书(飞连)使用教程(完整版)
人工智能·笔记·agent·rag·clawdbot
黎雁·泠崖20 分钟前
Java核心基础API学习总结:从Object到包装类的核心知识体系
java·开发语言·学习
香芋Yu36 分钟前
【机器学习教程】第02章:线性代数基础【下】
学习·机器学习
Terio_my40 分钟前
简要 Java 面试题学习
java·开发语言·学习
知识分享小能手1 小时前
Oracle 19c入门学习教程,从入门到精通,Oracle 的闪回技术 — 语法知识点与使用方法详解(19)
数据库·学习·oracle
不光头强1 小时前
kafka学习要点
分布式·学习·kafka
凉、介1 小时前
ACRN Hypervisor 简介
笔记·学习·虚拟化
飞鹰511 小时前
深度学习算子CUDA优化实战:从GEMM到Transformer—Week4学习总结
c++·人工智能·深度学习·学习·transformer
顾西爵霞1 小时前
个人学习主页搭建指南:从毛坯房到精装户型
学习·html