OpenCompass 大模型评测实战学习笔记

大模型开源开放评测体系 “司南” (OpenCompass2.0),用于为大语言模型、多模态模型等提供一站式评测服务。其主要特点如下:

开源可复现:提供公平、公开、可复现的大模型评测方案
全面的能力维度:五大维度设计,提供 70+ 个数据集约 40 万题的的模型评测方案,全面评估模型能力
丰富的模型支持:已支持 20+ HuggingFace 及 API 模型
分布式高效评测:一行命令实现任务分割和分布式评测,数小时即可完成千亿模型全量评测
多样化评测范式:支持零样本、小样本及思维链评测,结合标准型或对话型提示词模板,轻松激发各种模型最大性能
灵活化拓展:想增加新模型或数据集?想要自定义更高级的任务分割策略,甚至接入新的集群管理系统?OpenCompass 的一切均可轻松扩展
在这里插入图片描述
除此之外还有一些工具支持
在这里插入图片描述
在opencompass官网中,还可以看到一些教程
在这里插入图片描述
支持的评估指标(部分)
在这里插入图片描述
感觉用opencompass这个框架进行评测,会比自己写评测脚本方便一点,因为涉及到不同的指标什么的。

最近更新

  1. docker php8.1+nginx base 镜像 dockerfile 配置

    2024-05-16 01:18:09       94 阅读
  2. Could not load dynamic library ‘cudart64_100.dll‘

    2024-05-16 01:18:09       100 阅读
  3. 在Django里面运行非项目文件

    2024-05-16 01:18:09       82 阅读
  4. Python语言-面向对象

    2024-05-16 01:18:09       91 阅读

热门阅读

  1. 第十一周学习笔记DAY.1-MySQL

    2024-05-16 01:18:09       35 阅读
  2. mysql 索引失效的原因

    2024-05-16 01:18:09       31 阅读
  3. 设计模式:备忘录模式

    2024-05-16 01:18:09       32 阅读
  4. 数据特征降维 | 主成分分析(PCA)附Python代码

    2024-05-16 01:18:09       34 阅读
  5. sophgo sdk v23.03.01

    2024-05-16 01:18:09       34 阅读