MixEval/MixEval
收藏资源简介:
MixEval是一个基于真实世界用户查询的动态基准测试,旨在通过结合现有基准测试中的查询来评估大型语言模型(LLMs)。它包括两个版本:MixEval和MixEval-Hard,后者是前者的困难版本,旨在更好地区分强模型。数据集包含自由形式和多项选择题两种类型,并定期更新以避免数据污染。MixEval的优势包括准确的模型排名、快速且廉价的执行、动态基准测试、全面且偏少的查询分布以及公平的评分机制。
MixEval is a dynamic benchmark built on real-world user queries, designed to evaluate Large Language Models (LLMs) by aggregating queries from existing benchmarks. It features two variants: MixEval and MixEval-Hard, with the latter being a more challenging edition aimed at better distinguishing top-performing models. The dataset encompasses both free-form and multiple-choice question formats, and is updated regularly to prevent data contamination. The strengths of MixEval include accurate model ranking, fast and low-cost execution, dynamic benchmarking, a comprehensive yet minimally redundant query distribution, and a fair scoring mechanism.
MixEval 数据集概述
基本信息
- 许可证: Apache-2.0
- 任务类别:
- 文本生成
- 文本检索
- 问答
- 语言: 英语
- 名称: MixEval
- 大小类别: 1K<n<10K
- 标签:
- 基准测试
- 大型语言模型评估
- 动态基准测试
- 多模态大型模型
- 机器学习
- 深度学习
配置详情
- MixEval:
- 数据文件:
- 自由形式:
data/mixeval-jsonl/mixeval/free-form.jsonl - 多项选择:
data/mixeval-jsonl/mixeval/multiple-choice.jsonl
- 自由形式:
- 数据文件:
- MixEval_Hard:
- 数据文件:
- 自由形式:
data/mixeval-jsonl/mixeval-hard/free-form.jsonl - 多项选择:
data/mixeval-jsonl/mixeval-hard/multiple-choice.jsonl
- 自由形式:
- 数据文件:
数据集更新
- 当前动态基准版本:
2024-06-01
数据集概述
- MixEval: 基于现成基准混合的动态基准,评估大型语言模型,具有高能力模型排名(与Chatbot Arena相关性为0.96),运行快速且成本低廉(仅为MMLU的6%),每月稳定更新查询以避免污染。
- MixEval-Hard: MixEval的困难版本,旨在增强基准区分强模型的能力。
使用方法
-
加载MixEval: python from datasets import load_dataset dataset = load_dataset("MixEval/MixEval", MixEval)
-
加载MixEval-Hard: python from datasets import load_dataset dataset = load_dataset("MixEval/MixEval", MixEval-Hard)
数据集优势
- 准确的模型排名
- 快速、廉价和可重复的执行
- 动态基准测试
- 全面和较少偏见的查询分布
- 公平的评分过程
有效性
- MixEval和MixEval-Hard在所有基准中与Arena Elo和Arena Elo (En)的相关性最高。
- MixEval提高了其主要基准分割与Arena Elo和Arena Elo (En)的相关性。
- MixEval优于基准级和均匀混合。
- MixEval有效地将真实世界用户查询映射到基于真实情况的基准。
引用
@article{ni2024mixeval, title={MixEval: Deriving Wisdom of the Crowd from LLM Benchmark Mixtures}, author={Ni, Jinjie and Xue, Fuzhao and Yue, Xiang and Deng, Yuntian and Shah, Mahir and Jain, Kabir and Neubig, Graham and You, Yang}, journal={arXiv preprint arXiv:2406.06565}, year={2024} }




