haonan-li/cmmlu
收藏资源简介:
CMMLU是一个综合的中文评估套件,专门设计用于评估在中文语言和文化背景下的大规模多任务语言理解能力。它涵盖了67个主题,从基础到高级专业水平,包括需要计算专长的学科如物理和数学,以及人文和社会科学学科。数据集中的许多任务由于其特定的上下文细微差别和措辞,不易从其他语言翻译而来。此外,CMMLU中的许多任务的答案特定于中国,可能在其他地区或语言中不适用或不正确。数据集提供了每个主题的开发和测试数据集,每个问题都是选择题,有4个选项,只有一个正确答案。
CMMLU是一个综合的中文评估套件,专门设计用于评估在中文语言和文化背景下的大规模多任务语言理解能力。它涵盖了67个主题,从基础到高级专业水平,包括需要计算专长的学科如物理和数学,以及人文和社会科学学科。数据集中的许多任务由于其特定的上下文细微差别和措辞,不易从其他语言翻译而来。此外,CMMLU中的许多任务的答案特定于中国,可能在其他地区或语言中不适用或不正确。数据集提供了每个主题的开发和测试数据集,每个问题都是选择题,有4个选项,只有一个正确答案。
数据集概述
数据集名称
- CMMLU
数据集描述
- CMMLU 是一个专为评估大型语言模型(LLMs)在中文语言和文化背景下的高级知识和推理能力而设计的综合评估套件。该数据集覆盖了从基础到高级专业水平的67个主题,包括需要计算专业知识的物理和数学,以及人文和社会科学领域。
数据集特点
- 包含多个选择题和问答任务。
- 每个问题都是带有4个选项的多项选择题,仅有一个正确答案。
- 许多任务因其特定的上下文细微差别和措辞,不易从其他语言翻译。
- 许多任务的答案特定于中国,可能不适用于其他地区或语言。
数据集结构
- 提供每个主题的开发和测试数据集。
- 开发集包含5个问题,测试集包含100多个问题。
数据集使用
- 数据集可以通过Python代码加载,支持按主题加载或一次性加载所有数据。
数据集许可证
引用信息
@misc{li2023cmmlu, title={CMMLU: Measuring massive multitask language understanding in Chinese}, author={Haonan Li and Yixuan Zhang and Fajri Koto and Yifei Yang and Hai Zhao and Yeyun Gong and Nan Duan and Timothy Baldwin}, year={2023}, eprint={2306.09212}, archivePrefix={arXiv}, primaryClass={cs.CL} }




