Xiezhi
收藏资源简介:
Xiezhi是一个全面评估套件,设计用于评估整体领域知识,包含516个不同学科的多项选择题,涵盖13个不同主题,共有249,587个问题,以及Xiezhi-Specialty和Xiezhi-Interdiscipline两个子集,各含15,000个问题。
Xiezhi is a comprehensive evaluation suite designed to assess holistic domain knowledge. It consists of multiple-choice questions from 516 distinct disciplines across 13 different topics, with a total of 249,587 questions. Additionally, it includes two subsets: Xiezhi-Specialty and Xiezhi-Interdiscipline, each containing 15,000 questions.
数据集概述
Xiezhi(獬豸)是一个用于评估语言模型(LMs)的综合评估套件。它包含249587道多选题,涵盖516个不同学科和四个难度级别。
数据集详情
题目设置
- 所有测试的语言模型需要从50个选项中选择最佳答案。
- 每个问题除了正确答案外,还设置了3个迷惑选项,另外46个选项是从Xiezhi所有问题中的所有选项随机抽取的。
评估指标
- 使用Mean Reciprocal Rank(MRR)作为评估指标,计算正确答案的倒数排名。
数据示例
- 提供了Xiezhi专业领域和跨学科领域的题目示例。
- 展示了少样本学习设置的示例。
使用方法
- 测试可以在包含C-Eval、M3KE、MMLU、Xiezhi-Inter和Xiezhi-Spec的模型集合上进行,这些模型包含在
./Tester/model_test.py文件中。 - 任何人都可以通过运行
./Tester/test.sh来进行评估。 - 对于自定义数据,需要重写
./Tester/model_test.py中的_get_data函数。
许可证
- 该工作基于MIT许可证。
- Xiezhi数据集基于Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License。
引用
请在使用数据集时引用以下论文:
@article{gu2023xiezhi, title={Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation}, author={Zhouhong, Gu and Xiaoxuan, Zhu and Haoning, Ye and Lin, Zhang and Jianchen, Wang and Sihang, Jiang and Zhuozhi, Xiong and Zihan, Li and Qianyu, He and Rui, Xu and Wenhao, Huang and Weiguo, Zheng and Hongwei, Feng and Yanghua, Xiao} journal={arXiv:2304.11679}, year={2023} }

- 1Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation · 2024年



