XiezhiBenchmark
收藏资源简介:
“獬豸基准”数据集包含了249,587道双语多项选择题,涵盖13个类别下的516个学科领域。这些题目主要来源于两个渠道:约17万道题目来自六种不同的考试,另外约8万道题目是通过自动更新框架自动生成的。该数据集的评估方法采用代码驱动的评估方式。
The 'Xiezhi Benchmark' dataset encompasses 249,587 bilingual multiple-choice questions, spanning 516 academic fields across 13 categories. The questions are primarily sourced from two channels: approximately 170,000 questions come from six different examinations, while an additional 80,000 questions are automatically generated through an automated update framework. The evaluation method for this dataset employs a code-driven approach.
Xiezhi (獬豸) 数据集概述
数据集简介
- 目的:用于全面评估语言模型(LMs)的性能。
- 规模:包含249,587个多选题,涵盖516个不同学科和四个难度级别。
- 特点:旨在帮助开发者跟踪语言模型的进展并分析其重要优势/不足。
数据详情
- 问题类型:多选题,每个问题有50个选项。
- 选项设置:
- 每个问题包含1个正确答案和3个混淆选项。
- 其余46个选项随机从所有问题的选项中抽取。
- 示例:
- 专业领域问题示例:参见
resources/question_spec.png。 - 跨学科问题示例:参见
resources/question_inter.png。 - 少样本学习设置示例:参见
resources/question-3shot.png。
- 专业领域问题示例:参见
实验设置
- 评估指标:平均倒数排名(MRR),用于衡量模型将正确答案排在前列的能力。
- 模型评估:
- 评估了45个开源模型和两个API模型(ChatGPT和GPT-4)。
- 结果展示了零样本学习中的模型排名。
使用方式
- 测试脚本:通过运行
./Tester/test.sh进行评估。 - 自定义数据:需重写
./Tester/model_test.py中的_get_data函数。
许可证
- 代码:MIT许可证。
- 数据集:知识共享署名-非商业性使用-相同方式共享4.0国际许可证(CC BY-NC-SA 4.0)。
引用
如需使用该数据集,请引用以下论文: bibtex @article{gu2023xiezhi, title={Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation}, author={Zhouhong, Gu and Xiaoxuan, Zhu and Haoning, Ye and Lin, Zhang and Jianchen, Wang and Sihang, Jiang and Zhuozhi, Xiong and Zihan, Li and Qianyu, He and Rui, Xu and Wenhao, Huang and Weiguo, Zheng and Hongwei, Feng and Yanghua, Xiao}, journal={arXiv:2304.11679}, year={2023} }




