遇见数据集

cross-ling-know/mixup-lang-mmlu

收藏
Hugging Face2024-06-29 更新2024-07-06 收录
官方服务:

资源简介:

mixup-lang-mmlu数据集是一个基于MMLU的基准,旨在评估大型语言模型(LLMs)的跨语言推理能力。该数据集支持多种语言(包括英语、意大利语、法语、西班牙语和德语),并包含57个原始MMLU数据集中的主题。数据集的大小类别为10K到100K之间。

The mixup-lang-mmlu datasets serve as an MMLU-based benchmark designed to evaluate the cross-lingual reasoning capabilities of LLMs. The dataset supports multiple languages (including English, Italian, French, Spanish, and German) and includes 57 subjects from the original MMLU dataset. The size category of the dataset is between 10K and 100K.

提供机构:
cross-ling-know
原始信息汇总

mixup-lang-mmlu 数据集

概述

  • 名称: mixup-lang-mmlu
  • 任务类别: 问答
  • 语言: 英语、意大利语、法语、西班牙语、德语
  • 数据规模: 10K<n<100K
  • 许可协议: cc-by-nc-sa-4.0

数据集加载

  • 加载方式: python from datasets import load_dataset data_subject = load_dataset("cross-ling-know/mixup-lang-mmlu", data_files=["data/{split}/{subject}_{split}.csv"])

  • 可用分割: test, dev

  • 可用主题: 57个主题(来自原始MMLU数据集)

二维码
社区交流群
二维码
科研交流群
商业服务