cyankiwi/Global-MMLU-Lite-sample
收藏资源简介:
Global-MMLU-Lite样本子集是一个小型、固定大小的数据集,用于多语言MMLU(大规模多任务语言理解)评估管道的快速测试。它包含15种语言(阿拉伯语、孟加拉语、德语、英语、西班牙语、法语、印地语、印度尼西亚语、意大利语、日语、韩语、葡萄牙语、斯瓦希里语、约鲁巴语、中文),每种语言40个示例,总计600个示例。数据采用严格非重叠窗口从原始数据集的测试集和开发集中提取,其中语言0-9完全来自测试集,语言10-14来自开发集。该数据集保留了上游数据集的列和数据类型,确保与原始数据集代码兼容。
Global-MMLU-Lite — Sample Subset is a small, fixed-size subset intended for fast smoke-testing of multilingual MMLU evaluation pipelines. It contains 40 examples per language across 15 languages (Arabic, Bengali, German, English, Spanish, French, Hindi, Indonesian, Italian, Japanese, Korean, Portuguese, Swahili, Yoruba, Chinese), totaling 600 examples. The data uses strictly non-overlapping windows across languages: languages 0–9 fall entirely within the original test split, and languages 10–14 within the dev split. The schema (columns and dtypes) is preserved from the upstream dataset, ensuring compatibility with code for the original dataset.



