遇见数据集
官方服务:

资源简介:

UrduMMLU 是一个大规模、人工整理的多选题基准数据集,包含 26,431 道以乌尔都语原生编写的问题。这些问题源自巴基斯坦的中学和高中课程(涵盖 SSC-I 至 HSSC-II 级别),涉及人文学科、社会科学、STEM(科学、技术、工程、数学)、专业研究和通识知识等广泛领域。与机器翻译的 MMLU 变体不同,该数据集的每个条目均来自乌尔都语原生考试材料,并经过多阶段人工验证流程的清洗、去重、模式标准化和人工核查。

UrduMMLU is a large-scale, manually curated multiple-choice benchmark dataset containing 26,431 questions natively written in Urdu. These questions are derived from secondary and higher secondary school curricula in Pakistan (covering SSC-I to HSSC-II levels), spanning broad areas such as humanities, social sciences, STEM (science, technology, engineering, mathematics), professional studies, and general knowledge. Unlike machine-translated MMLU variants, each entry in this dataset originates from native Urdu examination materials and undergoes a multi-stage manual verification process including cleaning, deduplication, pattern standardization, and human review.

创建时间:
2026-06-04
原始信息汇总

数据集概览:UrduMMLU

UrduMMLU 是一个大规模、人工策划的乌尔都语理解基准数据集,包含 26,431 道多选题,题目以本土乌尔都语撰写,源自巴基斯坦中学和高中课程(SSC-I 至 HSSC-II),涵盖人文、社会科学、STEM、专业研究和常识等领域。

核心特征

属性 详情
问题数量 26,431 个
语言 乌尔都语 (ur)
格式 单选题(4-5 个选项)
教育等级 SSC-I, SSC-II, HSSC-I, HSSC-II
领域 5 个顶级领域,26 个子领域
数据文件 urdummlu.json(问题数据)、stats.json(统计信息)
许可证 CC BY 4.0

数据 Schema

每条记录包含以下字段:

字段 描述
id 稳定的整数标识符
question 乌尔都语的题干
options 选项键(AE)到乌尔都语选项文本的映射
correct_key 正确答案的选项键
domain 顶级领域(共 5 个)
subdomain 细粒度学科(共 26 个)
level 课程等级:SSC-ISSC-IIHSSC-IHSSC-II
length_tier 题目长度分类:shortlongnull
source 题目来源列表,包含 nameurl

领域分布

领域 问题数
Humanities(人文学科) 11,010
Social Sciences(社会科学) 7,968
STEM(科学、技术、工程、数学) 5,113
Other(其他) 1,365
Profession(专业研究) 975

课程等级分布

等级 问题数
SSC-I 11,601
SSC-II 6,838
HSSC-II 4,125
HSSC-I 3,867

使用方式

  • 加载数据:使用 from datasets import load_dataset 加载 MBZUAI/UrduMMLU 数据集,默认分割为 test
  • 评估:将每个题目视为单选题,以精确匹配准确率(exact-match accuracy)为主要指标,建议按 domainlevel 分组报告。

数据来源

题目收集自公开的乌尔都语考试和练习题库,包括 Ustad 360、MCQ Times、TestPoint PK、eTest、FBISE、ExamAunty、GoTest、PakMCQs 以及省级考试委员会(如 BISE Multan)等。每条记录均保留来源归属。

局限性

  • 参考答案基于原始材料,可能存在极少数错误。
  • length_tier 字段对部分题目未赋值。
  • 数据覆盖偏向于人文学科和 SSC 等级,反映了本土乌尔都语考试内容的可用性。
  • 伊斯兰研究类别中包含少量古兰经/古典阿拉伯语文本,符合巴基斯坦乌尔都语课程实际,但仅占很小比例。
搜集汇总
数据集介绍
UrduMMLU 数据集图片
构建方式
UrduMMLU 是一个大规模、经人工精心整理的多选题基准测试集,包含 26,431 道以乌尔都语为母语编写的题目。这些题目源自巴基斯坦中学和高中课程(SSC-I 至 HSSC-II),覆盖人文学科、社会科学、STEM、专业研究及常识领域。与依赖机器翻译的 MMLU 变体不同,该数据集的所有条目均来自原始乌尔都语考试材料,并经过清洗、去重、模式标准化以及多阶段人工标注管线的验证,确保了数据的高质量与原生语言特性。每个样本均包含稳定的标识符、问题干、选项映射、正确答案键、领域与子领域分类、课程级别、问题长度层级以及完整的来源追溯信息。
使用方法
使用 Hugging Face Datasets 库即可轻松加载 UrduMMLU,代码示例为 `ds = load_dataset('MBZUAI/UrduMMLU', split='test')`。评估时将每个样本视为单答案选择题,向模型呈现问题干与选项,将其选择的答案键与 `correct_key` 比较,以精确匹配准确率作为主要指标。建议按领域和课程级别分别报告准确率,以深入分析模型在不同子领域的表现。该数据集适用于教育评估、多语言理解基准测试及低资源语言模型的性能诊断。
背景与挑战
背景概述
UrduMMLU是由MBZUAI机构的研究人员Ahmer Tabassum、Sarfraz Ahmad等人在2026年创建的大规模、人工策定的乌尔都语多任务语言理解基准数据集。该数据集包含26,431道单选题,题目源自巴基斯坦中学和高中课程(SSC-I至HSSC-II),涵盖人文学科、社会科学、STEM、专业研究及常识等领域。与机器翻译的MMLU变种不同,UrduMMLU的所有题目均来自本土乌尔都语考试材料,经过多阶段注释管线的清洗、去重、模式归一化和人工验证,显著提升了低资源语言乌尔都语的自然语言理解评估质量。该数据集填补了乌尔都语基准测试的空白,为多语言和低资源语言理解研究提供了重要参考。
当前挑战
UrduMMLU旨在解决乌尔都语自然语言理解领域的评估难题。首先,该领域面临的最大挑战是缺乏高质量、大规模的人工标注数据集,尤其是针对乌尔都语这种低资源语言,现有MMLU变种多依赖机器翻译,存在语义失真和文化偏差。其次,数据集构建过程中面临多重挑战:需要从分散的在线题库中收集题目,并通过去重和模式归一化保证数据质量;多阶段人工验证流程需耗费大量人力,且答案键可能因原始材料错误而存在瑕疵;覆盖范围偏向人文学科和SSC级别,导致其他领域和更高教育层次的题目不足,影响基准的全面性。此外,题目长度分类不完整,部分条目缺失长度层级标签,给细粒度评估带来额外困难。
常用场景
经典使用场景
UrduMMLU作为专为乌尔都语设计的大规模多任务语言理解基准,其经典使用场景在于评估预训练语言模型在低资源语言上的推理与知识掌握能力。研究者常利用该数据集的26,431道人工策划多选题,从人文社科到STEM及职业知识等多个领域,系统性地衡量模型的零样本或少样本学习表现。通过按学科领域与教育层次(SSC-I至HSSC-II)分层的准确率报告,UrduMMLU为多语言自然语言处理领域提供了一个标准化的评测平台,尤其适合探索模型在非英语语境下的泛化边界。
解决学术问题
该数据集的核心学术贡献在于填补了乌尔都语机器阅读理解基准的空白,解决了低资源语言缺乏高质量、大规模且经过人工验证的评测数据这一长期痛点。以往研究多依赖机器翻译版MMLU,却因翻译误差和语境失真导致评估偏差。UrduMMLU通过多阶段人工标注流程确保了题目的原生性与文化适切性,使研究者能够精确诊断模型在乌尔都语上的知识缺陷,推动了对语言模型跨语言知识迁移机制的理解,并为构建更公平的多语言评估框架奠定了方法论基础。
实际应用
在实际应用层面,UrduMMLU直接服务于南亚地区乌尔都语教育科技的发展。教师与教育机构可借助该基准测试智能辅导系统或自动问答工具的学科知识覆盖度,从而优化个性化学习路径的生成算法。此外,该数据集还可用于验证面向巴基斯坦中学课程的数字教育平台,如自动出题系统或作业批改工具的语言理解能力,确保其在乌尔都语环境下维持与英语工具同等的准确性与可靠性。政府与非政府组织亦可利用其评估信息技术在偏远地区推广教育资源的实际效果。
数据集最近研究
最新研究方向
UrduMMLU作为乌尔都语首个大规模人工策划的多任务语言理解基准,填补了低资源语言在自然语言处理评测领域的空白。当前前沿研究方向聚焦于利用该基准评估大语言模型在不具备机器翻译偏差的母语语境下的推理能力,尤其是在巴基斯坦中等教育体系所涵盖的人文、社会科学及STEM等26个子领域的知识掌握水平。该数据集的出现与南亚地区AI本地化浪潮紧密相连,推动多语言模型的公平性研究,并引发对非英语语言模型评估标准化与知识地域性关联的深度思考,为构建真正平等的多语言AI生态系统提供了关键实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务