遇见数据集

INSAIT-Institute/rit-mmlu

收藏
Hugging Face2026-06-22 更新2026-07-22 收录
官方服务:

资源简介:

MMLU多语言基准数据集,源自Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets项目(项目页面:https://ritranslation.insait.ai/,arXiv:2602.22207)。该数据集将INSAIT-Institute/multilingual-benchmarks集合中的每种语言数据集重组为一个统一的Hugging Face数据集存储库,每种语言作为一个独立的配置/子集。MMLU(Massive Multitask Language Understanding)是一个多项选择基准,涵盖57个学术和专业科目,常用于评估语言模型的世界知识和推理能力。RiTranslation论文提出了一种自动化高质量基准和数据集翻译框架,研究了包括Self-Check、Best-of-N、Universal Self-Improvement (USI)和T-RANK多轮排序方法在内的测试时计算策略,评估显示其提高了翻译质量和多语言LLM评估的可靠性。可用语言配置包括:乌克兰语(ukr)、斯洛伐克语(sk)、罗马尼亚语(ro)、爱沙尼亚语(et)、立陶宛语(lt)、希腊语(el)、土耳其语(tr)。数据集结构包含以下字段:问题(question)、主题(subject)、选项(choices)、答案(answer)。每种配置保留源数据集的分割(训练、验证、测试)和模式,便于加载和评估。该数据集旨在用于多语言基准评估和分析,使跨语言模型比较更加便捷,同时保持每种语言的隔离性。注意:这些是机器翻译的评估基准,结果解释需考虑语言特定歧义、文化背景和基准污染等因素。

The MMLU Multilingual benchmark dataset, released from the Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets project (project page: https://ritranslation.insait.ai/, arXiv:2602.22207). It reorganizes the per-language datasets from the INSAIT-Institute/multilingual-benchmarks collection into a single Hugging Face dataset repository, with one config/subset per language. MMLU (Massive Multitask Language Understanding) is a multiple-choice benchmark spanning 57 academic and professional subjects, commonly used to evaluate world knowledge and reasoning in language models. The RiTranslation paper introduces an automated framework for high-quality benchmark and dataset translation, studying test-time compute strategies including Self-Check, Best-of-N, Universal Self-Improvement (USI), and the T-RANK multi-round ranking method, with evaluations showing improved translation quality and more reliable multilingual LLM assessment. Available language configs: Ukrainian (ukr), Slovak (sk), Romanian (ro), Estonian (et), Lithuanian (lt), Greek (el), Turkish (tr). Dataset structure includes fields: question, subject, choices, answer. Each config preserves the split names and schema of the corresponding source dataset for easy loading and evaluation. Intended for multilingual benchmark evaluation and analysis, facilitating model comparison across languages while keeping each language isolated. Caveats: These are machine-translated evaluation benchmarks; results should be interpreted with care for language-specific ambiguity, cultural context, and benchmark contamination.

提供机构:
INSAIT-Institute
搜集汇总
数据集介绍
INSAIT-Institute/rit-mmlu 数据集图片
构建方式
rit-mmlu数据集源于RiTranslation研究项目,旨在构建高质量的多语言评测基准。其构建过程依托于一套自动化的翻译管线,将源自MMLU这一涵盖57个学术与职业领域的多项选择评测基准,通过机器翻译技术精准转化为多种语言版本。研究人员在翻译过程中探索了多种测试时计算策略,包括自我校验、最佳N选、通用自我改进以及T-RANK多轮排序方法,以提升翻译质量与多语言评估的可靠性。最终,来自INSAIT-Institute多语言基准集合中各语言的数据集被重新组织,整合进统一的HuggingFace仓库,每种语言作为一个独立的配置子集,包含训练、验证与测试划分。
使用方法
使用rit-mmlu数据集进行多语言评测时,可通过HuggingFace的datasets库轻松加载。用户需指定目标语言配置名称,例如执行`load_dataset("INSAIT-Institute/mmlu", "ukr")`即可获取乌克兰语子集。对于需要查看可用配置的场景,可通过`get_dataset_config_names`函数获取所有语言选项列表。该数据集特别适用于评估大型语言模型在多语言环境下的知识与推理能力,同时为机器翻译质量与跨语言理解研究提供了标准化测试平台。研究者应审慎解读翻译数据带来的潜在偏差,并注意遵守原始基准的数据许可与引用规范。
背景与挑战
背景概述
在大规模语言模型评估领域,多语言基准测试的匮乏长期制约着非英语语言模型的客观评测。2026年,由Hanna Yukhymenko、Anton Alexandrov和Martin Vechev等研究者于INSAIT研究院提出的RiTranslation项目,针对此问题发布了MMLU多语言版本(rit-mmlu)。该数据集基于经典的MMLU基准,覆盖57个学术与专业科目的多项选择题,旨在评估模型的世界知识与推理能力。其核心研究问题在于如何通过自动化翻译管线,高效地将英语基准迁移至乌克兰语、斯洛伐克语、罗马尼亚语、爱沙尼亚语、立陶宛语、希腊语及土耳其语等七种语言。作为RiTranslation框架的产物,该数据集不仅填补了低资源语言评估工具的空白,更推动了多语言自然语言处理评估体系的标准化与可复现性,对跨语言模型研究具有重要影响力。
当前挑战
该数据集主要面临的挑战源于多领域与多语言的复合性。在领域问题层面,MMLU原有57个学术与专业科目的知识跨度极大,涵盖人文、科学、法律等迥异领域,要求模型具备广泛的世界知识与复杂的推理能力;而将其翻译为七种语言时,语言歧义、文化语境差异及术语不对等问题使得等价语义迁移尤为困难,直接影响了评测结果的解释力。在构建过程中,挑战集中于自动化翻译质量的控制:研究团队需确保翻译后的题目与选项保持原意且无歧义,为此探究了Self-Check、Best-of-N、Universal Self-Improvement(USI)及T-RANK多轮排序等测试时计算策略。此外,各语言数据源的格式、分割及许可协议不一致,整合为统一HuggingFace配置时需精细处理,同时需警惕评测数据在目标语言中的泄露风险与语义漂移问题。
常用场景
经典使用场景
MMLU多语言数据集(rit-mmlu)是经典的大规模多任务语言理解基准MMLU的多语言扩展版本,其核心应用场景在于全面评估语言模型在跨越57个学术与专业领域的通用知识与推理能力上的表现,且覆盖乌克兰语、斯洛伐克语、罗马尼亚语、爱沙尼亚语、立陶宛语、希腊语和土耳其语等七种中欧及东欧语言,为跨语言模型的零样本或少样本推理能力提供了标准化的评测平台。
解决学术问题
在学术研究中,该数据集直面当前大语言模型评测高度集中于英语的问题,解决了非英语语言环境中模型知识广度和推理能力难以量化评估的困境。通过提供高质量、人工校验的翻译基准,它使得研究者能够系统性地探究模型在不同语言间的知识迁移效果、跨语言泛化性能以及机器翻译带来的评测偏差,对推动多语言自然语言处理评测体系的完善具有里程碑式的意义。
实际应用
在实际应用中,rit-mmlu数据集广泛服务于多语言AI产品的质量把控与优化,例如教育领域的智能辅导系统可通过该基准检验其在希腊语或土耳其语等语种下数学、历史等科目的问答准确性;企业级多语言客服机器人亦能利用此数据集评估其在罗马尼亚语或乌克兰语等场景下的问题解决合规性与合理性。此外,语种适配的翻译引擎和跨语言知识图谱构建项目均能以此作为验证其技术路线的重要参考。
数据集最近研究
最新研究方向
随着多语言大语言模型的快速发展,如何高效、可靠地将其评估基准扩展到非英语语言成为前沿焦点。rit-mmlu数据集应运而生,它基于经典的MMLU基准,通过RiTranslation自动化流水线将涵盖57个学科的多选题翻译为乌克兰语、斯洛伐克语、罗马尼亚语等七种东欧和南欧语言。该研究方向聚焦于利用Self-Check、Best-of-N、T-RANK等测试时计算策略提升翻译质量,从而为多语言LLM提供更可信的评估手段。这一工作打破了语言壁垒,推动模型在资源较少语言上的能力验证,呼应了全球AI社区对评估公平性和文化包容性的迫切需求,为多语言模型的跨语言泛化研究树立了重要标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务