MMLU-ProX
收藏资源简介:
MMLU-ProX 是一个多语言基准,建立在 MMLU-Pro 的基础上,扩展到 13 种类型多样的语言,旨在评估大型语言模型在跨语言和文化边界时的推理能力。MMLU-ProX 通过扩展到 13 种类型多样的语言、建立在 MMLU-Pro 的挑战性推理设计基础上、采用严格的半自动翻译过程并经过专家验证、确保概念准确性、术语一致性和文化相关性,解决了现有多语言基准的关键限制。
MMLU-ProX is a multilingual benchmark built upon MMLU-Pro, which has been extended to cover 13 diverse languages, aiming to evaluate the reasoning capabilities of large language models (LLMs) across cross-lingual and cross-cultural boundaries. MMLU-ProX addresses the key limitations of existing multilingual benchmarks by extending its coverage to 13 diverse languages, leveraging the challenging reasoning design of MMLU-Pro, adopting a rigorous semi-automatic translation process verified by experts, and ensuring conceptual accuracy, terminological consistency and cultural relevance.
MMLU-ProX: 多语言大型语言模型评估基准
Overview
- 数据集名称:MMLU-ProX
- 数据集类型:多语言基准测试
- 语言覆盖:13种类型不同的语言
- 设计目的:评估大型语言模型在语言和文化边界上的推理能力
- 改进点:
- 扩展至13种类型不同的语言
- 基于MMLU-Pro的具有挑战性的推理聚焦设计
- 采用严格的半自动翻译过程,并经过专家验证
- 确保概念准确性、术语一致性和文化相关性
News
- [2025年3月] MMLU-ProX已在Hugging Face上发布!
- [2025年3月] 我们仍在扩展此数据集以支持更多语言!敬请期待。
Usage
- 使用说明:即将推出
Citation
- 引用信息:即将推出
Contact
- 联系方式:如有关于MMLU-ProX的问题或反馈,请提交一个issue。




