遇见数据集

tum-nlp/PluraMath

收藏
Hugging Face2026-07-08 更新2026-07-22 收录
官方服务:

资源简介:

PluraMath是一个人工策划的多语言数学推理基准,将PolyMath基准扩展到18种代表性不足的语言,涵盖6个语系,从中等资源语言(如印地语、土耳其语)到极端低资源语言(如上索布语和下索布语,母语者少于1.5万)。每个语言包含500个竞赛风格的数学问题,分为四个难度级别(低、中、高、顶级),所有问题均由母语者验证。数据集用于评估大型语言模型在多语言数学推理上的性能,揭示了高资源语言与代表性不足语言之间的持续差距。数据通过三阶段人工循环流程构建:自动翻译、人工验证和质量控制。

PluraMath is a human-curated multilingual mathematical reasoning benchmark that extends the PolyMath benchmark to 18 additional underrepresented languages spanning 6 language families, from mid-resource languages such as Hindi and Turkish down to extreme low-resource languages such as Upper and Lower Sorbian (< 15k L1 speakers). Every language contains 500 competition-style math problems across four difficulty levels (low, medium, high, top), all validated by native speakers. The dataset is used to evaluate LLMs on multilingual mathematical reasoning, highlighting a persistent gap between high-resource and underrepresented languages. It was constructed through a three-stage, human-in-the-loop pipeline: automatic translation, manual verification, and quality control.

提供机构:
tum-nlp
搜集汇总
数据集介绍
tum-nlp/PluraMath 数据集图片
构建方式
PluraMath数据集通过一套严谨的三阶段人机协同流水线构建而成。首先,针对每种目标语言,利用当前可获取的最强机器翻译系统(如DeepL、Gemini、Sarvamai等)将PolyMath基准中的数学问题(包含K-12应用题至奥林匹克竞赛题)自动翻译为第一稿译文。随后,招募母语人士对每一份译文进行逐条审核与校正,确保其语言准确性与数学含义的完整性。最后,执行自动化与人工结合的LaTeX语法检查及最终错误分析,以消除技术性瑕疵。这套流程为18种低资源语言各生成了500道经本地化验证的高质量数学题,总计9000条数据。
特点
该数据集的核心特色在于其卓越的语言覆盖广度与难度分层设计。它跨越6个语系,涵盖了从印地语、土耳其语等中等资源语言,到母语使用人数不足1.5万的上索布语与下索布语等极端低资源语言。每门语言下的500道题目严格遵循四个递进难度层级(低、中、高、顶级),确保了评测颗粒度。此外,所有翻译均经过母语专家的细致校验,保证了问题的语言地道性与内容保真度,使其成为评估大型语言模型在多语言环境下数学推理能力的稀缺且高质量的工具。
使用方法
PluraMath专为评估多语言数学推理能力而设计,严禁用于训练数据。用户可通过Hugging Face的datasets库便捷调用,示例代码如下:`from datasets import load_dataset; ds = load_dataset("TUM-NLP/PluraMath", "uk", split="test")`。使用时需指定语言代码(如'uk'代表乌克兰语)以获取特定语种子集。每个样本包含问题陈述(question)与标准答案(answer),其中预期最终答案需以`\boxed{}`格式呈现。研究者可通过调整难度层级的分片(split)进行针对性分析,或结合提供的评估框架对模型进行系统性基准测试。
背景与挑战
背景概述
在大型语言模型(LLM)迅猛发展的当下,数学推理能力作为评估模型认知水平的核心维度,其评测基准却长期失衡于英语等少数高资源语言。PluraMath数据集由德国慕尼黑工业大学自然语言处理组(TUM-NLP)主导构建,联合多国研究者于2026年推出,旨在系统性弥补这一空缺。该数据集将普适性的PolyMath评测框架拓展至18种长期被忽视的语言,涵盖印度-雅利安语系、突厥语系、斯拉夫语系等6个语系,从印地语、土耳其语等中等资源语言,到仅有不足1.5万母语者的上索布语和下索布语等极端低资源语言。每个语种精心收录500道按难度分级的数学竞赛题,总量达9,000条由母语者严格验证的翻译实例,为跨语言数学推理能力提供了迄今为止覆盖面最广的标准化评估工具。
当前挑战
PluraMath数据集直面并揭示了多语言数学推理领域的双重挑战:其一,模型在处理语言资源差异时表现出显著不公平性。对27个推理型LLM的基准测试显示,语言技术支撑度与数学推理性能存在强相关性(Spearman ρ=0.646),高资源语言平均比目标语言高出2.15个难度加权准确率点,在楚瓦什语和阿姆哈拉语中这一差距更升至4.86点。其二,构建过程本身面临多重技术壁垒,包括为18种语言开发专门的数据采集流水线,为低资源语言在DeepL、Gemini等系统中找到最佳翻译方案,以及确保所有翻译通过母语专家人工核验并统一最终答案以LaTeX命令表示。此外,模型在低资源语言场景下频繁出现中途切换至英语推理、步骤逻辑断裂及因Token预算不足而中断的问题,进一步证实扩展评测语系是当前LLM研究中的关键瓶颈。
常用场景
经典使用场景
在自然语言处理与多语言推理的交叉领域中,PluraMath被广泛用作评估大语言模型在数学推理任务上跨语言泛化能力的基准。该数据集涵盖18种资源匮乏或中低资源语言,每种语言包含500道源自竞赛的数学问题,并按难度等级分为四个层级。研究者通过对比模型在高资源语言(如英语)与目标语言上的推理准确率,能够系统地衡量其数学推理能力在多语言环境下的稳健性与迁移效率。该基准尤其适用于研究语言资源丰富程度如何影响模型在复杂推理任务上的表现。
解决学术问题
PluraMath的核心学术贡献在于揭示了当前语言模型在数学推理上存在的显著且顽固的语言资源鸿沟。通过量化27种推理模型在18种低资源语言上的表现,研究发现语言技术支持程度与推理性能之间存在强相关性(Spearman ρ = 0.646),平均高资源语言与目标语言之间准确率差距达2.15个百分点。此外,实验表明模型在低资源语言中频繁切换至英语进行推理,推理步骤的连贯性下降,且容易超出令牌预算。这些发现为多语言推理的公平性评估提供了重要实证基础。
衍生相关工作
PluraMath的发布催生了多项后续研究,其中包括对多语言推理中提示策略的系统性探索,例如基于英语思维链(En-CoT)与回译方法的有效性分析。此外,研究者基于该数据集进一步分析了翻译质量(chrF++)与数学推理准确率之间的中度相关性(r = +0.45),催生了将翻译增强与推理优化相结合的模型训练范式。该数据集还作为扩展基准,被用于检验新型开源模型(如DeepSeek-V3.2、Gemma系列)在低资源语言上的推理稳定性,推动了多语言评估框架的标准化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务