遇见数据集

PluraMath

收藏
Hugging Face2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

PluraMath是一个人工整理的多语言数学推理基准测试数据集,旨在将PolyMath基准扩展到18种未被充分代表的语言,涵盖6个语系,包括从中等资源语言(如印地语、土耳其语)到极端低资源语言(如上索布语、下索布语,母语者少于1.5万)。该数据集基于PolyMath的结构,每种语言包含500个竞赛风格的数学问题,分为四个难度等级:低(K-12文字题)、中(高中/大学考试与练习)、高(中高难度竞赛)、顶级(奥林匹克及前沿数学)。每个难度等级包含125个问题,每个问题实例包括目标语言的问题陈述和采用oxed{}格式的标准答案。数据集总共包含18种语言,共计9,000个人工验证的问题翻译。数据通过三阶段人工参与流程构建:初稿自动翻译、母语者手动验证与校正、自动化与手动LaTeX检查及最终错误分析。该数据集适用于评估大型语言模型在多语言数学推理任务上的性能,特别是揭示高资源语言与未被充分代表语言之间的推理能力差距。

PluraMath is a manually curated multilingual mathematical reasoning benchmark dataset, aiming to extend the PolyMath benchmark to 18 underrepresented languages, covering 6 language families, including from medium-resource languages (such as Hindi, Turkish) to extremely low-resource languages (such as Upper Sorbian, Lower Sorbian, with fewer than 15,000 native speakers). The dataset is based on the structure of PolyMath, with each language containing 500 competition-style mathematical problems, divided into four difficulty levels: low (K-12 word problems), medium (high school/university exams and exercises), high (medium-to-high difficulty competitions), and top (Olympiad and cutting-edge mathematics). Each difficulty level contains 125 problems, and each problem instance includes a problem statement in the target language and a standard answer in oxed{} format. The dataset comprises 18 languages in total, with a total of 9,000 manually validated problem translations. The data is constructed through a three-stage human-involved process: initial draft automatic translation, manual verification and correction by native speakers, automated and manual LaTeX checks, and final error analysis. This dataset is suitable for evaluating the performance of large language models on multilingual mathematical reasoning tasks, particularly to reveal reasoning capability gaps between high-resource and underrepresented languages.

创建时间:
2026-07-03
原始信息汇总

数据集概览:PluraMath

PluraMath 是一个人工策划的多语言数学推理基准数据集,旨在将数学推理评估扩展到高资源语言之外。它基于 PolyMath 基准构建,覆盖了 18 种代表性不足的语言,这些语言分属 6 个语系,从中度资源的印地语和土耳其语,到极端低资源的上下索布语(母语者少于 1.5 万)。

数据集规模与结构

  • 总问题数:每种语言包含 500 道竞赛风格数学题,总计 9,000 道人工验证的翻译问题
  • 难度级别:问题分为四个难度等级,每个等级 125 道题
    • low:K-12 应用题
    • medium:高中/大学考试及习题
    • high:中高难度竞赛题
    • top:奥赛及前沿数学题
  • 数据特征:每条数据包含 idquestion(目标语言问题描述)和 answer(标准答案,期望以 oxed{} 格式输出)。
  • 许可证:Apache 2.0。

覆盖的语言

数据集中包含的 18 种语言及其配置名称(config_name)如下:

  • am(阿姆哈拉语)
  • ca(加泰罗尼亚语)
  • chv(楚瓦什语)
  • cs(捷克语)
  • dsb(下索布语)
  • el(希腊语)
  • he(希伯来语)
  • hi(印地语)
  • hsb(上索布语)
  • kk(哈萨克语)
  • or(奥里亚语)
  • pl(波兰语)
  • sk(斯洛伐克语)
  • sr(塞尔维亚语)
  • tr(土耳其语)
  • tt(鞑靼语)
  • uk(乌克兰语)
  • uz(乌兹别克语)

每种语言的数据都包含 lowmediumhightop 四个拆分(split),每个拆分的大小约为 125 个样本。

数据构建流程

数据集通过一个三阶段人工参与的流程构建:

  1. 初稿翻译:使用每种语言最强大的可用系统(如DeepL、Gemini、Sarvamai、SalamandraTA、TartuNLP)进行自动翻译。
  2. 人工验证:由每种语言的 母语者 进行彻底的验证和修正。
  3. 质量控制:自动和人工结合的 LaTeX 检查及最终错误分析。

基准测试亮点

使用 PluraMath 对 27 个推理大语言模型 进行了评估,关键发现包括:

  • 性能差距普遍存在:语言技术支撑度与数学推理表现之间存在显著相关性(语言资源类别与基准排序的 Spearman ρ = 0.646)。高资源语言与目标语言的平均差距为 +2.15 难度加权准确率 (DW-Acc)
  • 闭源模型领先且更稳定:如 Claude-Haiku-4.5GPT-5.4 在所有评估语言上表现最佳且保持稳定。
  • 长推理不等于好推理:最佳模型产生正确答案的推理过程往往更短。
  • 翻译质量部分解释推理能力:翻译质量(chrF++)与数学准确率之间存在中等程度的相关性(r = +0.45)。

使用与引用

  • 预期用途:用于评估大语言模型的多语言数学推理能力。请勿使用测试数据进行训练

  • 加载方式示例: python from datasets import load_dataset ds = load_dataset("TUM-NLP/PluraMath", "uk", split="test") print(ds[0])

  • 相关资源

    • 论文:https://arxiv.org/abs/2607.05992 (注意:页面上提供的链接为占位符,实际地址可能不同)
    • 代码与评估框架:https://github.com/TUM-NLP/pluramath
    • 项目页面:https://tum-nlp.github.io/pluramath/
    • 基础基准:https://huggingface.co/datasets/Qwen/PolyMath
搜集汇总
数据集介绍
构建方式
PluraMath数据集以PolyMath基准为基石,通过一个精心设计的三阶段人工介入流程构建而成。首先,针对每种语言,选用当前最强大的机器翻译系统(如DeepL、Gemini等)进行初版翻译。随后,由母语者执行严格的手工验证与修正,确保翻译的准确性。最后,通过自动化和人工相结合的方式检查LaTeX格式的正确性,并完成最终的错误分析。该流程覆盖了18种语言,每种语言均包含500道源自竞赛的数学问题,按照难度分为低、中、高、顶尖四个层级,每个层级125题,总计9000个人工验证的问题翻译。
特点
该数据集的核心特色在于其对低资源语言数学推理能力的深入评测。它横跨6个语系,涵盖了从印地语、土耳其语等中等资源语言,到上索布语、下索布语等极端低资源语言(母语者不足1.5万人)。每个语言子集均包含四个难度梯度的问题,确保评测的全面性与区分度。数据集揭示了语言资源丰富度与数学推理性能之间显著的相关性(斯皮尔曼相关系数ρ = 0.646),并展现了闭源模型在不同语言间的表现稳定性远超开源模型,同时发现更长的推理链并不必然带来更准确的答案。
使用方法
PluraMath专为多语言数学推理评估而设计,不应用于训练。使用者可通过Hugging Face Datasets库便捷加载特定语言的子集,例如使用`load_dataset("TUM-NLP/PluraMath", "uk", split="test")`加载乌克兰语测试集。每个数据样本包含问题陈述(question)和标准答案(answer),且答案均采用`\boxed{}`格式包裹,便于自动化提取。研究者可沿用原PolyMath的评估框架,计算不同难度层级上的加权准确率(DW-Acc),并利用本数据集开源的代码框架,轻松扩展至其他未覆盖的语言。
背景与挑战
背景概述
PluraMath数据集由德国慕尼黑工业大学自然语言处理研究组于2026年创建,旨在突破数学推理评估在资源匮乏语言中的局限性。该数据集基于PolyMath基准框架,通过人工审定翻译将500道数学竞赛题扩展至18种低资源语言,涵盖6个语系,包括使用人数不足1.5万的上下索布语。研究团队邀请了18位母语者参与验证,构建了包含9000个高质量问题的评估体系。这一工作填补了多语言数学推理评估中低资源语言的空白,揭示了语言技术支持与模型推理能力之间的显著相关性(Spearman ρ=0.646),对推动公平性评估和跨语言NLP研究具有重要影响。
当前挑战
PluraMath致力于解决的核心挑战在于,现有数学推理基准多聚焦于英语等高资源语言,导致模型在低资源语言上的泛化能力严重不足,评估结果存在显著的资源偏好偏差(平均差距+2.15 DW-Acc分数)。在构建过程中,团队面临多重困难:低资源语言缺乏高质量翻译系统,需综合使用DeepL、Gemini等不同工具进行初译;必须依靠母语者逐条验证,确保翻译准确性和数学格式规范;同时需平衡不同语言间的难度一致性,避免文化差异带来的题目理解偏差。此外,模型在低资源语言中常出现中途切换至英语、推理链不完整等问题,进一步增加了评估的复杂性。
常用场景
经典使用场景
PluraMath是一套精心设计的多语言数学推理评测基准,其核心用途在于评估大语言模型在低资源语言上的数学解题能力。该数据集覆盖18种代表性不足的语言,包括印欧、乌拉尔、突厥等六大语系,每种语言包含500道竞赛风格数学题,并按难度划分为低、中、高、顶尖四个层次。研究者可借助这一资源,系统性地考察模型在阿姆哈拉语、上下索布语等极小资源语言上的推理表现,从而揭示当前语言技术在不同语言社群之间的性能鸿沟。
实际应用
在实际应用中,PluraMath可用于多语言教育智能系统的能力评估与优化。例如,教育科技公司可借助该数据集评测其数学辅导模型在土耳其语、乌克兰语等语言上的表现,从而针对性地提升低资源语言用户的答疑质量。此外,该数据集还可服务于机器翻译系统的数学文本翻译评估,以及多语言推理增强策略(如链式思维提示)的效果验证,推动语言智能在教育、科研等领域的跨语言落地与平等发展。
衍生相关工作
PluraMath的发布催生了若干重要的衍生研究工作。其基础框架继承自PolyMath基准,但通过引入18种低资源语言,拓展了多语言数学推理的研究边界。基于该数据集的研究者已开发出配套的数据采集与评估工具链,降低了其他低资源语言基准构建的门槛。此外,关于推理质量退化机制、翻译质量与数学准确率相关性、以及元认知策略(如链式思维提示)跨语言泛化性等议题,均成为后续学术探索的热点,推动多语言推理研究走向纵深。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务