MathArena/brokenarxiv-0526
收藏官方服务:
资源简介:
该数据集包含来自2026年5月BrokenArXiv的问题,用于MathArena排行榜。
This dataset comprises questions from BrokenArXiv in May 2026, designed for the MathArena leaderboard.
提供机构:
MathArena搜集汇总
数据集介绍

构建方式
在数学推理与大型语言模型评估领域,构建具有挑战性和诊断性的基准数据集至关重要。brokenarxiv-0526数据集源自MathArena平台,由苏黎世联邦理工学院研究团队开发,旨在评估模型对错误数学陈述的证明能力。该数据集通过从arXiv论文中人工筛选并构造具有微妙错误的数学陈述构建而成,共计50个训练样本。每个样本包含问题索引、分值评分方案、原始错误陈述及其正确版本、来源、标题和作者信息,确保数据来源的学术可溯性。
特点
该数据集的核心特点在于其专注于错误数学陈述的证明任务,而非传统的正确命题求解。每个问题均为故意设计或源自真实论文中存在的假命题,要求模型识别并论证其谬误,从而深度考验模型的数学严谨性与批判性推理能力。数据集的评分采用非最终答案式的证明型评分方案,强调推理过程的完整性,分值根据问题复杂度设置。数据集采用Attribution-ShareAlike 4.0国际许可协议,支持学术研究与开放共享。
使用方法
使用该数据集时,用户可通过HuggingFace Datasets库直接加载语料:`load_dataset("brokenarxiv-0526", split="train")`。数据集以默认配置提供单一分片,包含50个训练样本。用户可利用问题字段`problem`向模型提供错误陈述,要求模型以自然语言形式给出反证或数学证明。对于条件型问题,可利用`condition`字段提供前提假设。模型输出将由评分方案`grading_scheme`进行评审,以验证证明的准确性与逻辑严密性。
背景与挑战
背景概述
在人工智能促进数学推理的浪潮中,大型语言模型(LLMs)的评估方法正经历深刻变革。2026年,由苏黎世联邦理工学院(ETH Zurich)的Jasper Dekoninck、Nikola Jovanović等研究人员构建的MathArena平台应运而生,其配套数据集BrokenArXiv-May 2026(简称brokenarxiv-0526)聚焦于数学错误辨识这一核心研究问题。该数据集精心收录了50道来自ArXiv预印本的故意引入错误的虚假数学命题,要求模型识别并证明其谬误。作为MathArena排行榜的基石,它填补了现有基准测试仅关注正确证明的空白,将评估维度从“证明正确性”拓展至“错误检测与批判性思维”,对推动LLMs在数学验证、科学严谨性审查等领域的应用具有深远影响。
当前挑战
BrokenArXiv-May 2026数据集所应对的领域挑战在于,传统数学推理基准如MATH、GSM8K多聚焦于求解正确问题,而忽略了LLMs在错误检测与逻辑纠偏上的能力评测——这恰是高级数学素养与科学严谨性的关键维度。在构建过程中,研究团队面临三大特定挑战:其一,如何从海量ArXiv论文中精准筛选出包含隐蔽逻辑错误的真命题,确保错误类型覆盖典型数学推理漏洞;其二,设计无歧义的评分机制(如points字段与grading_scheme)以应对开放性证明判断的主观性;其三,在仅50个示例的小样本规模下,平衡问题的难度梯度,避免模型通过模式匹配而非真正理解进行作答。这些挑战的克服使该数据集成为衡量LLMs数学批判能力的独特试金石。
常用场景
经典使用场景
BrokenArXiv-0526数据集源自MathArena评估平台,专为测试大语言模型在数学领域中的推理与证明能力而设计。该数据集包含50道精心构造的伪数学命题,要求模型判断其真伪并给出证明或反驳。经典使用场景聚焦于零样本或少样本条件下的形式化数学推理挑战,评估模型对数学逻辑的掌握程度、反例构造能力以及严谨证明的生成水平。研究者通过向模型输入这些带有故意错误的数学陈述,观察其能否识别其中的谬误并予以纠正,从而衡量模型在复杂数学问题上的鲁棒性与批判性思维水平。
解决学术问题
该数据集解决了当前大语言模型评估中缺乏高质量数学错误检测与证明任务的问题。传统的数学基准如GSM8K或MATH侧重于计算题的解答,而BrokenArXiv-0526开创性地引入了“识别错误命题并证明其错误”这一对称推理任务,填补了模型在逻辑反驳与归谬能力评估方面的空白。其学术意义在于揭示模型是否真正理解数学概念的内在联系,而非仅仅依赖模式匹配。该数据集推动了形式化推理评测从简单解题向深度理解与批判性思维迈进,为后续构建更全面的数学智能评估体系奠定了重要基础。
衍生相关工作
BrokenArXiv-0526作为MathArena平台的核心组成部分,催生了一系列围绕数学错误检测与对抗性推理的经典工作。例如,后续研究者基于该数据集提出了“数学错误分类框架”,系统性地分析模型在识别不同逻辑谬误(如循环论证、错误假设)时的表现差异。另一项衍生工作则构建了“严格证明偏好对齐”方法,利用数据集中错误的命题作为负样本,通过强化学习优化模型产生严谨证明的能力。此外,该数据集还被用于开发MathCritic系列模型,专精于对数学推理链条进行逐行审查,显著提升了自动定理证明的准确性。
以上内容由遇见数据集搜集并总结生成



