MathArena/brokenarxiv-0426_outputs
收藏官方服务:
资源简介:
该数据集包含使用MathArena GitHub仓库生成的针对BrokenArXiv April 2026问题的模型答案。
This dataset contains model answers to the questions from BrokenArXiv April 2026 generated using the MathArena GitHub repository.
提供机构:
MathArena搜集汇总
数据集介绍

构建方式
该数据集基于MathArena评估平台构建,聚焦于BrokenArXiv 2026年4月发布的数学问题集。数据生成过程涉及向多种语言模型提交虚假数学陈述,并记录其回答与推理过程。每个问题均附有唯一标识符、模型名称、配置路径及尝试索引,以表征不同的推理尝试。同时,数据集详细记录了每次交互中的用户提示、完整模型回答、输入输出令牌数及预估API成本,从而全面捕捉模型在处理反事实命题时的行为特征。答案的真实性通过归一化评分(0至1)及细粒度裁判打分(0-2分制)予以评估,裁判依据包括模型是否识别出陈述为假或明确拒绝按原句证明。
特点
该数据集的核心特色在于其专注于评估大语言模型对虚假数学陈述的辨识与应对能力,区别于传统数学推理基准。每条样本不仅包含模型输出,还集成裁判的评分理由与标准化打分细则,支持多维度的性能剖析。数据集结构详尽,涵盖问题索引、源文献arXiv标识、令牌消耗及成本信息,便于进行经济性与效率分析。此外,所有样本均来自统一平台,确保了实验设置与评测标准的一致性。数据的CC-BY-SA-4.0许可协议为学术研究与复现提供了便利,使其成为研究模型数学鲁棒性与批判性思维的重要资源。
使用方法
该数据集适用于以HuggingFace Datasets库加载,可直接通过默认配置读取训练分割中的数据。使用者可依据'problem_idx'与'model_name'字段筛选特定问题或模型的回应,借助'correct'和'points_judge_1'字段评估模型表现。对于深入分析,'all_messages'与'grading_details_judge_1'字段提供了完整的交互历史与裁判推理过程,支持定性研究。在进行成本效益分析时,可结合'input_tokens'、'output_tokens'及'cost'字段计算不同模型的资源消耗。建议研究者配合MathArena官方仓库中的评估脚本,以复现原有评分流程或扩展新的评测维度。
背景与挑战
背景概述
在大型语言模型(LLM)迅猛发展的浪潮中,如何精准评估其数学推理能力,尤其是对虚假数学命题的识别与批判性思维,已成为领域内亟待探索的前沿课题。基于此背景,由Jasper Dekoninck、Nikola Jovanović等学者于2026年创建的brokenarxiv-0426_outputs数据集,依托MathArena评估平台,系统收录了多款模型对BrokenArXiv基准中数学错误陈述的回答。该数据集通过细粒度的评分机制,量化模型在面对虚假命题时的表现,不仅揭示了模型在数学真实性判断上的局限性,还为提升LLM的鲁棒性与推理可信度提供了关键基准,对推动AI数学评估范式的革新具有重要意义。
当前挑战
该数据集的核心挑战在于应对LLM在数学虚假命题识别任务中的结构性缺陷:许多模型倾向于无条件证明给定的数学陈述,即便该陈述为假,这暴露了模型在深层逻辑判断与事实甄别上的脆弱性。此外,构建过程亦面临多重技术难题,包括如何从海量arXiv论文中精准提取并构造高质量的假命题,设计能区分‘直接证明’、‘部分回避’与‘明确拒绝’的评分标准,以及应对不同模型输出格式的多样性。数据集仅含1220个样本的规模,也反映出在保证标注质量与样本代表性之间寻求平衡的艰难取舍。
常用场景
经典使用场景
BrokenArXiv April 2026数据集专为评估大语言模型在数学推理中的鲁棒性与批判性思维能力而设计。其核心场景是向模型呈现精心构造的虚假数学命题,要求模型识别这些命题的错误本质,而非盲目尝试证明。该数据集通过标准化评分机制,量化模型在面对错误数学陈述时的反应——从错误证明到明确拒绝或识别错误,从而提供一个细粒度的评测框架。研究者常利用此数据集检验模型是否具备超越表面形式的深层数学理解,以及是否能抵御数学形式上的误导性表述。
衍生相关工作
基于BrokenArXiv数据集,学界已衍生出多项重要工作。MathArena平台作为其基础框架,提供了可复现的评估流水线,并推动了数学推理全面评测体系的建立。后续研究借鉴其“错误命题检测”范式,扩展至物理、编程等领域的虚假陈述识别。部分工作致力于改进模型的否定理解能力,例如通过对抗训练或特定提示策略增强模型对错误前提的敏感性。此外,该数据集还激发了对“模型自信度校准”的探索——如何使模型在面对无法验证的命题时给出更合理的置信估计,这些成果共同丰富了大语言模型鲁棒性研究的理论图谱。
数据集最近研究
最新研究方向
该数据集聚焦于评估大语言模型在数学推理领域的鲁棒性与真实性,通过呈现包含错误数学命题的挑战性题目,检验模型能否识别虚假论断而非盲目证明。这一方向与当前对模型事实性、安全性和对抗性鲁棒性的研究热点紧密相连,有助于揭示模型在复杂数学语境下的理解偏差与脆弱性,推动构建更为可信的推理评估体系。
以上内容由遇见数据集搜集并总结生成



