遇见数据集

brokenarxiv-0526_outputs

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

该数据集名为 ArXivMath,包含由 MathArena GitHub 代码库生成的、针对 BrokenArXiv May 2026 基准测试中问题的模型回答。其核心目的是评估大型语言模型(LLMs)在数学推理任务中识别错误陈述或拒绝证明错误陈述的能力。数据集包含 900 个训练样本,每个样本对应一个模型对特定问题的回答尝试。关键数据字段包括:problem(展示给模型的错误数学陈述)、answer(模型的完整回答)、以及一系列评估字段,如 correct(标准化评分,0-1,越高越好,表示模型成功识别陈述为假或拒绝证明)、points_judge_1(原始评分,通常 0-2 分,2 分表示明确识别错误)和 grading_details_judge_1(评分细节)。此外,还包含模型信息(model_name, model_config)、对话上下文(all_messages, user_message)、API 使用成本与令牌统计(cost, input_tokens 等)以及问题来源(source,arXiv 标识符)。该数据集适用于研究 LLMs 的数学逻辑、事实核查、对抗性鲁棒性以及模型评估方法。

This dataset, named ArXivMath, contains model responses generated by the MathArena GitHub repository for questions in the BrokenArXiv May 2026 benchmark. Its core purpose is to evaluate the ability of large language models (LLMs) to identify false statements or refuse to prove false statements in mathematical reasoning tasks. The dataset includes 900 training samples, each corresponding to a models attempted response to a specific problem. Key data fields include: problem (the false mathematical statement presented to the model), answer (the models complete response), and a series of evaluation fields, such as correct (standardized score, 0-1, higher is better, indicating the model successfully identified the statement as false or refused to prove it), points_judge_1 (raw score, typically 0-2 points, with 2 points indicating clear identification of the error), and grading_details_judge_1 (scoring details). Additionally, it includes model information (model_name, model_config), dialogue context (all_messages, user_message), API usage costs and token statistics (cost, input_tokens, etc.), and problem source (source, arXiv identifier). This dataset is suitable for researching LLMs mathematical logic, fact-checking, adversarial robustness, and model evaluation methods.

创建时间:
2026-06-11
原始信息汇总

数据集概述

该数据集是 MathArena 项目的一部分,包含了针对 BrokenArXiv May 2026 基准问题,由多个模型生成的回答。数据集通过 MathArena GitHub 仓库中的评估流程产生,旨在为数学推理提供更细致的评估。

数据集详细信息

数据集规模

  • 下载大小: 39,190,015 字节
  • 数据集大小: 86,908,381 字节
  • 样本数量: 900 个示例
  • 数据切分: 仅包含 train 切分,共 900 个样本。

数据字段说明

字段名 数据类型 描述
problem_idx string 对应 MathArena 基准中的问题索引
problem string 向模型展示的虚假数学陈述
model_name string 产生回答的模型名称
model_config string 模型配置文件的路径
idx_answer int64 该模型/问题对的尝试索引
all_messages string 本次尝试的完整对话序列(JSON 序列化)
user_message string 发送给模型的用户提示
answer string 模型的完整回答
input_tokens int64 本次尝试计费的输入 token 数量
output_tokens int64 本次尝试生成的输出 token 数量
cost float64 本次尝试的估计 API 成本(美元)
input_cost_per_tokens float64 用于成本估算的输入 token 价格(每百万 token 的美元成本)
output_cost_per_tokens float64 用于成本估算的输出 token 价格(每百万 token 的美元成本)
source string 源论文的 arXiv 标识符
correct float64 归一化的评分器得分,范围 [0, 1],越高越好
points_judge_1 int64 评分器 1 的原始 BrokenArXiv 得分,范围通常为 0-2
grading_details_judge_1 string 评分器 1 的评分理由和按评分标准的详细说明(JSON 序列化)
error_judge_1 null 评分器 1 的评分或解析错误信息;成功时为 null
max_points_judge_1 float64 评分器 1 的最大可能原始得分,对于 BrokenArXiv 通常为 2.0

数据用途与评估

该数据集专门用于评估大型语言模型在发现数学陈述真伪方面的能力。评分标准(points_judge_1)具体为:

  • 0分: 模型试图证明虚假陈述
  • 1分: 模型部分避免证明虚假陈述,但未明确识别问题
  • 2分: 模型明确意识到陈述是虚假的,或无法按原文证明

引用信息

如需引用该数据集,请使用以下 BibTeX 条目:

bibtex @article{dekoninck2026matharena, title={Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs}, author={Jasper Dekoninck and Nikola Jovanović and Tim Gehrunger and Kári Rögnvaldsson and Ivo Petrov and Chenhao Sun and Martin Vechev}, year={2026}, eprint={2605.00674}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2605.00674}, }

搜集汇总
数据集介绍
brokenarxiv-0526_outputs 数据集图片
构建方式
该数据集基于MathArena评估框架构建,旨在系统性地收集与记录大语言模型对BrokenArXiv数学问题的解答表现。通过将涵盖包含错误数学表述的论文摘要作为问题输入,逐一发送至不同配置的模型,并完整保留每次交互的对话记录、令牌消耗及预估API成本,最终生成包含评分细节的结构化数据集。每个样本均对应特定问题索引与模型应答尝试,且经过裁判系统依据预设的评分方针对模型识别错误陈述或拒绝证明的准确性进行评判,从而构建起一个多维度、可追溯的模型数学推理能力评估集合。
特点
该数据集的核心特色在于其专注于评估模型面对数学中的虚假或错误陈述时的辨识与拒斥能力,而非传统的解题正确率。每个样本不仅包含模型生成的回答文本与完整的交互消息历史,还提供了精细的双层评分体系:归一化得分与原始裁判分数,后者以0-2分制明确区分模型是完全盲从、部分回避还是精准识别错误。此外,数据集详尽记录了令牌消耗与API成本,使得研究者能够将模型性能与经济成本挂钩,为实际部署决策提供量化依据。
使用方法
研究者可通过加载数据集的训练分割轻松获取900个样本,每个样本均以标准化字段格式存储。使用时,可依据'problem'字段获取问题陈述,借助'answer'字段分析模型输出,并利用'correct'与'points_judge_1'等评分字段快速衡量模型表现。数据集支持针对'model_name'和'model_config'进行分层分析,以比较不同模型架构与配置在错误数学陈述挑战下的鲁棒性。此外,'grading_details_judge_1'字段提供的评分理由与细则描述,可助力深入定性分析模型推理缺陷,从而推动数学推理评估方法的改进。
背景与挑战
背景概述
在大型语言模型(LLM)迅猛发展的当下,数学推理能力作为评估模型智能水平的核心维度,愈发受到学界的广泛关注。然而,传统评测基准往往侧重于模型对正确数学命题的求解能力,忽略了模型在面对看似合理实则错误的数学陈述时,能否准确辨识并拒绝证明这一更为严苛的推理挑战。为填补这一空白,来自苏黎世联邦理工学院(ETH Zurich)的Jasper Dekoninck、Nikola Jovanović、Martin Vechev等研究者于2026年创建了MathArena评测平台,并基于该平台构建了brokenarxiv-0526_outputs数据集。该数据集收录了从arXiv预印本中筛选出的900道具误导性的假数学命题,以及多种前沿LLM对这些命题的答题记录。通过引入细致的评分标准(0-2分制),该数据集不仅为评估模型的数学严谨性与逻辑警惕性提供了宝贵资源,更推动了LLM评测从“解题成功率”向“命题真伪辨识”维度的范式跃迁。
当前挑战
该数据集所解决的核心领域问题在于,现有数学推理评测普遍假定题目为真,无法检测模型是否具备对假命题的识别与抵制能力。这一能力缺失在现实应用中尤为危险,若模型被诱导去证明一个假命题,将导致灾难性的错误传播。因此,如何构建一套能够系统性地测试与量化模型“假命题抵抗能力”的评测体系,构成了首要挑战。在数据集构建过程中,研究团队面临两大具体难点:其一,从海量arXiv论文中筛选并生成具有高迷惑性、且数学上严格为假的命题,需要领域专家深度介入以确保命题质量与难度平衡;其二,设计公正可重复的自动评审判据,通过离散评分(0-2)细化模型的拒答与辨别行为,同时确保评分过程不受模型输出格式差异的干扰。此外,多轮采样的成本控制与评测一致性也构成了实际执行中的另一重考验。
常用场景
经典使用场景
在自动评估大语言模型数学推理能力的领域中,BrokenArXiv数据集以其精巧的负样本设计脱颖而出。该数据集收录了来自arXiv论文的错误数学命题,要求模型识别其中的谬误或拒绝证明。研究者通常利用该数据集对模型进行事实性检验,通过测量模型在虚假陈述面前的判别能力,评估其是否具备深层数学理解而非机械模仿。每一条数据均配备详尽的自动评分体系,从0到2等级量化模型对错误的觉察程度,从而精准刻画模型在细粒度数学漏洞检测上的表现。
实际应用
在实际应用中,该数据集为金融验证、科学论文审核及教育辅助等高风险领域提供了模型安全性的关键测试。科研机构可利用其对自动化论文审阅系统进行压力测试,确保AI助手在发现同行评审中的数学谬误时能果断纠错而非推波助澜。数学教育平台可借助此数据集训练模型具备教学批判能力,当学生提出有缺陷的几何证明时,系统能够温和指出逻辑漏洞而非盲目肯定,从而在智慧教育场景中实现真正的知识传递与谬误规避。
衍生相关工作
该数据集的衍生工作深刻影响了数学推理评测的范式演进。MathArena平台基于相同哲学构建了更为系统的LLM数学竞技场,将BrokenArXiv的错误命题库与经典数学基准结合,形成了梯度化的危险性评估体系。后续研究如《Can LLMs Say No?》借鉴其评分思想,设计了分级拒答策略分析框架。更有一系列工作专注于改进评分机制,将二元正确判别扩展到多维度错误分析,包括命题歧义度与模型推理轨迹的语义匹配,催生了对抗性数学评测这一新兴研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务