遇见数据集

livemath-v7-2603-2606

收藏
Hugging Face2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

LiveMathematicianBench v7 是一个自动生成、可定期刷新的研究级数学多选题基准测试,专为评估前沿 AI 模型在高等数学推理能力而设计。该数据集由哥伦比亚大学和微软研究院联合创建,数据来源为 2026 年 3 月至 6 月期间新发表的 arXiv 数学论文。每个问题都基于一篇论文中的一个定理,干扰项则从该定理的证明草稿中对抗性生成,并通过多阶段难度流水线确保最终集合对最强模型也具有挑战性。数据集按月份组织,每个月份包含四个子集:所有生成的多选题(full/)、经过质量过滤(评分规则 ALS+TAS+GPS+DQS 总分≥5)的子集(ge5/)、最难的子集(hard/,每个源定理仅保留一个最难问题)以及独立的复测结果。共有 431 个 hard 级别问题,GPT-5.4(medium)在该子集上的准确率为 42.5%。该基准测试适用于衡量模型在数学问题理解、定理应用和推理方面的能力,尤其适合用于评估大型语言模型的数学推理水平。

LiveMathematicianBench v7 is an automatically generated, periodically refreshable research-grade mathematical multiple-choice benchmark designed to evaluate the advanced mathematical reasoning capabilities of cutting-edge AI models. The dataset was jointly created by Columbia University and Microsoft Research, with data sourced from arXiv mathematics papers newly published between March and June 2026. Each question is based on a theorem from a paper, and the distractors are adversarially generated from the proof sketch of that theorem. A multi-stage difficulty pipeline ensures that the final set is challenging even for the strongest models. The dataset is organized by month, with each month containing four subsets: all generated multiple-choice questions (full/), a quality-filtered subset (ge5/, with a total score of ALS+TAS+GPS+DQS ≥ 5), the hardest subset (hard/, retaining only the most difficult question per source theorem), and independent retest results. There are 431 hard-level questions, and GPT-5.4 (medium) achieves an accuracy of 42.5% on this subset. The benchmark is suitable for measuring a models ability in mathematical problem understanding, theorem application, and reasoning, especially for evaluating the mathematical reasoning level of large language models.

创建时间:
2026-07-24
原始信息汇总

LiveMathematicianBench v7 数据集概述

基本信息

  • 数据集名称:LiveMathematicianBench v7(覆盖 arXiv 2026年3月至6月)
  • 许可证:CC-BY-4.0
  • 任务类型:问答(question-answering)
  • 标签:数学、研究级、基准测试、抗污染
  • 来源机构:哥伦比亚大学与微软研究院

核心特点

该基准测试为自动化、可刷新的研究级数学多选题数据集,题目源自最新发表的 arXiv 数学论文,通过构造方式实现抗污染。每个问题基于近期论文中的定理,干扰项根据证明草图对抗性生成,多阶段难度流水线确保最终题目对前沿模型具有较高难度。

数据组织

按月份目录(202603/、202604/、202605/、202606/)组织,每月包含:

文件路径 内容说明
full/qaEval_<month>_full.json 所有生成的多选题(v5)
ge5/qaEval_<month>_ge5.json 质量过滤后的题目(评分≥5)
hard/qaEval_<month>_ge5_hard.json 最终困难子集(每个源定理选一个最难题目)
hard/accuracy_test_<month>_medium_filter2.json 最终独立重测结果
summary.json 每月漏斗数据汇总

基准测试结果(GPT-5.4 medium 在最终困难集上)

月份 困难题数 准确率
2026-03 112 37.5%
2026-04 108 42.6%
2026-05 95 48.4%
2026-06 116 42.2%
总体 431 42.5%

注:准确率越低表示题目越难,完整的生成→过滤→非平凡题干→困难集漏斗见 summary.json

搜集汇总
数据集介绍
livemath-v7-2603-2606 数据集图片
构建方式
该数据集由哥伦比亚大学与微软研究院联合构建,旨在打造一个可自动刷新、抗污染的数学研究级问答基准。其构建方式基于arXiv上最新发表的数学论文,每个问题均锚定于某篇论文中的定理,干扰项则依据证明草稿进行对抗性设计。数据集按月份(2026年3月至6月)组织,每月的完整问题集经过多阶段质量筛选,包括质量评分(ALS+TAS+GPS+DQS总分≥5)和难度筛选,最终每个源定理仅保留最难的一个问题,形成最终hard子集。整个流程通过summary.json记录生成漏斗,确保问题对前沿模型具有挑战性。
特点
该数据集的核心特色在于其抗污染性和高难度。由于问题源自最近发表的arXiv论文,构建时即排除了与已有基准重叠的可能性,从而有效抵御数据污染。对抗性生成的干扰项基于定理的证明草图,使得问题无法通过表面模式匹配解决。多阶段硬度管道(从完整集到ge5再到hard子集)确保最终431个hard问题对当前最强模型(如GPT-5.4)的平均准确率仅为42.5%,显著低于一般基准,凸显其作为前沿数学推理评测工具的标杆价值。
使用方法
该数据集适用于评估和推动研究级数学推理模型的发展。用户可按月份直接加载JSON格式的问题文件,选择full、ge5或hard子集进行测试。每个问题为多项选择题,需结合数学定理理解进行推理。建议使用独立的重测结果文件(accuracy_test)作为验证基准,以校准模型性能。由于问题难度较高,可先使用ge5子集进行调优,再在hard子集上进行最终评测,以衡量模型的极限。同时,数据集的刷新机制允许定期更新,确保持续跟踪模型能力的进步。
背景与挑战
背景概述
LiveMathematicianBench v7(livemath-v7-2603-2606)是由哥伦比亚大学与微软研究院于2026年联合推出的研究级数学多选题基准测试集,旨在评估前沿大语言模型在高等数学推理上的能力。该数据集依托arXiv上最新发表的数学论文,自动生成基于定理的题目,并辅以对抗性干扰项与多阶段难度筛选流程,从根本上规避了数据污染问题,为数学推理研究提供了动态、可持续更新的评测平台。其核心研究问题聚焦于模型对新颖数学概念的理解与演绎能力,而非记忆已有知识。自发布以来,该基准已对GPT-5.4等前沿模型产生显著影响,其hard子集准确率仅约42.5%,凸显了当前模型在科研级数学推理上的局限,推动了该领域评测方法论的革新。
当前挑战
该数据集所面临的挑战涵盖领域问题与构建过程两个维度。在领域层面,研究级数学问题远超传统基准的难度,要求模型具备深层的定理理解、跨步骤逻辑推导与创造性思维,而现有模型在面临需多步推理或抽象概念时表现脆弱,准确率普遍低于50%,反映出通用推理能力的短板。在构建过程中,自动生成高质量且污染免疫的题目极具难度:需从海量arXiv论文中精准提取核心定理,设计不可区分的干扰项以避免猜测,并通过ALS、TAS等多重质量指标筛选,同时保证每个定理仅保留一道最难题,以平衡难度、代表性与资源消耗。此外,按月更新的动态机制要求流水线在短周期内完成生成、过滤与独立重测,确保时效性与稳定性,这对自动化系统的鲁棒性提出了严峻考验。
常用场景
经典使用场景
在数学推理与人工智能交叉领域,LiveMathematicianBench v7(livemath-v7-2603-2606)作为一项自动更新的研究级数学多选题基准,其经典应用场景聚焦于评估前沿大语言模型在最新数学文献理解上的推理能力。通过从2026年3月至6月新发表的arXiv论文中提取定理构造问题,该数据集利用对抗性干扰项和多阶段难度筛选,为模型提供高难度的挑战。研究者常以该基准的hard子集为测试床,衡量模型对数学证明逻辑的深层掌握,从而推动数学推理技术的前沿探索。
衍生相关工作
基于该数据集的构建理念,衍生出一系列相关工作,包括抗污染基准的设计框架、自动化问题生成技术的优化、以及多准则质量评估体系(如rubric ALS+TAS+GPS+DQS)的应用扩展。研究者借鉴其“最新论文驱动”模式,探索在其他科学领域(如物理、计算机科学)建立类似动态基准;同时,其对抗性干扰项生成策略激发了对硬例挖掘算法的研究。此外,该数据集的评估结果被用于训练奖励模型和强化学习环境,助力推理模型的迭代进化,推动了数学人工智能向更高层次发展。
数据集最近研究
最新研究方向
该数据集聚焦于研究级数学推理的自动化评估,通过从最新arXiv论文中提取定理并生成对抗性多选题,构建了一个抗污染的动态基准。其核心方向在于利用前沿大模型(如GPT-5.4)测试数学难题的解答能力,实测准确率约42.5%,揭示了当前模型在高级数学推理上的显著短板。此工作由哥伦比亚大学与微软研究院联合推进,推动了数学人工智能评估从静态题库向动态、可刷新的范式转变,为衡量模型在科学发现层面的泛化能力提供了新标尺,对数学教育智能化和自动定理证明研究具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务