遇见数据集

INSAIT-Institute/ProofRank

收藏
Hugging Face2026-06-24 更新2026-06-14 收录
官方服务:

资源简介:

--- dataset_info: features: - name: problem_id dtype: string - name: problem dtype: string - name: gold_answer dtype: string - name: in_diversity_eval dtype: bool - name: human_solution_summaries list: string - name: technique dtype: string splits: - name: main num_bytes: 1472173 num_examples: 382 - name: adaptivity num_bytes: 205869 num_examples: 445 download_size: 802720 dataset_size: 1678042 configs: - config_name: default data_files: - split: main path: data/main-* - split: adaptivity path: data/adaptivity-* --- # ProofRank: Evaluating LLM Proof Quality beyond Correctness This dataset contains a collection of final-answer mathematical problems used for the ProofRank evaluation benchmark. It combines high-school level competition problems from MathArena (AIME, HMMT, Apex) and IMO-AnswerBench to evaluate large language models on proof quality metrics beyond basic correctness. ## Included Splits The dataset is divided into two main splits: - `main`: Contains **382** base problems used to evaluate the proof-level metrics (conciseness, computational ease, cognitive simplicity) and problem-level diversity. - `adaptivity`: Contains **445** problem-technique pairs used to evaluate a model's capacity to solve a problem using a specifically requested method. ## Schema | Column | Type | Description | | :--- | :--- | :--- | | `problem_id` | string | Unique identifier for the problem. Use this as the stable row key. | | `problem` | string | The mathematical problem statement. | | `gold_answer` | string | The ground-truth final answer used for correctness verification. | | `in_diversity_eval` | boolean | Indicates whether the problem is to be used in measuring the diversity metric. | | `human_solution_summaries` | list of strings | Summaries of human-written solutions used for LLM-based method clustering. | | `technique` | string, nullable | The specific mathematical technique a model is requested to use. Populated in the `adaptivity` split. |

This dataset is designed for problem-solving and evaluation, comprising 382 main examples and 445 adaptivity examples. Each example includes the following fields: problem_id (problem identifier), problem (problem description), gold_answer (standard answer), in_diversity_eval (boolean indicating if used for diversity evaluation), human_solution_summaries (list of human solution summaries), and technique (solving technique). The dataset is intended to support natural language processing tasks such as answer generation, solution summarization, and diversity evaluation, suitable for research and development contexts.

提供机构:
INSAIT-Institute
搜集汇总
数据集介绍
INSAIT-Institute/ProofRank 数据集图片
构建方式
ProofRank数据集面向大语言模型数学证明质量的评估需求而构建,旨在超越传统仅关注答案正确性的评价范式。数据集从MathArena(涵盖AIME、HMMT及Apex等高中级别竞赛)与IMO-AnswerBench中精选最终答案型数学问题,经人工筛选与标注形成。其包含两个核心子集:主集(main)含382道基础问题,用于评估证明的简洁性、计算易行性与认知简化性等质量指标,同时衡量问题层面的多样性;适应性集(adaptivity)含445个问题-技术对,用于测试模型按指定方法解题的能力。每个问题均提供唯一标识符、问题陈述、标准答案及人类解答摘要,适应性问题额外标注所需数学技巧。
特点
该数据集的核心特色在于构建了多维度的证明质量评估体系,除基本的正确性验证外,引入简洁性、计算易行性与认知简化性三大定量指标,并通过问题级多样性度量(由in_diversity_eval字段标示)确保评估覆盖面。适应性集通过强制模型使用特定数学技术(如代数变换、几何构造等)来检测其方法遵从能力,从而揭示模型在解题策略上的僵化性或灵活性。human_solution_summaries字段为基于LLM的解法聚类提供了人工标注的参考聚类,支持对模型解题路径的语义级分析。数据结构设计紧凑,主集与适应性集总样本数达827条,兼顾评估深度与计算效率。
使用方法
用户可通过HuggingFace Datasets库加载该数据集,指定default配置后自动获取main与adaptivity两个子集。评估流程建议分两步进行:首先使用主集计算模型在各问题上的正确率及证明质量指标,其中proof-level指标需通过调用LLM Judge对生成解答进行简洁性、计算与认知复杂度打分;接着在适应性集上验证模型是否能在提示中要求使用特定技术时成功输出对应解法。in_diversity_eval为true的问题可用于计算模型在不同数学主题上的表现多样性。由于gold_answer字段仅提供最终答案,用户需结合自动化验证脚本(如符号计算或字符串匹配)判定基础正确性,再基于正确解答进行质量评估。
背景与挑战
背景概述
ProofRank数据集由MathArena与IMO-AnswerBench研究团队合作创建,发表于2025年,旨在解决大型语言模型在数学推理领域的一个关键局限:传统评估仅关注答案正确性,忽视了证明过程的质量。该数据集汇集了382道来自AIME、HMMT、Apex等高中竞赛的经典问题,以及445个问题-技巧配对,覆盖从基础代数到高级组合数学的多样领域,为评估模型证明的简洁性、计算友好性和认知简约性提供了标准化基准。作为首个系统度量证明质量的资源,ProofRank推动了语言模型评估从二元正确性向多维质量评价的范式转变,在强化学习、数学推理和可解释AI领域产生了深远影响。
当前挑战
ProofRank所应对的核心挑战在于解决数学推理评估中的维度缺失问题——传统正确率指标无法反映证明过程的严谨性与效率,导致模型在复杂推理任务中可能生成冗长、迂回甚至错误推导的解法,却仍被判定为正确。数据构建过程中面临双重困难:首先,需要从竞赛集合中筛选出能区分证明质量高下的问题,确保同一正确框架下有多种解法路径可供质量比较;其次,为每个问题精心标注人类解法的摘要,并设计技巧约束集以测试模型的方法适应性,这要求标注者具备深厚的数学底蕴与精细的粒度控制,否则会引入主观偏差或削弱评估的判别力。
常用场景
经典使用场景
ProofRank数据集精心汇集了382道高中竞赛级别数学问题,源自AIME、HMMT、Apex及IMO-AnswerBench等权威来源,专为评估大语言模型在数学证明任务中的生成质量而设计。其经典使用场景在于对模型输出的证明进行多维度度量,超越单纯的正确性判断,深入考察证明的简洁性、计算便捷性与认知简洁性等品质。通过将模型生成的证明与人类参考解答进行对比,研究者得以系统性地剖析模型在数学推理中的表达效率与逻辑凝练程度,从而为数学推理能力的评估提供更为精细的量化指标。
衍生相关工作
ProofRank的诞生催生了一系列围绕证明质量评估的衍生研究。其核心思想启发了对证明简洁性与计算经济性等新度量的深入探讨,推动了自动数学证明评估从二元判定向量化评分体系的转型。基于该数据集的多样性度量机制,研究者进一步构建了覆盖更广泛数学分支的证明质量评估基准,如代数与几何领域的专题评估集。此外,自适应评估分裂中所蕴含的方法学遵循能力评测,为研究如何增强模型对特定解题技术的指令服从性提供了灵感,进而催生了融合技巧约束的数学推理训练范式,显著提升了生成证明与人类解题策略的契合度。
数据集最近研究
最新研究方向
ProofRank数据集聚焦于数学推理领域,针对大型语言模型在解题时仅关注答案正确性的局限性,开创性地引入证明质量评估维度。该研究前沿方向涵盖凝练性、计算简洁性与认知简约性等元指标,并结合技巧适应性(adaptivity)分片,要求模型按指定数学方法解题,以检验其逻辑严谨性与方法迁移能力。这一范式与近期热点——如AI在数学竞赛(AIME、IMO)中的表现突破——紧密相连,推动评估标准从结果导向向过程深度理解演进。其意义在于促进LLM向可解释、可验证的数学推理迈进,为教育辅助与科学发现提供更可靠的智能支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务