遇见数据集

32-B-mutated

收藏
Hugging Face2026-05-25 更新2026-05-26 收录
官方服务:

资源简介:

本数据集名为32-B Mutated MiniF2F Results,包含针对MiniF2F基准经过变异处理的模型生成输出。数据集由两部分构成:一部分来自Goedel-Prover-V2-32B模型(n=32),包含1220行变异数据;另一部分来自Pythagoras-Prover-RL-32B模型(n=32),其数据被分割为两个分片,每个分片包含610行数据。原始输入文件为`contamination_minif2f/mutated_misc_minif2f_putnambench.jsonl`。该数据集适用于分析或评估大型语言模型在数学定理证明任务上的生成性能,特别是针对MiniF2F问题集的变异版本。

This dataset is named 32-B Mutated MiniF2F Results and contains model-generated outputs that have been mutated for the MiniF2F benchmark. The dataset consists of two parts: one from the Goedel-Prover-V2-32B model (n=32), containing 1220 rows of mutated data; and another from the Pythagoras-Prover-RL-32B model (n=32), whose data is split into two shards, each containing 610 rows. The original input file is `contamination_minif2f/mutated_misc_minif2f_putnambench.jsonl`. This dataset is suitable for analyzing or evaluating the generation performance of large language models on mathematical theorem proving tasks, particularly for mutated versions of the MiniF2F problem set.

创建时间:
2026-05-24
搜集汇总
数据集介绍
32-B-mutated 数据集图片
构建方式
该数据集通过将MiniF2F基准测试中的数学问题经过突变处理,生成更具挑战性的变体,并分别使用Goedel-Prover-V2-32B和Pythagoras-Prover-RL-32B两种大型语言模型以n=32的采样次数进行推理输出。构建过程中,源自污染检测文件`contamination_minif2f/mutated_misc_minif2f_putnambench.jsonl`的原始数据被划分为1220行(Goedel-32B)及两个各含610行的分片(Py32B),确保了模型输出的多样性与可复现性。
特点
该数据集特色在于聚焦于数学推理的鲁棒性评估,通过突变技术引入问题变体,从而测试模型对表面相似但内涵变化的题目的泛化能力。同时,双模型输出架构使得研究者能横向对比Goedel-Prover-V2-32B与Pythagoras-Prover-RL-32B在相同突变集上的表现差异,为分析不同训练策略对数学定理证明的影响提供了宝贵的实证材料。
使用方法
使用该数据集时,可直接从Hugging Face数据集库加载,并按模型目录(`Goedel-32B/`与`Py32B/`)区分输出结果。每个样本包含原始突变后的MiniF2F问题及其对应语言模型的生成证明或答案,适用于评估模型在数学推理任务上的准确性、一致性及对问题变异的鲁棒性。研究者亦可将其作为对比基准,分析不同采样策略或模型架构在自动化定理证明中的表现。
背景与挑战
背景概述
该数据集构建于近年来人工智能在数学定理证明领域蓬勃发展的背景下,由研究团队基于MiniF2F基准测试集进行变异处理而成,核心目的在于评估大型语言模型在自动定理证明任务中的鲁棒性与泛化能力。数据集收录了Goedel-Prover-V2-32B与Pythagoras-Prover-RL-32B两个先进模型在n=32采样条件下的生成结果,共计1220条经变异的证明路径。通过引入对原有定理的结构性扰动,该数据集为衡量模型在非标准表述下的推理一致性提供了重要测试范式,对推动形式化数学推理与自动化验证的研究具有标志性影响。
当前挑战
该数据集所针对的核心领域挑战在于,现有的数学定理证明模型在训练过程中往往过度拟合特定表述模式,难以应对输入语序、符号替换或逻辑结构微调等变异场景,从而暴露出推理链的脆弱性。构建过程中,研究团队面临确保变异后定理仍保持语义与推导等价性的难题,同时需平衡变异强度与问题可解性,以避免生成无效或歧义性的测试样本。此外,大规模采样的计算开销以及双模型输出之间的可比性对齐,也对数据构建的工程稳定性提出了严苛要求。
常用场景
经典使用场景
在自动定理证明与数学推理领域,32-B-mutated数据集主要服务于评估和增强大语言模型在形式化数学证明上的生成能力。该数据集通过对MiniF2F基准进行深度变异处理,构造出包含1,220条经过精心变异的数学问题样本,为研究者提供了一个模拟复杂、非标准数学命题场景的测试平台。其核心用途在于对比不同规模模型(如Goedel-Prover-V2-32B与Pythagoras-Prover-RL-32B)在约束条件下生成证明步骤的鲁棒性与准确性,从而推动形式化证明自动化技术的边界拓展。
实际应用
在实际应用中,32-B-mutated数据集可嵌入到数学辅导系统的自动化验证模块中,用于检测模型生成的证明步骤是否在逻辑上无懈可击。例如,在线教育平台可借助该数据集训练出的评估器,实时纠正学生提交的数学证明中的隐含错误,或为自动出题系统生成形态各异的变式题目。此外,该数据集还能服务于高级数学研究中的自动化推理辅助工具,帮助数学家批量验证猜想在不同表述下的等价性,从而提升数学研究的效率与严谨性。
衍生相关工作
围绕32-B-mutated数据集,衍生出一系列旨在提升证明搜索效率与模型可解释性的经典工作。研究者基于此数据集开发了针对变异样本的对比训练框架,通过强化学习策略增强模型对问题改写的容忍度。后续工作进一步探索了将数据集中的变异模式与蒙特卡洛树搜索相结合的方法,显著提升了在大搜索空间下的证明生成成功率。此外,该数据集还催生了面向数学形式化语言的嵌入空间分析研究,揭示模型在识别变异前后问题语义不变性上的行为规律,为构建更稳健的数学推理系统奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务