遇见数据集

fineproofs-prm-context-v2-solution-xprob

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

FineProofs PRM Context v2: Solution Xprob 是一个用于过程奖励模型(Process Reward Model)训练的数据集,专注于定理证明(theorem proving)任务。该数据集是 FineProofs 系列的一部分,属于九个行匹配的上下文变体之一,基于经过验证的 FineProofs rollout 集合构建。该变体使用 'solution' 上下文,从 'cross_problem' rollout 中采样,并采用 'whole_solutions_no_truncation' 打包策略。数据集的训练目标包括部分前缀和完整响应,两者均使用规范化的标准化学分(由 clamped 点数除以最大点数计算得出)。'correct' 列是一个旧版布尔投影(当 reward >= 0.5 时为 True),但实际训练使用稠密的 'reward' 目标。数据集包含训练集(53,457 行,2,542 个问题)和验证集(2,602 行,128 个问题),所有九个上下文变体共享相同的行键、标签、奖励、问题分割和硬端点覆盖。保留的问题在分割和上下文选择之前已被移除。数据集还提供了数据来源、跨臂验证和文件指纹等元数据文件。

FineProofs PRM Context v2: Solution Xprob is a dataset for training Process Reward Models, focusing on theorem proving tasks. It is part of the FineProofs series, one of nine line-matched context variants, built upon a validated FineProofs rollout collection. This variant uses the solution context, sampled from cross_problem rollouts, and employs a whole_solutions_no_truncation packing strategy. The training targets include partial prefixes and complete responses, both using normalized standardized scores (calculated by clamped points divided by maximum points). The correct column is a legacy boolean projection (True when reward >= 0.5), but actual training uses a dense reward target. The dataset contains a training set (53,457 rows, 2,542 problems) and a validation set (2,602 rows, 128 problems), with all nine context variants sharing the same row keys, labels, rewards, problem splits, and hard endpoint coverage. Reserved problems are removed before splitting and context selection. The dataset also provides metadata files such as data sources, cross-arm validation, and file fingerprints.

创建时间:
2026-08-02
原始信息汇总

FineProofs PRM Context v2: Solution Xprob 数据集概述

基本信息

  • 数据集名称: FineProofs PRM Context v2 - Solution Xprob
  • 任务类型: 文本分类(text-classification)
  • 标签: process-reward-model、theorem-proving、fineproofs

数据来源与构建

  • 上下文类型: 使用 solution 上下文,来源于 cross_problem 回滚(rollouts)
  • 打包策略: whole_solutions_no_truncation(完整解决方案,不截断)
  • 基座模型: 由九个行匹配的上下文变体之一组成,基于经过验证的 FineProofs 回滚集合构建
  • 目标设计: 部分前缀和完整响应目标均使用规范的归一化评分信用,该信用由 clamped 分数除以最大分数得出
  • correct 列说明: 仅为遗留的布尔投影(奖励 >= 0.5 时为真),训练时使用密集的 reward 目标

数据合同(Contract)

项目 内容
Run ID fineproofs_all_qwen35_9b_direct2phase_m32_20260730
收集模型 Qwen/Qwen3.5-9B
模型修订版本 c202236235762e1c871ad0ccb60c8ee5ba337b9a
上下文分支 solution_xprob
上下文模式 solution
上下文范围 cross_problem
上下文正确性标签 no
验证 SHA-256 c5a3b92bd6196d4a33cded2c1a01870d1963d323351d573b369b7f97f3b7f648

数据划分

划分 行数 问题数
train 53,457 2,542
validation 2,602 128

关键设计说明

  • 九个上下文分支具有相同的行键、标签、奖励、训练/验证问题划分以及硬端点覆盖
  • 保留问题在划分和上下文选择之前被移除
  • 本地的 val.parquet 发布为 validation.parquet
  • 文件中包含 dataset_provenance.jsonverification.json_SUCCESS.json,用于提供实时输入来源、跨分支检查以及已发布文件的精确指纹信息
搜集汇总
数据集介绍
fineproofs-prm-context-v2-solution-xprob 数据集图片
构建方式
该数据集源于FineProofs验证性回滚集合,采用Qwen3.5-9B模型在跨问题场景下生成的解决方案上下文,并以完整解决方案且不截断的打包策略构建。其标签与奖励基于规范化的标准评分,即钳制得分除以最大得分,而‘correct’列仅为奖励阈值0.5的旧式布尔投影。数据构建遵循严格的契约,包括固定的运行ID、模型修订版及SHA-256校验,确保可复现性与可验证性。九个上下文变体共享相同的行键、标签、问题和硬端点覆盖,且已排除未见问题后划分训练与验证集。
使用方法
使用时,可加载train.parquet和validation.parquet文件,其中validation.parquet对应验证集。训练时应以密集的‘reward’列作为回归目标,而非‘correct’布尔列。该数据集适用于文本分类任务,典型应用是训练过程奖励模型,以评估数学定理证明中每个推理步骤的正确性。用户可根据HuggingFace数据集加载方式,直接使用默认配置读取数据,并结合模型输入格式进行预处理,以支持监督学习或强化学习中的奖励信号生成。
背景与挑战
背景概述
随着形式化数学与自动化定理证明的深度融合,过程奖励模型(Process Reward Model, PRM)在引导推理路径的逐步验证中扮演着愈发关键的角色。FineProofs PRM Context v2 - Solution Xprob 数据集应运而生,由致力于提升数学推理可靠性的研究团队于2026年7月30日构建,依托Qwen/Qwen3.5-9B模型在跨问题卷展(cross_problem rollouts)中采集的解决方案上下文,旨在为PRM提供细粒度的过程监督信号。作为FineProofs rollout集合的九个行匹配变体之一,该数据集通过规范的规范化评分机制(clamped points / max points)生成密集的奖励目标,突破传统二元正确性标注的局限,为定理证明中的过程级评估提供了高质量训练资源,对推动形式化数学的自动化验证与可解释推理具有重要意义。
当前挑战
该数据集构建面临多重挑战。领域层面,过程奖励模型需捕捉推理步骤的局部正确性,而定理证明的搜索空间庞大且存在多种等价证明路径,要求模型具备对细微语义差异的判别力,同时跨问题的上下文选择需平衡泛化性与针对性,避免过拟合至特定证明策略。构建过程中,数据源自跨问题卷展,如何确保九种变体间行键、标签及奖励的一致性,并依据严格的SHA-256校验保障数据完整性,是工程上的核心难点。此外,密集奖励的规范化需精确处理部分前缀与完整响应的目标对齐,去除截断策略的选择亦影响序列长度分布,而训练/验证问题分割时需确保held-out问题在上下文选择前被剔除,以维护评估的公正性与可靠性。
常用场景
经典使用场景
FineProofs PRM Context v2 - Solution Xprob数据集在过程奖励模型(PRM)的训练与评估中扮演着核心角色,特别针对数学定理证明的自动验证场景。该数据集以Qwen3.5-9B模型生成的跨问题解决方案为上下文,提供了超过五万条训练样本及两千余条验证样本,每条样本均带有基于归一化评分标准的密集奖励信号,而非简单的二元正确标签。研究者可借此训练PRM来逐步评估证明过程中的每个推理步骤,从而精确识别逻辑漏洞或无效推导,为强化学习中的过程监督提供细粒度的反馈信号。这种细粒度的训练范式显著提升了模型在复杂数学推理任务中的鲁棒性和可解释性,使其成为构建高性能自动定理证明系统的关键数据资产。
解决学术问题
该数据集针对数学定理证明中长链条推理难以验证的学术难题,提供了一种标准化的过程级监督方案。传统方法常依赖最终答案的二元判定,忽视中间步骤的正确性,导致模型产生看似合理实则错误的推理路径。通过引入密集的、基于规则归一化的奖励目标,该数据集使研究人员能够量化每个推理步骤的贡献,从而设计出更有效的过程奖励模型,用于指导策略模型在搜索空间中优先探索逻辑严谨的路径。此能力不仅提升了自动定理证明的成功率,还为可解释人工智能领域贡献了方法论基础,推动了从结果导向到过程导向的验证范式转变,对形式化数学和智能推理系统的研究具有深远意义。
实际应用
在实际应用中,该数据集所训练的PRM可直接嵌入交互式定理证明器或数学问题求解引擎,用于实时监测和纠正模型的推导过程。例如,在自动化数学竞赛解题或辅助数学研究方面,系统可借助PRM对生成的证明草稿逐步评分,及时指出错误步骤并建议修正策略,从而显著提升最终答案的准确性和可靠性。此外,该数据集还支持教育科技领域中的智能辅导系统,通过分析学生的解题步骤提供个性化反馈,培养逻辑推理能力。在工业级AI系统中,此类PRM亦被用于过滤低质量的推理链,优化大型语言模型的推理输出,减少幻觉现象,从而提升在金融、法律等要求严格逻辑领域中的应用安全性。
数据集最近研究
最新研究方向
该数据集聚焦于形式化定理证明中的过程奖励模型(PRM)训练,通过跨问题(cross-problem)的解决方案上下文构建,提供九种严格行匹配的上下文变体之一。其最新研究方向在于利用密集奖励信号替代传统的二值正确性标注,以更精细地捕捉证明步骤的局部质量,推动PRM从粗粒度评估向细粒度过程监督演进。数据源自Qwen3.5-9B模型的大规模 rollout 收集,并经过规范化评分与SHA-256验证,确保了数据的可复现性与跨臂一致性。此设计旨在支撑前沿的自动定理证明系统,提升其推理链的鲁棒性和可解释性,对数学推理的AI辅助验证和复杂问题求解具有重要推动作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务