遇见数据集

fineproofs-prm-context-v2-full-cot

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

FineProofs PRM Context v2: Full Cot 是一个用于过程奖励模型(Process Reward Model)训练的数据集,专注于定理证明(theorem proving)领域。该数据集基于 FineProofs rollout collection,使用 Qwen3.5-9B 模型生成,采用 full_cot 上下文模式,从同一问题(same_problem)的 rollouts 中提取,并应用 middle_truncated_reasoning_equal_share 的打包策略。数据包含训练集(53,457 条样本,2,542 个问题)和验证集(2,602 条样本,128 个问题)。每条样本包含密集的奖励信号(reward)作为训练目标,以及一个基于奖励阈值的布尔型正确性标签(correct,reward >= 0.5 时为正)。数据集适用于需要细粒度奖励监督的定理证明推理任务,特别是过程奖励模型的训练与评估。

FineProofs PRM Context v2: Full Cot is a dataset dedicated to training Process Reward Models (PRMs), focusing on the domain of theorem proving. Built upon the FineProofs rollout collection, this dataset was generated using the Qwen3.5-9B model, adopts the full_cot context mode, is extracted from rollouts of identical problems, and employs the packing strategy named middle_truncated_reasoning_equal_share. It consists of a training set with 53,457 samples corresponding to 2,542 problems, and a validation set with 2,602 samples corresponding to 128 problems. Each sample contains dense reward signals as the training objective, along with a boolean correctness label (`correct`), which is marked positive when the reward value is greater than or equal to 0.5. This dataset is suitable for theorem proving reasoning tasks that require fine-grained reward supervision, especially for the training and evaluation of Process Reward Models.

创建时间:
2026-08-02
原始信息汇总

数据集概述:FineProofs PRM Context v2 - Full Cot

该数据集是 FineProofs 项目下的一个子集,名为 FineProofs PRM Context v2 - Full Cot,主要用于过程奖励模型(Process Reward Model) 的训练与评估,服务于定理证明(Theorem Proving) 相关任务。数据集的任务类别为文本分类(text-classification)

核心特点

  • 上下文策略:该版本使用了来自 same_problemfull_cot(完整思维链)上下文,并采用 middle_truncated_reasoning_equal_share 的打包策略。
  • 训练目标:部分前缀(partial-prefix)和完整响应(complete-response)目标均使用基于裁剪后分数除以最大分数的规范归一化评分;correct 列仅为旧版布尔投影(reward >= 0.5),训练时应使用密集的 reward 目标。
  • 数据来源:该数据集是九个行匹配的上下文变体之一,所有变体均基于已验证的 FineProofs 展开(rollout)集合构建。

数据契约(Contract)

  • 运行 IDfineproofs_all_qwen35_9b_direct2phase_m32_20260730
  • 采集模型Qwen/Qwen3.5-9B,模型修订版本为 c202236235762e1c871ad0ccb60c8ee5ba337b9a
  • 上下文模式full_cot,上下文范围为 same_problem
  • 上下文正确性标签:不包含(no
  • 验证哈希(SHA-256)c5a3b92bd6196d4a33cded2c1a01870d1963d323351d573b369b7f97f3b7f648

此外,九个变体具有相同的行键、标签、奖励、训练/验证问题划分及硬端点覆盖。被排除的问题在划分和上下文选择前已被移除。

数据划分

划分 行数 问题数
train 53,457 2,542
validation 2,602 128

本地文件 val.parquet 发布为 validation.parquet。数据集还包含 dataset_provenance.jsonverification.json_SUCCESS.json 文件,分别用于记录实时输入来源、跨变体验证以及发布文件的精确指纹。

搜集汇总
数据集介绍
fineproofs-prm-context-v2-full-cot 数据集图片
构建方式
FineProofs PRM Context v2 - Full Cot 数据集源于经过验证的 FineProofs rollout 集合,由 Qwen3.5-9B 模型在 2026 年 7 月 30 日运行生成,采用全思维链上下文模式,并应用中间截断推理等分打包策略。该数据集包含九个交叉匹配的上下文变体之一,其构建过程严谨,基于同一问题的 rollout 数据,确保行键、标签、奖励及训练/验证问题划分在所有变体中一致。数据集的正确性标签被有意排除在上下文之外,以强化模型对过程奖励的独立学习。数据划分前已移除留出问题,并分别生成训练集(53,457 行,2,542 个问题)和验证集(2,602 行,128 个问题),同时辅以数据来源、验证及文件指纹等元数据文件,确保可追溯性和完整性。
特点
该数据集的核心特征在于其密集的奖励目标,而非传统的布尔正确性标签,奖励值基于截断分数除以满分计算,并使用规范化公式处理。标签类型涵盖部分前缀和完整响应两种,均以标准化的规范分数为基准。'correct' 列仅为遗留的布尔投影,用于指示奖励是否大于等于 0.5,但训练过程采用密集奖励信号以提升过程监督的敏感性。数据集具有高度结构化的上下文设计,通过全思维链上下文提供丰富的推理过程,并采用同一问题范围内的 rollout,保证了上下文与目标问题的紧密相关性。此外,数据集的九个变体在行键、标签和划分上完全一致,便于跨变体的比较研究,这一设计为过程奖励模型的训练提供了稳健且可扩展的数据基础。
使用方法
使用该数据集时,研究者可直接加载 HuggingFace 上的 parquet 文件,其包含默认配置的训练和验证划分。针对过程奖励模型(PRM)的训练,应聚焦于 'reward' 列作为回归或分类目标,而非 'correct' 列,因为后者仅为简化指标。数据集的九个变体共享相同的标签和划分,因此可用于探索不同上下文策略对模型性能的影响。为满足句对分类任务,可将部分前缀与完整响应配对,并利用归一化得分作为监督信号。验证集在发布时命名为 'validation.parquet',并附带 provenance 和验证文件,用户需核对这些元数据以保证数据完整性。该数据集适合用于定理证明中的步骤级质量评估,并可结合多种上下文变体进行消融实验,以提升模型的推理评判能力。
背景与挑战
背景概述
FineProofs PRM Context v2 - Full Cot数据集由FineProofs项目团队于2026年创建,旨在推动自动定理证明领域的过程奖励模型(PRM)研究。该数据集基于Qwen3.5-9B模型生成的大规模 rollout 集合,构建了九种上下文变体之一,核心研究问题在于如何利用完整的思维链(CoT)上下文提升过程监督的准确性。通过精细的奖励标注和验证机制,该数据集为过程奖励模型的训练提供了高质量资源,对定理证明的形式化验证和推理能力评估具有重要影响力,促进了该领域从结果导向向过程监督的范式转变。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。在领域问题上,自动定理证明长期受限于稀疏反馈和长链推理的信用分配难题,传统结果监督难以定位错误步骤,而过程奖励模型需在复杂逻辑推导中提供稠密、细粒度的监督信号。构建过程中,如何从大规模rollout中有效提取完整思维链上下文,并平衡推理长度与答案正确性,是一大挑战;同时,确保不同上下文变体间标签一致性、处理推理截断策略(如middle_truncated)以及保证跨验证集的公平分割,均需严格的工程设计与校验机制。
常用场景
经典使用场景
该数据集是面向数学定理自动证明领域的过程奖励模型(Process Reward Model, PRM)训练资源,其核心设计在于为每个证明步骤提供细粒度的稠密奖励信号。经典使用场景为训练PRM以评估中间推理步骤的正确性,通过上下文完整的思维链(full_cot)和统一的规范化评分,模型可学习区分有效与无效的推理路径,从而提升证明搜索中的步骤级决策能力。
解决学术问题
在形式化数学与自动推理研究中,传统结果奖励模型仅评判最终答案,难以应对长链条推理中的中间错误累积。此数据集通过提供带有过程的、稠密奖励的监督信号,解决了PRM训练中缺乏高质量过程标注的难题,使研究者能够构建更精确的步骤级反馈机制,进而推动证明验证、策略优化和多步推理可解释性等核心问题的探索。
衍生相关工作
基于该数据集,研究者已衍生了多种上下文变体(如部分前缀、不同打包策略)以探究PRM的输入敏感性,并开发了跨臂一致性验证方法。后续工作包括将过程奖励与搜索算法(如树搜索)结合,构建更强大的证明策略,以及利用其规范化的奖励目标进行多任务学习,为过程监督在复杂推理任务中的泛化奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务