遇见数据集

fineproofs-prm-context-v2-solution

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

FineProofs PRM Context v2 - Solution 是一个用于过程奖励模型(PRM)训练的数据集,源自 FineProofs 项目中的验证 rollout 集合。该数据集采用 solution 上下文,从 same_problem 的 rollout 中采样,并使用 whole_solutions_no_truncation 打包策略。它是九个行匹配的上下文变体之一,所有变体共享相同的行键、标签、奖励、训练/验证问题划分以及硬端点覆盖。数据集中包含 correct 列(基于奖励阈值为 0.5 的布尔值投影)和用于训练的密集 reward 目标。数据集规模:训练集包含 53,457 条样本,对应 2,542 个问题;验证集包含 2,602 条样本,对应 128 个问题。验证文件以 validation.parquet 形式发布。该数据集适用于定理证明领域中的过程奖励建模任务,可支持基于 Qwen3.5-9B 等模型的训练与评估。

FineProofs PRM Context v2 - Solution is a dataset for training process reward models (PRM), derived from the validation rollout set of the FineProofs project. It adopts the solution context, samples from rollouts of same_problem, and uses the whole_solutions_no_truncation packing strategy. It is one of nine row-matched context variants, all sharing the same row keys, labels, rewards, train/validation problem splits, and hard endpoint coverage. The dataset includes a correct column (a boolean projection based on a reward threshold of 0.5) and dense reward targets for training. Dataset size: training set contains 53,457 samples corresponding to 2,542 problems; validation set contains 2,602 samples corresponding to 128 problems. The validation file is published as validation.parquet. This dataset is suitable for process reward modeling tasks in the theorem proving domain, supporting training and evaluation based on models such as Qwen3.5-9B.

创建时间:
2026-08-02
原始信息汇总

数据集概述

FineProofs PRM Context v2: Solution 是一个用于**过程奖励模型(Process Reward Model)训练和评估的文本分类数据集,专注于定理证明(Theorem Proving)**领域。该数据集基于FineProofs验证的rollout集合构建,是九个行匹配的上下文变体之一。

构建背景与核心特性

  • 上下文类型:使用来自 same_problem rollouts的 solution 上下文,采用 whole_solutions_no_truncation 打包策略。
  • 标签体系:部分前缀和完整响应目标均使用基于钳制分数除以最大分数的规范化评分标准(rubric credit)。
  • 奖励目标:训练时使用稠密的 reward 目标;correct 列仅为旧有的布尔投影(reward >= 0.5),并非训练依据。

数据契约

项目
运行ID fineproofs_all_qwen35_9b_direct2phase_m32_20260730
收集模型 Qwen/Qwen3.5-9B
模型版本 c202236235762e1c871ad0ccb60c8ee5ba337b9a
上下文臂 solution
上下文模式 solution
上下文范围 same_problem
上下文中的正确性标签 no
验证SHA-256 c5a3b92bd6196d4a33cded2c1a01870d1963d323351d573b369b7f97f3b7f648

九个上下文变体共享相同的行键、标签、奖励、训练/验证问题划分以及硬端点覆盖。持有问题在划分和上下文选择之前被移除。

数据划分

划分 行数 问题数
train 53,457 2,542
validation 2,602 128

本地文件 val.parquetvalidation.parquet 名称发布。

附带文件

  • dataset_provenance.json:包含实时输入来源信息。
  • verification.json:包含跨臂检查信息。
  • _SUCCESS.json:包含精确的已发布文件指纹。
搜集汇总
数据集介绍
fineproofs-prm-context-v2-solution 数据集图片
构建方式
在定理证明与过程奖励建模的交叉领域中,该数据集脱胎于经过验证的FineProofs rollout集合,以九个行匹配上下文变体中的solution分支为定位。其构建以Qwen/Qwen3.5-9B为采集模型,锁定同一问题下的solution上下文,采用whole_solutions_no_truncation的打包策略,从而避免截断对推理轨迹完整性的破坏。所有样本的奖励目标均源自钳制点数与最大点数之比,经规范化处理为规范评分标准,correct列仅作为奖励不低于0.5时的传统布尔投影存在,真正用于训练的是稠密reward目标。九个分支在行键、标签、奖励、训练与验证问题划分及硬端点覆盖上完全一致,留出问题在划分与上下文选择之前即被移除,验证哈希值则锚定了数据生成流程的可复现性。
使用方法
使用该数据集时,研究者可借助HuggingFace的datasets库直接加载train与validation两个划分,其中validation.parquet即为本地val.parquet的发布版本。训练过程应以稠密reward列作为监督目标,correct列仅适合作为评估阶段的参考性布尔投影,而不宜替代奖励信号。由于九个上下文分支共享行键与划分,使用者可将本分支与其他分支进行行对齐的对照实验,以考察不同上下文范围对过程奖励建模的影响。数据集中附带的dataset_provenance.json、verification.json与_SUCCESS.json文件记录了实时输入溯源、跨分支校验及发布文件指纹,建议在复现或审计时一并核验,以确保实验条件与原始采集契约保持一致。
背景与挑战
背景概述
过程奖励模型(PRM)近年来在定理证明与复杂推理任务中展现出关键价值,其核心在于对推理链条的中间步骤进行细粒度信用分配,而非仅依赖最终答案的二元判定。FineProofs PRM Context v2 - Solution 数据集由相关研究团队于2026年构建,基于 Qwen3.5-9B 模型对同一问题的多路径 rollout 进行采集,并采用"solution"上下文模式与"whole_solutions_no_truncation"打包策略生成。该数据集以规范化评分准则为标签基础,提供稠密的奖励信号,旨在推动 PRM 训练从粗放正确性判断向精细化步骤评估演进,对形式化数学与自动定理证明领域具有重要的基准意义。
当前挑战
该数据集所应对的领域挑战在于,定理证明过程冗长且中间步骤的信用分配高度模糊,传统结果监督难以捕捉推理链中的细微错误与冗余,而过程监督又面临标注成本高昂与一致性不足的困境。构建过程中,需在保持九个上下文变体行键、标签、奖励及训练/验证问题划分完全一致的前提下,确保留出问题在划分与上下文选择前被彻底移除,并完成跨变体校验与文件指纹验证。如何在多路径 rollout 中维持奖励信号的可比性与无偏性,同时避免截断引入的分布偏差,构成该数据集的核心技术难题。
常用场景
经典使用场景
在自动化定理证明与形式化数学领域,过程奖励模型(PRM)已成为提升大语言模型推理鲁棒性的关键组件。该数据集凭借从同一问题多次采样中提取的完整解答上下文,为逐步推理过程提供稠密奖励信号,使得模型能够细致区分成功路径中的每个推导步骤。其经典用法在于:以验证过的FineProofs采样轨迹为基座,训练PRM对部分前缀或完整响应进行细粒度评分,从而在搜索与重排序阶段精准筛选高质量证明路径。
解决学术问题
该数据集直击PRM训练中过程监督信号稀疏、奖励尺度不统一以及数据泄漏等长期困扰学术界的难题。通过采用钳位点数除以最大点数的归一化评分规则,它提供了连续且一致的稠密奖励标签,缓解了二值正确性判断带来的信息损失。同时,严格的留出问题划分与行匹配保证了多上下文变体间的公平比较,为研究上下文选择对奖励建模的影响提供了可复现的实验基准,推动了过程奖励模型方法论的系统化发展。
实际应用
在实际应用中,该数据集能够支撑构建高效的过程奖励模型,用于交互式定理证明助手、数学推理辅导系统以及代码生成验证工具。部署后的PRM可实时评估模型生成的中间步骤,引导搜索算法优先探索有希望的证明分支,显著减少无效计算。对于需要高可靠性的形式化验证流程,基于该数据集训练的奖励模型可充当自动审查员,标记潜在错误步骤,从而提升整体证明生成的成功率与可解释性。
数据集最近研究
最新研究方向
在定理证明与形式化推理领域,过程奖励模型(PRM)正从粗粒度结果监督向细粒度步骤级信用分配演进。fineproofs-prm-context-v2-solution数据集依托Qwen3.5-9B采集的大规模 rollout,以“solution”上下文臂为核心,采用整解无截断打包策略,提供规范化的稠密奖励目标,突破了传统布尔正确性标签的局限。其行匹配的九臂上下文变体设计,为隔离上下文类型对奖励建模的影响提供了受控实验基础,推动了PRM在长程推理链中的鲁棒性研究。该数据集与当前LLM数学推理、自动定理证明及可验证奖励模型的热点方向深度契合,为构建可解释、可泛化的步骤级监督信号提供了关键资源,对提升形式化验证系统的可信度具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务