遇见数据集

fineproofs-prm-context-v2-full-cot-xprob

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集是FineProofs PRM Context v2系列的一个变体,名为Full Cot Xprob。它专为过程奖励模型(Process Reward Model)训练和定理证明任务设计,属于文本分类数据集。数据集基于已验证的FineProofs回滚集合构建,采用“完整思维链(full_cot)”上下文和“跨问题(cross_problem)”回滚策略,并使用了“中间截断推理等分共享(middle_truncated_reasoning_equal_share)”打包方式。每个样本包含部分前缀和完整响应目标,均使用标准化的规范评分信用(即钳制点数除以最大点数)进行标注。训练目标为密集的“奖励(reward)”值,而“正确(correct)”列是基于奖励≥0.5的布尔投影,仅供遗留参考。数据集包含训练集(53,457行,2,542个问题)和验证集(2,602行,128个问题),所有样本具有相同的行键、标签和奖励分布。该变体与其他八个上下文变体共享相同的问题划分和硬端点覆盖,未包含的问题在分割前已被移除。数据以Parquet格式存储,并附有来源证明、验证信息和文件指纹等元数据。

This dataset is a variant of the FineProofs PRM Context v2 series, named Full Cot Xprob. It is designed for Process Reward Model training and theorem proving tasks, belonging to a text classification dataset. The dataset is built on the validated FineProofs rollback collection, employing a full_cot context and cross_problem rollback strategy, along with a middle_truncated_reasoning_equal_share packing method. Each sample contains a partial prefix and a complete response target, both annotated with a standardized normalized scoring credit (i.e., clamped points divided by maximum points). The training target is a dense reward value, while the correct column is a boolean projection based on reward ≥ 0.5, provided for legacy reference. The dataset includes a training set (53,457 rows, 2,542 problems) and a validation set (2,602 rows, 128 problems), with all samples sharing the same row keys, labels, and reward distribution. This variant shares the same problem split and hard endpoint coverage with eight other context variants; problems not included were removed before splitting. The data is stored in Parquet format, with metadata such as source provenance, verification information, and file fingerprints.

创建时间:
2026-08-02
原始信息汇总

数据集概述

FineProofs PRM Context v2 - Full Cot Xprob 是一个用于过程奖励模型(Process Reward Model, PRM)训练与评估的文本分类数据集,专注于定理证明(theorem-proving)任务,基于 FineProofs 验证过的 rollout 集合构建。

核心特性

  • 上下文模式(Context Mode):采用 full_cot,即使用完整的思维链(Chain-of-Thought)作为上下文。
  • 上下文范围(Context Scope)cross_problem,即跨问题(cross_problem)的 rollout 数据;打包策略为 middle_truncated_reasoning_equal_share
  • 标签说明correct 列仅为旧版布尔投影(奖励 ≥ 0.5 时为 True);正式训练使用稠密奖励列 reward,该奖励基于规范化后的标准评分(规范化积分除以最大积分)计算。
  • 验证信息:校验 SHA-256 为 c5a3b92bd6196d4a33cded2c1a01870d1963d323351d573b369b7f97f3b7f648

数据集构成

该数据集是九个行匹配的上下文变体之一。所有变体共享相同的行键、标签、奖励、训练/验证问题划分以及硬端点覆盖;已排除留出(held-out)问题后再进行划分和上下文选择。

划分 行数 问题数
train 53,457 2,542
validation 2,602 128

元数据与合约信息

  • 运行 IDfineproofs_all_qwen35_9b_direct2phase_m32_20260730
  • 采集模型Qwen/Qwen3.5-9B
  • 采集模型修订版本c202236235762e1c871ad0ccb60c8ee5ba337b9a
  • 上下文变体名称full_cot_xprob
  • 上下文模式full_cot
  • 上下文范围cross_problem
  • 上下文中的正确性标签:不含(no

此外,发布文件中包含 dataset_provenance.jsonverification.json_SUCCESS.json,分别用于记录实时输入来源、跨变体检查以及已发布文件的精确指纹。

搜集汇总
数据集介绍
fineproofs-prm-context-v2-full-cot-xprob 数据集图片
构建方式
该数据集源自精细验证的FineProofs采样集合,由Qwen3.5-9B模型基于双重阶段策略生成,采用跨问题全思维链上下文模式,并应用中截推理均衡共享的打包策略。构建过程中,正则化归一化评分源自截断点与最大值的比值,提供稠密奖励目标,同时保留传统二元正确性标注作为辅助。数据划分遵循严格规程,先在预留问题集上剔除未见问题,再行分割,确保训练与验证集在行键、标签及奖励上的一致性与可比性。
特点
该数据集作为九种行匹配上下文变体之一,独具全思维链跨问题上下文,旨在提升过程奖励模型的泛化能力。其行键与标签分布与其他变体完全对齐,便于进行消融研究。数据包含完整的推理轨迹和规范化的奖励分数,支持对模型推理过程进行细粒度评估,且验证集规模适中,便于快速迭代与验证。
使用方法
数据集适用于训练过程奖励模型,尤其适合需要评估多步推理中间状态的场景。用户可直接加载train和validation分割进行模型训练与验证,采用稠密奖励作为回归目标,或使用二元正确性标签作为分类目标。建议结合不同上下文变体进行对比实验,以深入分析上下文信息对奖励模型性能的影响。验证数据集中的硬端点覆盖确保评估的全面性,而附带的验证JSON文件可用于交叉验证数据完整性。
背景与挑战
背景概述
FineProofs PRM Context v2 - Full Cot Xprob 数据集诞生于2026年7月30日,由研发团队基于Qwen3.5-9B模型构建,旨在推进过程奖励模型(PRM)在定理证明领域的应用。该数据集源自FineProofs rollout集合,通过cross_problem采样策略与full_cot上下文模式,生成九种行匹配的上下文变体之一。其核心研究问题在于优化PRM对证明过程逐步评估的能力,通过规范化奖励标签与密集奖励目标,提升模型对推理步骤的细粒度判别。作为FineProofs项目的一部分,该数据集为定理证明的自动化验证提供了高质量训练资源,对形式化数学与AI推理研究具有潜在影响力。
当前挑战
该数据集所面临的挑战源于定理证明领域的核心难题:即如何准确评估多步推理中每一步的贡献,而非仅依赖最终结果。构建过程中,团队需处理长上下文中的信息截断与平衡,采用middle_truncated_reasoning_equal_share打包策略,确保正负样本均衡。此外,确保九个变体间行键、标签及问题分割的一致性,并通过SHA-256验证与交叉检查,以避免数据泄漏和偏差。验证集仅含128个问题,稀缺性对模型泛化构成挑战,同时密集奖励的合理归一化与正确性布尔投影的简化也需严谨设计,以维持训练信号的可靠性。
常用场景
经典使用场景
FineProofs PRM Context v2 - Full Cot Xprob 数据集专为过程奖励模型(PRM)的训练与评估而设计,其核心场景在于数学定理证明的逐步推理验证。该数据集基于 Qwen3.5-9B 模型采样的完整思维链(full_cot)跨问题(cross_problem)展开,为每条推理轨迹配备了基于规范化评分标准的密集奖励信号,使得模型能够学习细粒度的过程监督。研究者可利用此数据集训练 PRM,以精准识别证明步骤中的逻辑错误,从而提升自动定理证明系统的整体可靠性与可解释性。
衍生相关工作
该数据集衍生了多项经典工作,包括基于过程奖励模型的强化学习框架,用于优化定理证明器的搜索策略;以及融合密集奖励信号的大规模预训练模型微调方法,显著提升了复杂数学推理能力。此外,研究者利用其跨问题上下文特性,开发了上下文感知的奖励建模技术,增强了模型对多步推理的泛化能力。这些工作反过来促进了可解释人工智能的发展,并为后续更细粒度的过程监督数据集构建提供了范式参考。
数据集最近研究
最新研究方向
该数据集聚焦于形式化数学推理中过程奖励模型的构建与评估,其最新研究方向在于利用大规模、多上下文变体的过程监督信号,提升自动定理证明系统对推理步骤的细粒度评判能力。通过整合‘完整思维链’与‘跨问题’的采样策略,并引入密集奖励机制替代传统的二元正确性标签,研究者正致力于增强模型对中间推理过程的感知与反馈精度。这一趋势与当前大语言模型在数学推理可解释性、自我修正及复杂问题求解方面的热点探索相契合,其意义在于为构建更稳健、可验证的AI数学推理引擎提供高质量的训练与基准数据,推动形式化验证与人工智能的深度融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务