遇见数据集

fineproofs-prm-context-v2-solution-label-xprob

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

FineProofs PRM Context v2 - Solution Label Xprob 是一个用于过程奖励模型(Process Reward Model)训练和定理证明任务的数据集。该数据集由 Qwen3.5-9B 模型收集,采用 solution_label 上下文模式和 cross_problem 展开(rollout)策略,并使用 whole_solutions_no_truncation 打包策略。数据集的奖励目标为密集奖励(dense reward),其中 correct 列是基于奖励阈值(>=0.5)的布尔投影。数据集包含训练集(53,457行,对应2,542个问题)和验证集(2,602行,对应128个问题),均为 parquet 格式。该数据集是九个行匹配的上下文变体之一,所有变体共享相同的行键、标签、奖励以及训练/验证问题划分。

FineProofs PRM Context v2 - Solution Label Xprob is a dataset for process reward model training and theorem proving tasks. It was collected by the Qwen3.5-9B model, using the solution_label context mode and cross_problem rollout strategy, with the whole_solutions_no_truncation packing strategy. The reward target is dense reward, where the correct column is a boolean projection based on a reward threshold (>=0.5). The dataset includes a training set (53,457 rows, corresponding to 2,542 problems) and a validation set (2,602 rows, corresponding to 128 problems), both in parquet format. It is one of nine row-matched context variants, all sharing the same row keys, labels, rewards, and training/validation problem splits.

创建时间:
2026-08-02
原始信息汇总

数据集概述

数据集名称:FineProofs PRM Context v2 - Solution Label Xprob

任务类别:文本分类(text-classification)

标签:过程奖励模型(process-reward-model)、定理证明(theorem-proving)、FineProofs

数据集描述

该数据集是FineProofs验证收集集的一个上下文变体,采用 solution_label 上下文模式,来源于 cross_problem 回滚,打包策略为 whole_solutions_no_truncation。它是从已验证的FineProofs回滚集合中构建的九个行匹配上下文变体之一。

部分前缀和完整回答的目标均使用来自规范化归一化评分(clamped points 除以 max points)的规范rubric信用。correct 列仅是一个传统的布尔投影,阈值为 reward >= 0.5;训练使用稠密的 reward 目标。

数据契约

属性
运行ID fineproofs_all_qwen35_9b_direct2phase_m32_20260730
收集模型 Qwen/Qwen3.5-9B
模型修订版本 c202236235762e1c871ad0ccb60c8ee5ba337b9a
上下文臂 solution_label_xprob
上下文模式 solution_label
上下文范围 cross_problem
上下文中的正确性标签 是(yes)
验证SHA-256 c5a3b92bd6196d4a33cded2c1a01870d1963d323351d573b369b7f97f3b7f648

九个数据臂具有相同的行键、标签、奖励、训练/验证问题划分和硬端点覆盖。持出(held-out)问题在划分和上下文选择之前被移除。

数据划分

划分 行数 问题数
训练集(train) 53,457 2,542
验证集(validation) 2,602 128

本地 val.parquet 文件以 validation.parquet 名称发布。dataset_provenance.jsonverification.json_SUCCESS.json 文件包含实时输入来源、跨臂检查和已发布文件的精确指纹。

搜集汇总
数据集介绍
fineproofs-prm-context-v2-solution-label-xprob 数据集图片
构建方式
该数据集源自FineProofs验证过的 rollout 集合,由 Qwen/Qwen3.5-9B 模型在特定运行配置下生成,采用跨问题(cross_problem)采样策略,上下文模式为 solution_label,打包策略为 whole_solutions_no_truncation。数据行与其余八个变体严格对应,确保样本键、奖励标签、难易度划分及硬端点覆盖一致,留出问题在划分和上下文选择前移除,以保证评估的公正性。标签基于归一化的分数(clamped points 除以 max points)计算规范化的 rubric credit,correct 列为 legacy 布尔投影,训练时使用稠密奖励目标。
使用方法
该数据集适用于文本分类任务,特别是过程奖励模型的训练与评估。使用时,可将训练集用于模型微调,验证集用于超参数调优或早停策略。数据集中包含稠密 reward 目标,应作为主要监督信号,而 correct 列仅作为参考。推荐的基线模型为 Qwen3.5-9B,但也可适配其他 Transformer 架构。用户需依据 dataset_provenance.json 和 verification.json 确保数据完整性,并可通过 HuggingFace 的 datasets 库直接加载 parquet 文件。
背景与挑战
背景概述
随着形式化数学推理与人工智能的深度融合,过程奖励模型(Process Reward Model, PRM)在自动定理证明与数学问题求解中扮演着日益关键的角色。FineProofs PRM Context v2 - Solution Label Xprob 数据集于2025年7月30日由相关研究团队基于Qwen3.5-9B模型构建,隶属于FineProofs系列,旨在为过程奖励模型提供细粒度的、上下文感知的训练数据。该数据集的核心研究问题在于如何通过整合跨问题(cross_problem)的解决方案标签上下文,提升模型对推理步骤正确性的判别能力,从而推动自动定理证明系统在复杂数学任务中的性能。其影响力体现在为PRM研究提供了标准化的数据构建范式与验证流程,并为后续多臂对比实验奠定了坚实基础。
当前挑战
该数据集所应对的领域挑战在于过程奖励模型对推理步骤细粒度评估的需求:传统结果奖励仅提供二元反馈,难以捕捉证明过程中的部分正确性,而PRM需在长链条推理中准确识别中间步骤的错误与贡献。此外,构建过程中面临多重挑战:确保跨问题上下文的一致性与行级对齐,需在剔除保留问题后仍维持训练与验证分割的平衡;正确性标签的标准化,需将原始评分转换为规范化的密集奖励,同时保留二值投影的兼容性;以及验证流程的完备性,通过SHA-256校验与来源追踪保障数据质量,但需处理九种上下文变体间的同构性与差异性,避免数据泄露与评估偏差。
常用场景
经典使用场景
FineProofs PRM Context v2数据集专为过程奖励模型(Process Reward Model, PRM)的训练与评估而设计,其核心场景在于数学定理证明的自动验证。该数据集基于Qwen3.5-9B模型生成的跨问题(cross_problem)轨迹,采用solution_label上下文,并严格控制数据划分,确保训练与验证集的独立性。研究者可利用该数据集训练PRM,以细粒度地评估每一步推理的正确性,从而提升自动定理证明系统的可靠性。数据集的密集奖励信号(reward)替代了传统的二元正确标签,使得模型能够学习到更精确的过程级反馈,适用于强化学习中的奖励建模。
解决学术问题
该数据集解决了自动定理证明领域中奖励稀疏和过程监督不足的学术难题。传统方法多依赖最终结果的正误,缺乏对中间推理步骤的指导,导致模型在长链条推理中容易累积错误。FineProofs PRM Context v2通过提供基于规范化评分(clamped points除以max points)的密集奖励,使研究者能够训练过程奖励模型,对每一步逻辑推导进行精细评估。这有效缓解了奖励稀疏性问题,促进了可解释且稳健的推理策略学习,为神经符号AI和形式化数学验证提供了关键数据支撑,推动了该领域基础研究的进展。
实际应用
在实际应用中,该数据集主要服务于智能教育辅导系统和交互式定理证明辅助工具。教育场景下,PRM可对学生的数学解题步骤进行实时评分与反馈,指出逻辑漏洞,实现个性化学习指导。在软件验证领域,该数据集训练的模型可集成到证明助手中,自动检查形式化证明的每一步,减少人工审查负担,提高验证效率。此外,该数据集还为自动化推理竞赛和数学奥林匹克AI系统提供训练基础,支持开发能够自主证明复杂定理的智能体,展现出在科研辅助决策和知识发现中的巨大潜力。
数据集最近研究
最新研究方向
该数据集聚焦于形式化定理证明中的过程奖励建模,是当前人工智能数学推理领域的前沿探索。它利用Qwen3.5-9B模型生成的跨问题强化学习轨迹,创新性地以完整解决方案标签为上下文,结合归一化评分标准为部分推理步骤提供密集奖励信号。这一设计突破了传统二元正确性标注的局限,为细粒度监督复杂数学推导过程提供了高质训练数据,有力推动了过程监督在自动化定理证明、数学问题求解等方向的研究进展,对于提升大模型在严谨逻辑任务中的推理能力具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务