遇见数据集

fineproofs-branch-rollout-distribution

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

FineProofs Branch Rollout Distribution 是一个针对数学推理任务中模型rollout前缀的聚合统计数据集。该数据集基于运行 'fineproofs_all_qwen35_9b_direct2phase_m32_20260730' 生成,每行代表一个收集到的响应前缀,并总结了32个由Qwen3.5-9B模型连续生成的延续,这些延续由GPT-OSS-120B根据问题评分标准进行评分。数据集包含86,156个前缀记录,每个记录包括轨迹元数据、经验评分统计以及一个20-bin的延续评分直方图(将[0,1]以0.05间隔划分)。此外,还提供集合范围分布、深度摘要和PRM构建记录(summary.json)、完整性覆盖元数据(trace_manifest.json)以及10,454个选定的基础推理轨迹(traces/*.json.gz,按问题ID前两个十六进制字符分片)。每个轨迹存储一次,并包含每个收集前缀步骤的精确UTF-16偏移。数据集适用于推理评估、过程奖励模型(PRM)训练或分析,以及模型rollout行为研究。

FineProofs Branch Rollout Distribution is an aggregated statistical dataset of model rollout prefixes for mathematical reasoning tasks. The dataset is generated based on running fineproofs_all_qwen35_9b_direct2phase_m32_20260730, where each row represents a collected response prefix and summarizes 32 consecutive continuations generated by the Qwen3.5-9B model, which are scored by GPT-OSS-120B according to problem scoring criteria. The dataset contains 86,156 prefix records, each including trajectory metadata, empirical score statistics, and a 20-bin continuation score histogram (dividing [0,1] into 0.05 intervals). Additionally, it provides collection range distribution, depth summary, and PRM construction records (summary.json), completeness coverage metadata (trace_manifest.json), and 10,454 selected basic reasoning trajectories (traces/*.json.gz, sharded by the first two hexadecimal characters of the problem ID). Each trajectory is stored once and includes precise UTF-16 offsets for each collected prefix step. The dataset is suitable for reasoning evaluation, process reward model (PRM) training or analysis, and model rollout behavior research.

创建时间:
2026-07-30
原始信息汇总

数据集概述

FineProofs Branch Rollout Distribution 是一个数学推理与过程奖励模型(PRM)评估相关的数据集,许可证为 MIT。

该数据集记录了运行任务 fineproofs_all_qwen35_9b_direct2phase_m32_20260730 的逐前缀汇总统计信息。每一行代表一条已收集的响应前缀,并汇总了由 GPT-OSS-120B 根据问题评分标准对 32 条全新 Qwen3.5-9B 续写结果进行评分的结果。mean_grade 是归一化后的平均评分,取值范围为 [0, 1],并非伯努利成功率。

文件结构与内容

文件路径 内容说明
data/prefix_values.parquet 包含 86,156 条前缀记录,附有轨迹元数据、经验评分统计以及 20 桶续写评分直方图
data/summary.json 包含整个采集过程的分布概况、深度汇总及 PRM 构建的核算信息
data/trace_manifest.json 包含推理导出的完整性与覆盖率元数据
data/traces/*.json.gz 包含全部 10,454 条选定的基础推理轨迹,按问题 ID 前两位十六进制字符分片存储;每条轨迹仅保存一次,并带有每个采集前缀步骤的精确 UTF-16 偏移量

评分直方图说明

  • 20 个直方图桶将 [0, 1] 区间按 0.05 间隔划分,评分 1.0 归入最后一桶。
  • 采样的续写文本及裁判记录数量更大,未在本数据集中重复保存。
  • 轨迹端点是依据 (problem_id, sample_index) 关联自独立冻结的 GPT-OSS-120B 基础评分日志;可空的 branch 元数据从未被用作标签。
搜集汇总
数据集介绍
fineproofs-branch-rollout-distribution 数据集图片
构建方式
FineProofs Branch Rollout Distribution数据集源自对数学推理问题的大规模采样实验,其构建基于Qwen3.5-9B模型在直接双阶段推理模式下生成的响应前缀,每个前缀对应32次独立采样续写,并由GPT-OSS-120B依据官方评分标准进行评判。数据以Parquet格式存储,包含86,156条前缀记录,涵盖轨迹元数据、经验分数统计及20区间直方图,同时辅以汇总JSON和完整推理轨迹压缩包,轨迹通过问题ID的十六进制前缀分片,并精确记录每个前缀步骤的UTF-16偏移量,确保与基础评分日志的精确关联。
特点
该数据集的核心特点在于其细粒度的过程监督数据建模,每个前缀的32次续写评分均值归一化至[0,1]区间,并非简单的二值成功指标,从而提供连续的过程奖励信号。20个直方图区间以0.05为步长划分,完整捕捉分数分布形态。此外,轨迹元数据与评判记录分离存储,避免了标签泄漏,且分片压缩格式保证了数据的高效加载与可追溯性,为过程奖励模型训练和评估提供了坚实的数据基础。
使用方法
该数据集适用于过程奖励模型(PRMs)的训练与评估,用户可基于前缀的统计特征设计回归或排序损失函数。直方图信息可支持不确定性感知的标签平滑,而完整轨迹文件则便于进行逐步推理分析。数据以Parquet和JSON格式提供,兼容主流数据处理框架,便于与HuggingFace生态无缝集成。使用时需注意mean_grade为连续值,应选择合适的归一化策略,并依据轨迹索引与基础评分日志保持关联,以充分利用全部信息。
背景与挑战
背景概述
FineProofs Branch Rollout Distribution 数据集诞生于2026年,由致力于数学推理与过程奖励模型(PRM)研究的团队构建,旨在为复杂数学问题的多步推理过程提供细粒度的过程级监督信号。该数据集基于Qwen3.5-9B模型对一系列数学问题进行树状展开(rollout),每个前缀(prefix)节点关联32次独立延续的评分结果,这些评分由GPT-OSS-120B依据问题评分标准生成,以均值归一化等级(mean_grade)呈现。其核心研究问题在于如何利用过程级反馈增强推理模型的逐步优化能力,通过提供丰富的分支分布统计而非简单的二元成功标签,为PRM的训练与评估奠定基础。数据集的发布对可解释、可验证的数学推理AI研究具有重要推动作用,为后续过程监督策略的探索提供了高密度、结构化的基准资源。
当前挑战
该数据集所应对的领域挑战在于,传统结果级监督难以揭示推理过程中的错误根源,而过程级标注成本高昂且主观性强;FineProofs通过自动化的评分模型与标准化前缀聚合,降低了过程监督数据的获取门槛,但其构建过程亦面临多重挑战:其一,确保32次采样延续的多样性及代表性,以准确刻画前缀节点的分布特征,避免采样偏差;其二,GPT-OSS-120B评分的一致性与鲁棒性需精心校验,保证跨问题、跨轨迹的评分可比性;其三,处理海量轨迹数据的存储与压缩,在保留完整推理信息(如UTF-16偏移)的同时控制冗余,这要求高效的数据结构设计;其四,针对分支元数据可能缺失的情况,设计严谨的标签策略,避免信息泄露或错误关联,从而保障数据集作为PRM训练基准的可信度。
常用场景
经典使用场景
在数学推理与过程监督领域,FineProofs Branch Rollout Distribution数据集为训练和评估过程奖励模型(PRM)提供了关键的支持性资源。该数据集记录了Qwen3.5-9B模型在解题过程中生成的80余万条前缀轨迹,每条轨迹均附有由GPT-OSS-120B依据问题评分标准评定的归一化等级得分,以及详细的连续生成分布。研究者可借此构建过程监督信号,用于训练PRM以预测中间步骤的正确性,从而强化模型在复杂数学问题上的逐步推理能力。该数据集特别适用于需要细粒度监督信号的场景,其20-bin直方图与完整的轨迹元数据使得对模型中间状态的动态评估成为可能,为过程奖励建模和推理策略优化提供了坚实的实验基础。
衍生相关工作
围绕该数据集,衍生出一系列值得关注的学术探索。其一,基于其前缀级得分分布,研究者可训练生成式PRM,用于动态预测后续步骤的优劣,进而衍生出对推理路径长度与答案质量之间非线性关系的建模研究。其二,其细粒度的直方图信息催生了将过程奖励与强化学习策略优化相结合的算法工作,比如将PRM得分作为奖励信号用于PPO或GRPO训练,提升策略模型的推理表现。其三,该数据集中轨迹与得分记录的格式,亦为探索多模型蒸馏和弱监督标注方法提供了基准,即在仅有轻微噪声的评分下如何高效构建可靠的过程监督数据集。这些衍生工作共同推进了过程监督在数学推理乃至更广阔多步任务中的应用边界。
数据集最近研究
最新研究方向
该数据集聚焦于过程奖励模型(PRM)在数学推理任务中的细粒度评估与训练样本构建,其核心理念在于利用大规模采样轨迹和分级标注来捕捉推理步骤的中间质量。当前前沿研究方向包括:基于前缀级评分直方图的分布鲁棒性训练,以提升模型对部分正确推理路径的判别能力;通过整合轨迹级元数据与多粒度标签,探索弱监督下的过程监督信号提取;以及利用该数据集评估生成式评判者(如GPT-OSS-120B)在复杂数学问题上的可解释性与一致性。该数据集的发布为可扩展的PRM训练与基准测试提供了高质量资源,有望推动推理模型在可验证性、可解释性及自我修正能力上的突破,对数学自动推理及大模型对齐领域具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务