fineproofs-branch-rollout-distribution
收藏资源简介:
FineProofs Branch Rollout Distribution 是一个针对数学推理任务中模型rollout前缀的聚合统计数据集。该数据集基于运行 'fineproofs_all_qwen35_9b_direct2phase_m32_20260730' 生成,每行代表一个收集到的响应前缀,并总结了32个由Qwen3.5-9B模型连续生成的延续,这些延续由GPT-OSS-120B根据问题评分标准进行评分。数据集包含86,156个前缀记录,每个记录包括轨迹元数据、经验评分统计以及一个20-bin的延续评分直方图(将[0,1]以0.05间隔划分)。此外,还提供集合范围分布、深度摘要和PRM构建记录(summary.json)、完整性覆盖元数据(trace_manifest.json)以及10,454个选定的基础推理轨迹(traces/*.json.gz,按问题ID前两个十六进制字符分片)。每个轨迹存储一次,并包含每个收集前缀步骤的精确UTF-16偏移。数据集适用于推理评估、过程奖励模型(PRM)训练或分析,以及模型rollout行为研究。
FineProofs Branch Rollout Distribution is an aggregated statistical dataset of model rollout prefixes for mathematical reasoning tasks. The dataset is generated based on running fineproofs_all_qwen35_9b_direct2phase_m32_20260730, where each row represents a collected response prefix and summarizes 32 consecutive continuations generated by the Qwen3.5-9B model, which are scored by GPT-OSS-120B according to problem scoring criteria. The dataset contains 86,156 prefix records, each including trajectory metadata, empirical score statistics, and a 20-bin continuation score histogram (dividing [0,1] into 0.05 intervals). Additionally, it provides collection range distribution, depth summary, and PRM construction records (summary.json), completeness coverage metadata (trace_manifest.json), and 10,454 selected basic reasoning trajectories (traces/*.json.gz, sharded by the first two hexadecimal characters of the problem ID). Each trajectory is stored once and includes precise UTF-16 offsets for each collected prefix step. The dataset is suitable for reasoning evaluation, process reward model (PRM) training or analysis, and model rollout behavior research.
数据集概述
FineProofs Branch Rollout Distribution 是一个数学推理与过程奖励模型(PRM)评估相关的数据集,许可证为 MIT。
该数据集记录了运行任务 fineproofs_all_qwen35_9b_direct2phase_m32_20260730 的逐前缀汇总统计信息。每一行代表一条已收集的响应前缀,并汇总了由 GPT-OSS-120B 根据问题评分标准对 32 条全新 Qwen3.5-9B 续写结果进行评分的结果。mean_grade 是归一化后的平均评分,取值范围为 [0, 1],并非伯努利成功率。
文件结构与内容
| 文件路径 | 内容说明 |
|---|---|
data/prefix_values.parquet |
包含 86,156 条前缀记录,附有轨迹元数据、经验评分统计以及 20 桶续写评分直方图 |
data/summary.json |
包含整个采集过程的分布概况、深度汇总及 PRM 构建的核算信息 |
data/trace_manifest.json |
包含推理导出的完整性与覆盖率元数据 |
data/traces/*.json.gz |
包含全部 10,454 条选定的基础推理轨迹,按问题 ID 前两位十六进制字符分片存储;每条轨迹仅保存一次,并带有每个采集前缀步骤的精确 UTF-16 偏移量 |
评分直方图说明
- 20 个直方图桶将 [0, 1] 区间按 0.05 间隔划分,评分 1.0 归入最后一桶。
- 采样的续写文本及裁判记录数量更大,未在本数据集中重复保存。
- 轨迹端点是依据
(problem_id, sample_index)关联自独立冻结的 GPT-OSS-120B 基础评分日志;可空的 branch 元数据从未被用作标签。




