fineproofs-prm-context-v2-full-cot
收藏资源简介:
FineProofs PRM Context v2: Full Cot 是一个用于过程奖励模型(Process Reward Model)训练的数据集,专注于定理证明(theorem proving)领域。该数据集基于 FineProofs rollout collection,使用 Qwen3.5-9B 模型生成,采用 full_cot 上下文模式,从同一问题(same_problem)的 rollouts 中提取,并应用 middle_truncated_reasoning_equal_share 的打包策略。数据包含训练集(53,457 条样本,2,542 个问题)和验证集(2,602 条样本,128 个问题)。每条样本包含密集的奖励信号(reward)作为训练目标,以及一个基于奖励阈值的布尔型正确性标签(correct,reward >= 0.5 时为正)。数据集适用于需要细粒度奖励监督的定理证明推理任务,特别是过程奖励模型的训练与评估。
FineProofs PRM Context v2: Full Cot is a dataset dedicated to training Process Reward Models (PRMs), focusing on the domain of theorem proving. Built upon the FineProofs rollout collection, this dataset was generated using the Qwen3.5-9B model, adopts the full_cot context mode, is extracted from rollouts of identical problems, and employs the packing strategy named middle_truncated_reasoning_equal_share. It consists of a training set with 53,457 samples corresponding to 2,542 problems, and a validation set with 2,602 samples corresponding to 128 problems. Each sample contains dense reward signals as the training objective, along with a boolean correctness label (`correct`), which is marked positive when the reward value is greater than or equal to 0.5. This dataset is suitable for theorem proving reasoning tasks that require fine-grained reward supervision, especially for the training and evaluation of Process Reward Models.
数据集概述:FineProofs PRM Context v2 - Full Cot
该数据集是 FineProofs 项目下的一个子集,名为 FineProofs PRM Context v2 - Full Cot,主要用于过程奖励模型(Process Reward Model) 的训练与评估,服务于定理证明(Theorem Proving) 相关任务。数据集的任务类别为文本分类(text-classification)。
核心特点
- 上下文策略:该版本使用了来自
same_problem的full_cot(完整思维链)上下文,并采用middle_truncated_reasoning_equal_share的打包策略。 - 训练目标:部分前缀(partial-prefix)和完整响应(complete-response)目标均使用基于裁剪后分数除以最大分数的规范归一化评分;
correct列仅为旧版布尔投影(reward >= 0.5),训练时应使用密集的reward目标。 - 数据来源:该数据集是九个行匹配的上下文变体之一,所有变体均基于已验证的 FineProofs 展开(rollout)集合构建。
数据契约(Contract)
- 运行 ID:
fineproofs_all_qwen35_9b_direct2phase_m32_20260730 - 采集模型:
Qwen/Qwen3.5-9B,模型修订版本为c202236235762e1c871ad0ccb60c8ee5ba337b9a - 上下文模式:
full_cot,上下文范围为same_problem - 上下文正确性标签:不包含(
no) - 验证哈希(SHA-256):
c5a3b92bd6196d4a33cded2c1a01870d1963d323351d573b369b7f97f3b7f648
此外,九个变体具有相同的行键、标签、奖励、训练/验证问题划分及硬端点覆盖。被排除的问题在划分和上下文选择前已被移除。
数据划分
| 划分 | 行数 | 问题数 |
|---|---|---|
| train | 53,457 | 2,542 |
| validation | 2,602 | 128 |
本地文件 val.parquet 发布为 validation.parquet。数据集还包含 dataset_provenance.json、verification.json 和 _SUCCESS.json 文件,分别用于记录实时输入来源、跨变体验证以及发布文件的精确指纹。




