fineproofs-prm-context-v2-solution
收藏资源简介:
FineProofs PRM Context v2 - Solution 是一个用于过程奖励模型(PRM)训练的数据集,源自 FineProofs 项目中的验证 rollout 集合。该数据集采用 solution 上下文,从 same_problem 的 rollout 中采样,并使用 whole_solutions_no_truncation 打包策略。它是九个行匹配的上下文变体之一,所有变体共享相同的行键、标签、奖励、训练/验证问题划分以及硬端点覆盖。数据集中包含 correct 列(基于奖励阈值为 0.5 的布尔值投影)和用于训练的密集 reward 目标。数据集规模:训练集包含 53,457 条样本,对应 2,542 个问题;验证集包含 2,602 条样本,对应 128 个问题。验证文件以 validation.parquet 形式发布。该数据集适用于定理证明领域中的过程奖励建模任务,可支持基于 Qwen3.5-9B 等模型的训练与评估。
FineProofs PRM Context v2 - Solution is a dataset for training process reward models (PRM), derived from the validation rollout set of the FineProofs project. It adopts the solution context, samples from rollouts of same_problem, and uses the whole_solutions_no_truncation packing strategy. It is one of nine row-matched context variants, all sharing the same row keys, labels, rewards, train/validation problem splits, and hard endpoint coverage. The dataset includes a correct column (a boolean projection based on a reward threshold of 0.5) and dense reward targets for training. Dataset size: training set contains 53,457 samples corresponding to 2,542 problems; validation set contains 2,602 samples corresponding to 128 problems. The validation file is published as validation.parquet. This dataset is suitable for process reward modeling tasks in the theorem proving domain, supporting training and evaluation based on models such as Qwen3.5-9B.
数据集概述
FineProofs PRM Context v2: Solution 是一个用于**过程奖励模型(Process Reward Model)训练和评估的文本分类数据集,专注于定理证明(Theorem Proving)**领域。该数据集基于FineProofs验证的rollout集合构建,是九个行匹配的上下文变体之一。
构建背景与核心特性
- 上下文类型:使用来自
same_problemrollouts的solution上下文,采用whole_solutions_no_truncation打包策略。 - 标签体系:部分前缀和完整响应目标均使用基于钳制分数除以最大分数的规范化评分标准(rubric credit)。
- 奖励目标:训练时使用稠密的
reward目标;correct列仅为旧有的布尔投影(reward >= 0.5),并非训练依据。
数据契约
| 项目 | 值 |
|---|---|
| 运行ID | fineproofs_all_qwen35_9b_direct2phase_m32_20260730 |
| 收集模型 | Qwen/Qwen3.5-9B |
| 模型版本 | c202236235762e1c871ad0ccb60c8ee5ba337b9a |
| 上下文臂 | solution |
| 上下文模式 | solution |
| 上下文范围 | same_problem |
| 上下文中的正确性标签 | no |
| 验证SHA-256 | c5a3b92bd6196d4a33cded2c1a01870d1963d323351d573b369b7f97f3b7f648 |
九个上下文变体共享相同的行键、标签、奖励、训练/验证问题划分以及硬端点覆盖。持有问题在划分和上下文选择之前被移除。
数据划分
| 划分 | 行数 | 问题数 |
|---|---|---|
| train | 53,457 | 2,542 |
| validation | 2,602 | 128 |
本地文件 val.parquet 以 validation.parquet 名称发布。
附带文件
dataset_provenance.json:包含实时输入来源信息。verification.json:包含跨臂检查信息。_SUCCESS.json:包含精确的已发布文件指纹。





