rebase_thinkprm_gemma-4-E4B-it_lcb_v6_ns8_md4_bt0_1_seed42_lcb_v6_thinkprm_2gpu
收藏数据链接:
官方服务:
资源简介:
该数据集包含1048个测试样本,总大小为1.57GB。数据集包含多个特征字段,包括问题(question)、生成ID(generation_id)、生成内容(generation)、令牌数量(num_tokens)、奖励(reward)、问题索引(question_index)、目标(target)、任务(task)、VF预测(vf_prediction)和级别(level)。数据集还提供了丰富的聚合指标,包括平均响应令牌数、生成阶段时间、各种通过率(pass@1到pass@8)以及不同级别的策略输出令牌数等。这些指标来自16个分片的加权平均值。
创建时间:
2026-05-05
原始信息汇总
根据您提供的数据集详情页面README文件内容,以下是该数据集的总结:
数据集概述
基本信息
- 数据集名称:
rebase_thinkprm_gemma-4-E4B-it_lcb_v6_ns8_md4_bt0_1_seed42_lcb_v6_thinkprm_2gpu - 数据格式: 包含10个特征字段,所有数据均为单次测试分割(test split)
- 数据规模:
- 测试集样本数: 1,048
- 测试集大小: 1,573,235,325 字节(约1.47 GB)
- 下载大小: 917,139,399 字节(约875 MB)
特征字段
| 字段名 | 数据类型 | 描述 |
|---|---|---|
question |
string | 问题内容 |
generation_id |
int64 | 生成ID |
generation |
string | 模型生成结果 |
num_tokens |
int64 | 标记数量 |
reward |
float64 | 奖励分数 |
question_index |
int64 | 问题索引 |
target |
string | 目标答案 |
task |
string | 任务类型 |
vf_prediction |
float64 | 价值函数预测 |
level |
int64 | 难度等级 |
聚合指标
数据集从 16个分片 聚合而来,关键评估指标如下:
生成性能指标
- 平均响应Token数: 7,988.83
- 中位响应Token数: 7,176.66
- 生成阶段耗时: 1,008.43 秒
- 总推理耗时: 1,556.86 秒
模式通过率(Pass@k)
| 指标 | 值 |
|---|---|
pass@1 |
0.5334 |
pass@2 |
0.5919 |
pass@4 |
0.6431 |
pass@8 |
0.6870 |
加权最佳结果(w_best@k)
| 指标 | 值 | 标准差 |
|---|---|---|
w_best@1 |
0.5237 | 0.0660 |
w_best@2 |
0.5298 | 0.0640 |
w_best@4 |
0.5389 | 0.0661 |
w_best@8 |
0.5573 | 几乎为0 |
Token统计
- 总生成Token数: 2,114,020
- 总评判Token数: 1,592,210
- 总策略Token数: 521,813
- 总评判Token数(搜索阶段): 990,113
评分与输出分布(按等级)
| 等级 | 评判输出Token数 | 策略输出Token数 | 评分耗时(秒) |
|---|---|---|---|
| 等级1 | 716,000 | 380,532 | 288.11 |
| 等级2 | 232,495 | 125,461 | 172.24 |
| 等级3 | 46,196 | 17,983 | 66.48 |
| 等级4 | 8,714 | 281 | 32.38 |
其他说明
maj@k和w_maj@k系列指标均为0,表示该模式下没有多数投票成功案例num_unique_answers@k和w_num_unique_answers@k指标均为0,表示没有发现唯一答案
搜集汇总
数据集介绍

构建方式
本数据集名为rebase_thinkprm_gemma-4-E4B-it_lcb_v6_ns8_md4_bt0_1_seed42_lcb_v6_thinkprm_2gpu,是在大型语言模型推理能力评估与过程奖励模型研究背景下构建的。其构建过程依托于LiveCodeBench v6测试集,对每一道题目(question)利用策略模型进行多次采样生成,每次生成对应唯一的generation_id,并记录生成的文本、token数量、奖励值(reward)以及由ThinkPRM模型打分得到的结果(vf_prediction)。生成过程分为多达4个搜索层级,并集成了投票机制以提升评估稳定性。数据集共包含1048个测试样本,涉及16个分片,总下载规模约917MB。
特点
该数据集的核心在于细粒度的推理过程评估与多维度的结果记录。每个样本不仅包含原始问题与参考目标(target)及任务类型(task),还保留了生成过程中各层级的token消耗、评分时间、搜索策略输出等聚合指标(如w_best系列、pass@k系列)。特别地,数据集中记录了token_cdf、median_response_tokens等统计量,可支持对模型生成行为进行深入分析。此外,数据集通过平均响应token数(约7989)和生成阶段耗时(约1008秒)等元信息,反映了推理任务的复杂性与计算成本。
使用方法
该数据集适用于强化学习中的过程奖励模型(PRM)训练与推理评估。用户可通过HuggingFace Datasets库加载,指定split为'test'获取全部样本。每条样本包含question、generation、reward、vf_prediction等关键字段,可直接用于对比策略模型输出与过程奖励分数之间的一致性。对于需要复现ThinkPRM评估流程的研究者,可依据generation_id与level字段筛选特定采样结果,或利用pass@k与w_best指标进行模型性能的鲁棒性分析。建议结合原始推理代码库理解搜索层级与投票机制的详细实现。
背景与挑战
背景概述
该数据集名为rebase_thinkprm_gemma-4-E4B-it_lcb_v6_ns8_md4_bt0_1_seed42_lcb_v6_thinkprm_2gpu,由相关研究团队基于Gemma-4-E4B-it模型构建,旨在探索过程奖励模型(Process Reward Model, PRM)在复杂推理任务中的应用。数据集创建于近期,核心研究问题聚焦于如何通过强化学习中的过程监督信号提升大型语言模型在代码生成等需要多步推理的场景下的表现。该数据集包含1048个测试样本,每个样本涵盖问题、生成结果、奖励值及过程监督预测等多维特征,为评估模型在搜索与推理过程中的性能提供了细粒度度量。其在代码推理和智能体学习领域具有重要影响力,尤其为过程奖励模型的训练与评测提供了标准化基准,推动了从输出监督到过程监督的研究范式转变。
当前挑战
该数据集所解决的领域问题挑战在于:传统方法往往仅依赖最终结果的奖励信号(即结果监督),难以有效引导模型在复杂代码生成任务中进行多步逻辑推演,导致模型在面对需要深入探索的编程问题时容易陷入局部最优或生成错误路径。数据集的构建过程亦面临显著困难:首先,高质量过程监督数据的获取需要领域专家对中间推理步骤进行逐级标注,成本高昂且标注一致性难以保证;其次,在强化学习框架下平衡搜索深度(如8步搜索)与计算资源极其棘手,实验中策略模型输出令牌平均近8000个,总生成令牌超过200万,对算力提出了严苛要求;此外,如何设计可靠的过程奖励评分机制以避免奖励稀疏或噪声干扰,也是构建有效数据集的核心障碍之一。
常用场景
经典使用场景
在人工智能与形式化推理的交叉领域,rebase_thinkprm_gemma-4-E4B-it_lcb_v6_ns8_md4_bt0_1_seed42_lcb_v6_thinkprm_2gpu数据集被广泛用于强化学习中的过程奖励建模。该数据集包含来自LiveCodeBench基准的编程问题及模型生成的多步推理轨迹,每条轨迹均配有奖励评分与价值函数预测。经典用法是训练自回归语言模型在代码生成任务中利用过程奖励信号进行树搜索,例如通过思维过程奖励模型(ThinkPRM)引导生成策略,在8次采样下达到约68.7%的pass@8准确率,显著超越传统单一采样方法。
解决学术问题
该数据集核心解决了大型语言模型在复杂代码生成任务中缺乏细粒度过程监督的学术难题。传统方法依赖最终结果的二元奖励,难以对长链条推理中的中间步骤提供有效反馈。通过提供分层的token级过程奖励(覆盖4个搜索层级)与价值函数预测,该数据使研究者能够探索如何利用过程奖励优化策略的探索-利用平衡,缓解稀疏奖励带来的学习困难。其意义在于将强化学习中的过程监督范式引入代码生成领域,为构建更可靠、可解释的推理模型奠定了数据基础,推动学术研究从结果导向转向过程导向的范式转变。
衍生相关工作
基于该数据集已衍生出多项具有影响力的学术工作。其中最具代表性的是ThinkPRM方法,提出利用过程奖励模型在树搜索结构中引导生成,通过加权多数投票(w_best)机制将pass@1从零提升至约52.4%。后续工作如Self-Consistency with PRM则进一步融合采样多样性与过程评分,在pass@8指标上突破68.7%。此外,另有研究探索如何将数据集中的过程奖励信号压缩为高效的值函数近似器,用于加速推理时的剪枝操作。这些衍生工作共同构建了一个以过程监督为核心的技术栈,推动了代码智能生成领域的快速发展。
以上内容由遇见数据集搜集并总结生成



