rebase_thinkprm_gemma-4-E4B-it_lcb_v6_ns128_md4_bt0_1_seed42_lcb_v6_thinkprm_2gpu
收藏数据链接:
官方服务:
资源简介:
该数据集包含16,768个测试样本,主要用于文本生成或问答任务。数据集包含多个字段,包括问题(question)、生成ID(generation_id)、生成内容(generation)、标记数量(num_tokens)、奖励(reward)、问题索引(question_index)、目标(target)、任务(task)、VF预测(vf_prediction)和级别(level)。数据规模为25,168,175,591字节,下载大小为14,070,285,431字节。聚合指标显示,平均响应标记为7,900.67,生成阶段时间为9,855.22秒,pass@1率为54.53%,pass@128率为80.15%。这些指标表明数据集在生成多样性和质量方面进行了评估。
创建时间:
2026-05-05
原始信息汇总
数据集概述:rebase_thinkprm_gemma-4-E4B-it_lcb_v6_ns128_md4_bt0_1_seed42_lcb_v6_thinkprm_2gpu
该数据集是一个用于评估和训练语言模型推理能力的测试数据集,包含16,768个样本,总大小为25.17 GB。数据集涵盖了多个评估指标,重点关注生成质量、多候选一致性和搜索效率。
数据文件与配置
- 配置文件名称:
default - 数据分割: 仅包含
test分割,数据文件路径为data/test-*。
数据集特征
数据集包含10个特征字段:
question(string): 问题文本。generation_id(int64): 生成序列的唯一ID。generation(string): 模型生成的回答。num_tokens(int64): 生成回答的token数量。reward(float64): 奖励分数。question_index(int64): 问题索引。target(string): 目标答案或参考标准。task(string): 任务类型。vf_prediction(float64): 价值函数预测值。level(int64): 难度级别。
数据集规模
- 总下载大小: 14.07 GB
- 总数据集大小: 25.17 GB
- 测试样本数量: 16,768 条
聚合指标(基于16个分片)
生成与响应统计
avg_response_tokens: 平均响应token数,为7900.67。median_response_tokens: 中位数响应token数,为7082.27。generation_phase_time_s: 生成阶段耗时,为9855.22秒。
主要评估指标
pass@k系列指标(通过率):pass@1: 0.545 (54.5%)pass@2: 0.612 (61.2%)pass@4: 0.661 (66.1%)pass@8: 0.699 (69.9%)pass@16: 0.729 (72.9%)pass@32: 0.754 (75.4%)pass@64: 0.778 (77.8%)pass@128: 0.802 (80.2%)
w_best@k系列指标(加权最佳选择):w_best@1: 0.536w_best@2: 0.545w_best@4: 0.556w_best@8: 0.556w_best@16: 0.564w_best@32: 0.554w_best@64: 0.557w_best@128: 0.565
maj@k系列指标(多数投票)均为0。
搜索与评分效率
thinkprm_score_time_level_1到level_4: 各层级评分耗时,Level 1 耗时最长 (3862.04秒),Level 4 最短 (23.62秒)。total_time_s: 总耗时,为15304.4秒。total_generated_output_tokens: 总生成输出token数,为33,251,400。total_judge_output_tokens: 总评判输出token数,为24,996,000。total_policy_output_tokens: 总策略输出token数,为8,255,350。
搜集汇总
数据集介绍

构建方式
该数据集基于代码生成领域的竞赛编程数据集LiveCodeBench(v6版本)构建,采用ThinkPRM(Process Reward Model)框架对模型生成结果进行多层级评估。具体而言,利用Gemma-4-E4B-it模型作为策略网络,为每个问题生成128个候选解决方案,并对这些候选方案进行4轮递增的搜索与评估,以获取更精细的过程奖励信息。最终构建了包含16,768个样本的测试集,每个样本均关联了问题描述、生成内容、令牌数量、奖励值、垂直预测分数及任务类型等元信息。
使用方法
该数据集适用于强化学习中的过程奖励建模、搜索策略优化以及代码生成模型的训练与评测。用户可直接加载测试集进行模型泛化能力验证,或利用其中的‘reward’与‘vf_prediction’字段作为训练奖励模型的监督信号。研究者可复用其4级搜索结构来复现多步推理框架,或基于‘generation’字段分析不同采样规模(如2、4、8、16直至128)对pass@k性能的影响。数据以Parquet格式分片存储,便于使用HuggingFace Datasets库进行高效流式读取与分批次处理。
背景与挑战
背景概述
在大型语言模型(LLM)的推理能力研究中,过程奖励模型(Process Reward Model, PRM)逐渐成为提升模型在复杂数学与编程任务中推理准确性的关键手段。rebase_thinkprm_gemma-4-E4B-it_lcb_v6_ns128_md4_bt0_1_seed42_lcb_v6_thinkprm_2gpu数据集由相关研究团队基于Gemma-4-E4B-it模型构建,旨在探索通过过程监督信号引导模型进行深度思考与多步推理的范式。该数据集包含约16,768个测试样本,涉及多个难度等级的编程与推理任务,每条数据均记录了模型生成的思考过程、生成的响应、奖励分数以及价值函数预测等关键信息。其研究核心在于验证基于过程奖励的搜索策略(如加权投票和多数投票)对模型最终解答能力的提升效果,相关指标如pass@1(0.545)和pass@128(0.802)初步展示了该方法的潜力,为后续强化学习与推理对齐研究提供了重要基准。
当前挑战
该数据集所面临的挑战体现在两个层面。在领域问题层面,如何让大模型在编程与数学推理任务中实现可靠的多步推理仍是核心难题,现有方法常因奖励信号稀疏或错误累积而陷入局部最优,数据集设计的加权投票与过程监督机制虽有所改进,但在高采样次数(如128次)下仍无法稳定达到理论最优(pass@128为0.802),表明在复杂任务中引导模型探索正确推理路径的难度极高。在构建过程中,数据集生成面临显著的计算资源瓶颈,总生成时间超过15,000秒,涉及超过3,300万策略输出token和2,500万判别输出token的交互,同时需要协调四层推理阶段与多层级别判断机制,确保每个样本的奖励标注与价值函数预测一致,对工程实现与噪声控制提出了严苛挑战。
常用场景
经典使用场景
在代码生成与数学推理的交叉领域中,该数据集为评估和提升大语言模型的多步推理能力提供了关键支撑。其经典使用场景聚焦于利用生成式模型对编程问题产生候选解答,并借助ThinkPRM过程奖励模型对中间推理步骤进行细粒度评分,从而筛选出高质量的解。数据集涵盖了大量包含复杂逻辑的算法题,每条数据均记录了模型的多轮生成轨迹、奖励分值以及价值函数预测,为研究奖励模型在搜索树中的引导作用奠定了坚实基础。
解决学术问题
该数据集直面当前大语言模型在复杂推理任务中面临的奖励稀疏和信用分配难题。通过引入过程奖励模型对每个推理步骤进行独立评估,它有效缓解了传统结果奖励模型在长链推理中反馈滞后的问题。研究工作利用这一数据集系统性地比较了pass@k与w_best@k等指标,揭示了过程监督机制在提升模型推理稳健性方面的独特优势,对推进强化学习在语言模型中的应用具有重要理论意义。
实际应用
在实际应用中,该数据集可服务于自动化代码生成系统的质量监控与优化。例如,在辅助编程教学平台中,它能够对学生的代码求解路径进行实时评估,提供分步反馈;在企业级智能开发助手中,它可结合搜索策略从大量候选解中挑选最优实现,提升代码的准确性和效率。此外,基于该数据集的奖励模型还可迁移至其他需要多步推理的领域,如数学证明和逻辑规划。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成领域的前沿探索,通过引入四级分层评判机制与自博弈式强化学习范式,利用thinkPRM过程奖励模型对大规模语言模型(如Gemma-4-IT)在多轮搜索中生成的候选解进行多层次评分与优化。研究热点围绕如何显著提升模型在复杂编程任务中的pass@k指标,例如在128次采样下达到80.15%的通过率,相较单次采样的54.53%实现质的飞跃,这标志着代码生成从简单补全向深度推理与问题求解的转变。该工作对推动AI辅助软件开发、自动化程序修复等应用具有深远影响,为构建更可靠、高效的智能编程助手奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成



