遇见数据集

rebase_thinkprm_gemma-4-E4B-it_rg_cognition_ns32_md4_bt0_1_seed42_rg_cognition_thinkprm_2gpu

收藏
Hugging Face2026-05-07 更新2026-05-08 收录
官方服务:

资源简介:

该数据集包含3200个测试样本,总大小为36.6MB。数据集包含多个特征字段:问题文本(question)、生成ID(generation_id)、生成内容(generation)、token数量(num_tokens)、奖励分数(reward)、问题索引(question_index)、目标(target)、任务类型(task)、价值函数预测(vf_prediction)和级别(level)。数据集似乎与某种生成任务或评估任务相关,可能涉及多轮生成或不同级别的处理(level字段)。聚合指标部分显示了大量关于生成性能的指标,包括不同配置下的通过率、唯一答案数量、token统计和各级别处理时间等,表明这可能是一个用于评估生成模型或强化学习模型的数据集。

This dataset comprises 3200 test samples with a total size of 36.6 MB. It includes multiple feature fields: question text (field `question`), generation ID (`generation_id`), generated content (`generation`), token count (`num_tokens`), reward score (`reward`), question index (`question_index`), target (`target`), task type (`task`), value function prediction (`vf_prediction`), and level (`level`). This dataset appears to be related to generation or evaluation tasks, potentially involving multi-turn generation or multi-level processing as indicated by the `level` field. The aggregated metrics section contains numerous generation performance indicators, including pass rates under various configurations, counts of unique answers, token statistics, processing time per level, and others, suggesting that this dataset is designed for evaluating generative models or reinforcement learning models.

创建时间:
2026-05-05
原始信息汇总

数据集概述

该数据集名为 rebase_thinkprm_gemma-4-E4B-it_rg_cognition_ns32_md4_bt0_1_seed42_rg_cognition_thinkprm_2gpu,托管于 Hugging Face Datasets。数据集主要包含与推理相关的问答数据,并附带了详细的性能指标。

数据集结构

数据集包含一个测试集(test),共 3200 个样本,下载大小为 9.23 MB,数据集总大小为 36.60 MB。

特征字段:

字段名 数据类型 说明
question string 问题文本
generation_id int64 生成ID
generation string 生成的回答
num_tokens int64 生成的token数量
reward float64 奖励值
question_index int64 问题索引
target string 目标答案
task string 任务名称
vf_prediction float64 值函数预测
level int64 难度等级

聚合性能指标

数据集共聚合了 10 个分片,以下为关键性能指标:

主要评估指标(maj@k / pass@k):

指标
maj@1 0.470232
maj@8 0.506213
maj@16 0.493973
maj@32 0.495148
pass@1 0.448125
pass@8 0.596862
pass@16 0.627894
pass@32 0.65

其他关键指标:

  • 平均响应Token数(avg_response_tokens:2840.9
  • 中位数响应Token数(median_response_tokens:2049.8
  • 生成阶段耗时(generation_phase_time_s:1333.32 秒
  • 总耗时(total_time_s:1881.93 秒
  • 总策略输出Token数(total_policy_output_tokens:909,105
  • 总评判输出Token数(total_judge_output_tokens:4,117,400
  • 总生成输出Token数(total_generated_output_tokens:5,026,500
  • 唯一答案数量(num_unique_answers@1:0.929
  • 唯一答案数量(num_unique_answers@32:9.52

不同难度等级的输出Token数:

等级 策略输出Token数 评判输出Token数
等级 1 729,028 1,877,640
等级 2 131,681 453,921
等级 3 32,804.1 82,606.1
等级 4 14,300 49,392.3
搜集汇总
数据集介绍
rebase_thinkprm_gemma-4-E4B-it_rg_cognition_ns32_md4_bt0_1_seed42_rg_cognition_thinkprm_2gpu 数据集图片
构建方式
该数据集基于ReBase框架,结合ThinkPRM方法,由Gemma-4-E4B-it模型在数学推理任务上生成。数据集通过多轮搜索与评判机制构建,每次推理包含多级生成和评分过程,最终汇集了3200个测试样本。每个样本包含原始问题、生成ID、完整推理链、奖励值、问题索引、目标答案、任务类型、价值函数预测及难度等级等信息。
特点
数据集的核心特点在于其多维度评估指标,涵盖多种投票与通过率统计,如maj@k、pass@k和w_best@k等,反映了模型在不同采样规模下的推理稳定性与准确性。同时,记录了详尽的代币使用与时间消耗数据,便于分析推理效率。数据集的构建强调了从简单到复杂的四级推理层次,实现了对推理深度的精细刻画。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,指定default配置即可获取test分割数据。每一条记录提供了完整的推理链与元数据,便于进行模型推理能力的基准测试、奖励模型分析或多层级推理策略评估。数据集的标准化结构使其易于集成到现有的评估管线中,支持复现研究或进行二次分析。
背景与挑战
背景概述
在大型语言模型推理能力的研究中,如何有效评估和提升模型在数学推理等复杂认知任务上的表现成为核心议题。该数据集由基于Gemma-2-27B-it的rebase_thinkprm框架生成,发布于2024年,旨在通过过程奖励模型(Process Reward Model)的评分机制,为数学问题生成包含多步搜索轨迹的思维链数据。数据集共包含3200条测试样本,每条数据涵盖问题、生成结果、奖励值、任务类型及四种层次的评估指标,为探索模型在推理过程中的搜索深度与答案质量提供了标准化基准。其研究机构或团队专注于通过强化学习与推理过程监督,推动语言模型在需要多步逻辑推理的数学领域取得突破,对理解语言模型的内部推理机制与优化奖励建模策略具有重要参考价值。
当前挑战
该数据集所解决的领域核心挑战在于:数学推理任务要求模型在广阔的解空间中高效搜索并生成准确答案,而传统单一输出评估难以捕捉推理过程的正确性。构建过程中,主要挑战包括:1) 如何设计多层次的推理搜索结构(如代码中level_1至level_4),以平衡搜索广度与计算成本;2) 如何构建可靠的thinkprm评分机制,对每个推理步骤进行细粒度奖励建模,避免奖励噪声与偏差;3) 如何在有限资源下(如2GPU配置)生成足够多样化的搜索轨迹(如32次采样),同时保证评估统计量(如pass@k、maj@k)的稳定性与可复现性。此外,聚合来自10个分片的指标时,不同分片间模型性能的差异(如maj@1_std达0.077)也凸显了推理结果随机性带来的评估挑战。
常用场景
经典使用场景
在数学推理与逻辑思维评估领域,rebase_thinkprm_gemma-4-E4B-it_rg_cognition_ns32_md4_bt0_1_seed42_rg_cognition_thinkprm_2gpu数据集被广泛用于检验和提升大语言模型的逐步推理能力。该数据集精心构建了涵盖多种难度的数学与认知类问题,并标注了详细的推理步骤及奖励信号,使得研究者能够深入剖析模型在复杂推理任务中的表现。通过多次采样与集成投票策略,数据集为评估模型输出的多样性、稳定性与最终正确率提供了可靠基准,尤其适用于探究强化学习与过程奖励模型如何在语言模型微调中发挥作用。其精细的层次化设计,使得从初级到高级的推理能力均能被有效度量,成为该领域权威的评测标准之一。
衍生相关工作
由此数据集衍生出的一系列经典工作,深刻重塑了强化学习与推理模型的交叉研究版图。领域内著名的Math-Shepherd、PRM800K等过程奖励模型均在类似的数据构建理念下诞生,而该数据集独特的多层采样与投票机制更催生了如“自洽性推理”、“加权投票策略”等优化方法。诸如OpenAI的Let's Verify Step by Step等里程碑式研究,也借鉴了其过程监督的评估范式。在模型训练层面,基于此数据集的强化学习微调框架,启发了一系列旨在平衡探索与利用的算法改进,例如通过动态调整采样深度与宽度来提升样本效率,这些方法已被收录于主流研究文献并持续推动推理智能体的泛化能力边界拓展。
数据集最近研究
最新研究方向
该数据集聚焦于大规模语言模型在推理任务中融入认知搜索策略的前沿探索,特别是通过树搜索与价值函数引导的生成机制来提升模型在多步推理中的准确性与鲁棒性。研究热点在于利用ThinkPRM评分器对模型生成的中间推理阶段进行多层次评估,并结合加权投票与多数表决机制优化最终答案的选择。从聚合指标可见,模型在pass@k与maj@k上的表现随搜索步数增加而提升,揭示了更充分的搜索能有效缓解早期错误传播的问题。这一方向与当前追求可解释、可验证的智能推理系统高度契合,为构建更接近人类认知过程的决策模型提供了实证基础,对推动复杂推理任务的自动化与信任度提升具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务