rebase_vgs_gpt-oss-20b_rg_cognition_ns32_md4_bt0_1_seed42_rg_cognition_vgs_2gpu
收藏数据链接:
官方服务:
资源简介:
该数据集包含多个字段,主要用于问题生成和回答任务。数据集的主要特征包括问题文本(question)、生成ID(generation_id)、生成的回答(generation)、标记数量(num_tokens)、奖励分数(reward)、问题索引(question_index)、目标文本(target)、任务类型(task)、预测值(vf_prediction)和级别(level)。数据集仅包含测试集(test),共有3200个样本,总大小为59,735,548字节。此外,数据集还提供了丰富的聚合指标,包括不同级别的回答唯一性统计(num_unique_answers@N)、通过率(pass@N)、响应标记数统计(avg_response_tokens, median_response_tokens)以及各阶段的策略输出标记数(policy_output_tokens_level_X)等。这些指标可以帮助研究人员评估模型性能或分析数据集特性。
创建时间:
2026-05-07
原始信息汇总
根据您提供的数据集详情页面内容,以下是该数据集的概述:
数据集概述
基本信息
- 数据集名称: rebase_vgs_gpt-oss-20b_rg_cognition_ns32_md4_bt0_1_seed42_rg_cognition_vgs_2gpu
- 数据集大小: 59,735,548 字节
- 下载大小: 18,831,547 字节
- 配置: 仅包含一个默认配置(
default)
数据划分
- 测试集(test): 包含 3,200 个样本
数据特征(Features)
该数据集包含以下字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
question |
string | 问题内容 |
generation_id |
int64 | 生成ID |
generation |
string | 生成的回答 |
num_tokens |
int64 | 生成的token数量 |
reward |
float64 | 奖励值 |
question_index |
int64 | 问题索引 |
target |
string | 目标答案 |
task |
string | 任务类型 |
vf_prediction |
float64 | 价值函数预测值 |
level |
int64 | 层级 |
聚合指标(Aggregated Metrics)
该数据集从 10 个分片(shards) 聚合而来,以下是关键性能指标:
生成质量指标
| 指标 | 值 |
|---|---|
maj@1(多数投票准确率@1) |
0.4787 |
maj@16(多数投票准确率@16) |
0.5226 |
pass@1(通过率@1) |
0.4553 |
pass@16(通过率@16) |
0.5993 |
avg_response_tokens(平均响应token数) |
4,551.74 |
median_response_tokens(中位数响应token数) |
2,710.35 |
生成效率指标
| 指标 | 值 |
|---|---|
generation_phase_time_s(生成阶段耗时) |
773.75 秒 |
total_time_s(总耗时) |
876.97 秒 |
total_generated_output_tokens(总生成输出token数) |
1,456,800 |
total_policy_output_tokens(策略输出总token数) |
1,456,800 |
多样性指标
| 指标 | 值 |
|---|---|
num_unique_answers@1(唯一答案数@1) |
0.925 |
num_unique_answers@16(唯一答案数@16) |
4.937 |
num_unique_answers@32(唯一答案数@32) |
8.33 |
加权指标(Weighted Metrics)
| 指标 | 值 |
|---|---|
w_maj@1(加权多数投票准确率@1) |
0.4816 |
w_maj@16(加权多数投票准确率@16) |
0.5028 |
w_pass@1(加权通过率@1) |
0.4772 |
w_pass@16(加权通过率@16) |
0.4489 |
搜集汇总
数据集介绍

构建方式
该数据集基于GPT模型在开放源代码场景下的推理生成能力构建,融合了认知科学中的反绎生成(Retro-Generation)范式。数据通过两阶段流程生成:首先,模型针对给定问题生成多样化候选回答;随后,借助价值引导搜索(Value-Guided Search, VGS)策略,对生成结果进行多层级评分与筛选,最终保留质量最优的样本。每个样本包含原始问题、唯一生成标识、生成文本、令牌数量、奖励值、问题索引、目标答案、任务类型、价值函数预测值及难度等级等字段,体现了系统化的数据提炼过程。
特点
数据集共计3200条测试样本,每条样本均经过精细的元数据标注,涵盖生成阶段耗时、响应令牌分布、多数投票准确率(maj@1至maj@32)及通过率(pass@1至pass@32)等多种聚合指标。特别地,数据集中存储了四层搜索阶段的策略输出令牌分布,以及不同投票规模下的答案唯一性统计,为分析模型推理的多样性与鲁棒性提供了丰富维度。价值函数预测值与奖励值并存,使得该数据集不仅能用于评估生成质量,还可支撑强化学习中的奖励建模研究。
使用方法
该数据集以HuggingFace数据集格式存储,用户可通过`load_dataset`接口直接加载,并指定配置名`default`以读取测试分割。加载后,每条记录为字典结构,包含`question`、`generation`、`target`等关键字段,便于直接用于语言模型的生成效果评估或训练。此外,数据集附带聚合评价指标(如maj@k和pass@k),可作为基准测试的参考标准。用户还可利用`vf_prediction`和`reward`字段,开展基于价值函数的解码策略实验或奖励模型的训练与验证。
背景与挑战
背景概述
rebase_vgs_gpt-oss-20b_rg_cognition_ns32_md4_bt0_1_seed42_rg_cognition_vgs_2gpu 数据集由作者在推理时通过自洽性搜索构建,旨在评估和提升大规模语言模型在复杂认知推理任务中的表现。该数据集创建于近期,依托于 Open Source 社区和 GPT 系列模型的研究背景,核心研究问题在于如何通过多步推理和多答案聚合策略来改善模型在数学、逻辑等认知任务上的准确性与鲁棒性。数据集包含 3200 个测试样本,每个样本涵盖问题、生成答案、奖励值及任务类型等字段,并提供了丰富的聚合指标如 pass@k、maj@k 等,为评估语言模型的推理能力提供了标准化的基准。该数据集对推动大模型在推理增强领域的研究具有重要意义,为后续研究者探索自我一致性、奖励模型及搜索策略提供了宝贵的数据支持。
当前挑战
数据集所解决的领域问题主要围绕大语言模型在复杂认知推理中面临的挑战,包括模型在单次生成时的答案准确性不足、对多步推理任务的依赖性强、以及不同生成策略间的一致性较差。为此,数据集通过多轮搜索与自洽性投票机制,探索了如何通过多次采样与加权聚合提升最终答案的可靠性。在构建过程中,数据集面临的主要挑战在于如何高效地从大规模模型生成多样化的候选答案,同时保证生成质量与计算资源的平衡;此外,奖励模型的设计与多层级打分机制的优化也增加了构建的复杂性。数据集通过在 2 个 GPU 上执行多轮生成与评分,成功模拟了多步推理与答案聚合的过程,为应对上述挑战提供了实践范例。
常用场景
经典使用场景
该数据集专为强化学习与生成式搜索(VGS, Verification-Guided Search)在数学推理领域中的协同训练而设计。其核心应用在于结合大规模语言模型(如GPT系列)的生成能力与基于价值函数(value function)的搜索引导机制,对模型输出进行多轮采样与评估。数据集中包含了每个生成结果的token数量、奖励(reward)信号、价值函数预测值(vf_prediction)以及搜索层级(level)等结构化信息,使其成为探索推理能力涌现、多步验证与迭代优化算法的理想测试平台。研究者可基于该数据集对模型进行少样本或零样本下的多步推理能力评估,尤其适用于需要链式思维(Chain-of-Thought)与自洽性投票(Self-Consistency)相结合的场景。
实际应用
在实际应用中,该数据集可服务于需要高可靠性数学推理的自动化系统,例如教育辅导平台中的解题验证、金融领域的合规性分析、以及科学文献中数学公式推导的自动校验。其多层级搜索结构允许系统在资源受限环境下(如边缘设备)按需调整推理深度,从而在准确率与计算开销之间取得平衡。此外,该数据集还可用于构建面向代码生成、逻辑规划或定理证明等任务的强化学习训练管线,通过价值函数引导搜索路径,提升复杂问题求解的鲁棒性与效率。
衍生相关工作
该数据集衍生了一系列关于验证引导搜索(VGS)与强化学习相结合的前沿工作,例如基于价值函数蒸馏的多步推理模型、以及将自一致性投票(Self-Consistency)与奖励模型深度融合的迭代优化算法。其评估指标(如maj@k、pass@k、w_best等)已成为衡量推理可靠性的重要基准,被后续工作广泛引用以对比不同搜索策略与奖励范式的优劣。此外,该数据集中记录的搜索层级信息与token开销数据,直接促成了对推理链深度与计算成本关系的实证分析,催生了自适应深度搜索算法和层级化奖励塑形方法等创新方向。
以上内容由遇见数据集搜集并总结生成



