遇见数据集

rebase_vgs_gemma-4-E4B-it_rg_cognition_ns8_md4_bt0_1_seed42_rg_cognition_vgs_2gpu

收藏
Hugging Face2026-05-07 更新2026-05-08 收录
官方服务:

资源简介:

该数据集包含800个测试样本,每个样本包含多个特征字段:问题文本(question)、生成ID(generation_id)、生成内容(generation)、token数量(num_tokens)、奖励值(reward)、问题索引(question_index)、目标文本(target)、任务类型(task)、价值函数预测(vf_prediction)和层级(level)。数据集总大小为8,958,545字节,下载大小为2,396,010字节。聚合指标显示,数据来自10个分片,包含平均响应token数(2749.41)、各层级生成token数(如level_1为181885)、不同评估指标(如pass@1为0.46875)等详细性能数据。虽然缺少明确的背景说明,但从特征字段和评估指标推断,该数据集可能用于评估文本生成模型的性能。

This dataset contains 800 test samples. Each sample includes multiple feature fields: question (question text), generation_id (generation ID), generation (generated content), num_tokens (token count), reward (reward value), question_index (question index), target (target text), task (task type), vf_prediction (value function prediction), and level. The total size of the dataset is 8,958,545 bytes, with a download size of 2,396,010 bytes. Aggregated metrics show that the data is split into 10 shards, and contains detailed performance data including the average number of response tokens (2749.41), the number of generated tokens per level (e.g., 181885 for level_1), and various evaluation metrics (e.g., a pass@1 score of 0.46875). Although no explicit background description is provided, it can be inferred from the feature fields and evaluation metrics that this dataset may be used to evaluate the performance of text generation models.

创建时间:
2026-05-05
原始信息汇总

根据您提供的数据集详情页面README文件内容,以下是对该数据集的概述:

数据集概述

基本信息

  • 数据集名称rebase_vgs_gemma-4-E4B-it_rg_cognition_ns8_md4_bt0_1_seed42_rg_cognition_vgs_2gpu
  • 来源:Hugging Face
  • 下载大小:2,396,010 字节
  • 数据集大小:8,958,545 字节

数据集结构

特征(Features)

数据集包含以下10个字段:

字段名称 数据类型 说明
question string 问题文本
generation_id int64 生成ID
generation string 生成的回答内容
num_tokens int64 生成的token数量
reward float64 奖励值
question_index int64 问题索引
target string 目标答案
task string 任务名称
vf_prediction float64 价值函数预测值
level int64 难度等级

数据划分(Splits)

  • 测试集(test):包含 800 个样本,占用 8,958,545 字节。

聚合指标(Aggregated Metrics)

该数据集基于 10 个分片(shards)进行聚合,主要指标如下:

生成质量指标

指标
maj@1 0.4968
maj@2 0.4907
maj@4 0.5096
maj@8 0.5260
pass@1 0.4688
pass@2 0.5307
pass@4 0.5679
pass@8 0.5900

生成效率指标

指标
avg_response_tokens 2,749.41
median_response_tokens 2,013.80
total_generated_output_tokens 219,958
total_policy_output_tokens 219,958

时间指标

指标
generation_phase_time_s 235.107
total_time_s 250.256

多样性指标

指标
num_unique_answers@1 0.932
num_unique_answers@2 1.319
num_unique_answers@4 1.979
num_unique_answers@8 3.242

配置(Configs)

  • 默认配置default,数据文件路径为 data/test-*(仅包含测试集分片)。
搜集汇总
数据集介绍
rebase_vgs_gemma-4-E4B-it_rg_cognition_ns8_md4_bt0_1_seed42_rg_cognition_vgs_2gpu 数据集图片
构建方式
本数据集基于Gemma-4-E4B-it模型,通过一种名为推理指导约束生成(Reasoning-Guided Constrained Generation, RG-Cognition)的方法构建。该方法在生成过程中引入了多层次的搜索与验证机制,具体采用4阶段搜索深度(ns8)、4次采样(md4)、0温度(bt0_1)以及固定随机种子42,以确保生成过程的稳定性和可复现性。数据集共包含800条测试样本,每条样本均记录有提问文本、对应的生成标识符、模型生成内容、生成token数量、奖励得分、问题索引、目标答案、任务类型、价值函数预测值以及难度等级等10项特征。这些特征共同构成了对模型生成能力和推理过程的全面刻画。
特点
该数据集的一大特色在于其丰富的聚合评估指标,涵盖了从平均响应token数(2749.41)、中位响应token数(2013.8)到多角度准确率指标(如maj@1为0.4968,pass@8为0.59)的详尽统计,同时提供了不同搜索阶段(level1至level4)的token使用分布和VGS评分时间。此外,数据集中还包含了唯一答案数量、加权投票准确率等多样化指标,这些指标共同为评估模型在复杂推理任务中的表现提供了多层次、多维度的定量分析依据。数据集的难度等级划分(level)进一步支持了对模型在不同复杂度问题上的差异化性能评估。
使用方法
使用本数据集时,研究人员可通过HuggingFace的datasets库直接加载默认配置的测试集。每条样本以字典形式呈现,包含question、generation、target等字段,便于直接用于模型生成质量的评价与对比分析。特别地,reward字段可用于强化学习中的奖励信号建模,vf_prediction字段支持值函数校准研究。聚合评估指标(如各种pass@k和maj@k)可引导研究者在不同搜索策略和采样次数下调整模型参数,实现对推理能力的精准诊断与优化。数据集的10个分片(shards)结构也支持分布式处理与结果复现。
背景与挑战
背景概述
该数据集构建于大语言模型推理能力持续演进的背景下,由相关研究团队基于Gemma-4-E4B-it模型生成,旨在探索视觉引导搜索(Visual Guided Search, VGS)与认知推理任务(Cognition)的融合。核心研究问题聚焦于如何通过多轮生成与评分机制,提升模型在复杂推理场景下的答案一致性与准确性。数据集包含800条测试样例,记录了从问题到多轮生成、令牌分布、奖励函数及投票精度等详尽的性能指标,为评估多步推理与搜索策略提供了标准化基准。其对相关领域的影响力体现在提供了一种可复现的评估框架,推动了语言模型在结构化推理任务中的实证研究。
当前挑战
当前数据集面临的核心挑战源于多步推理中答案多样性与准确性的权衡。领域问题方面,视觉引导搜索任务要求模型在有限信息下通过多轮生成逐步收敛至正确解答,然而测试结果显示,即使采用多数投票(maj@8)策略,最佳准确率仍仅为52.6%,暴露出模型在复杂逻辑链条中易陷入局部最优的局限。构建过程则面临计算资源优化难题,单次生成需平均235秒完成四层搜索,且每层产生的令牌数量差异悬殊(从18万至3千不等),如何平衡搜索深度与生成效率成为数据集工程化的关键瓶颈。
常用场景
经典使用场景
在认知科学与人工智能的交叉领域中,该数据集专为评估和提升大型语言模型的推理与决策能力而设计。其经典使用场景集中于通过多轮生成与验证(VGS)机制,对模型在复杂认知任务中的表现进行系统性评测。具体而言,研究者利用该数据集中的问题、生成结果及对应的奖励信号,来训练或微调模型,使其能够对自身的输出进行自我校验与优化,从而模拟人类在解决问题时的反思与纠错过程。这种范式尤其适用于需要深度推理与多步骤求解的场景,如数学问题解析、逻辑推理链构建及开放式问答等。
衍生相关工作
该数据集的发布催生了一系列具有深远影响的衍生研究工作。最直接的成果是基于验证器引导搜索(VGS)策略的进一步优化,研究者开始探索如何将多层级的搜索树与强化学习奖励模型相结合,以更高效地引导模型探索高质量解答空间。同时,数据集中蕴含的关于模型输出多样性(如num_unique_answers指标)与最终性能之间关系的见解,启发了对模型探索与利用平衡的量化研究。此外,pass@k与maj@k等评测指标的广泛采用,促进了学术界对语言模型推理能力评估标准的统一与升级,并直接推动了如自一致性(Self-Consistency)等增强推理鲁棒性方法的系统化发展。
数据集最近研究
最新研究方向
该数据集聚焦于大规模语言模型在推理任务中的自我博弈(Self-Play)与引导式搜索(Guided Search)机制的研究。通过记录多轮生成过程中的策略输出、奖励信号及价值函数预测,数据集为分析模型在复杂认知任务中的逐步推理能力与自我修正行为提供了关键资源。当前前沿方向在于利用此类数据探索模型的内部搜索策略,如基于价值的束搜索(Beam Search)和多数投票(Majority Voting)的增益效果,并结合强化学习中的策略优化与值函数逼近,以提升模型在开放域推理中的准确性与鲁棒性。此方向与近期多智能体推理、推理时计算扩展(Test-Time Compute Scaling)等热点紧密关联,对推动具备深度思考能力的可解释AI系统发展具有基础性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务