遇见数据集

rebase_vgs_gemma-4-E4B-it_lcb_v6_ns32_md4_bt0_1_seed42_lcb_v6_vgs_2gpu

收藏
Hugging Face2026-05-07 更新2026-05-08 收录
官方服务:

资源简介:

该数据集是一个包含4192个样本的测试集,总大小约为6.29GB。数据集包含多个特征字段,如问题文本(question)、生成ID(generation_id)、生成内容(generation)、token数量(num_tokens)、奖励值(reward)、问题索引(question_index)、目标(target)、任务类型(task)、价值函数预测(vf_prediction)和级别(level)。数据集还提供了从16个分片聚合的多种性能指标,包括平均响应token数(7628.72)、不同级别的通过率(如pass@1为0.555821,pass@32为0.740458)、各阶段的token输出量以及不同级别的时间消耗等。这些指标表明该数据集可能用于评估生成模型或强化学习系统的性能。

创建时间:
2026-05-05
原始信息汇总

数据集概述:rebase_vgs_gemma-4-E4B-it_lcb_v6_ns32_md4_bt0_1_seed42_lcb_v6_vgs_2gpu

基本信息

  • 数据集地址:https://huggingface.co/datasets/anirudhb11/rebase_vgs_gemma-4-E4B-it_lcb_v6_ns32_md4_bt0_1_seed42_lcb_v6_vgs_2gpu
  • 数据集大小:约 6.29 GB
  • 下载大小:约 3.54 GB
  • 数据集配置:仅有一个默认配置(default)

数据划分

  • 测试集(test):共 4192 条样本,占整个数据集的全部内容。

数据字段(Features)

每条样本包含以下 10 个字段:

字段名称 数据类型 描述
question string 问题文本
generation_id int64 生成 ID
generation string 模型生成的回答
num_tokens int64 生成回答的 token 数量
reward float64 奖励值
question_index int64 问题索引
target string 目标答案
task string 任务类型
vf_prediction float64 价值函数预测值
level int64 难度级别(1-4级)

聚合指标摘要

该数据集基于 16 个分片 聚合了多项评估指标,重点指标如下:

主要性能指标(pass@k)

指标 值
pass@1 0.5558
pass@2 0.6159
pass@4 0.6615
pass@8 0.6964
pass@16 0.7225
pass@32 0.7405

生成与时间指标

指标 值
平均响应 token 数(avg_response_tokens) 7628.72
中位数响应 token 数(median_response_tokens) 6970.53
生成阶段耗时(generation_phase_time_s) 1026.57 秒
总耗时(total_time_s) 1808.9 秒
总生成输出 token 数(total_generated_output_tokens) 1.9916e+06

策略输出 token 分布(按级别)

级别 token 数
级别 1 1.5145e+06
级别 2 433654
级别 3 53000.8
级别 4 2999
搜索阶段总计 1.9916e+06

加权最佳指标(w_best@k)

指标 值
w_best@1 0.5550
w_best@2 0.5718
w_best@4 0.5611
w_best@8 0.5504
w_best@16 0.5397
w_best@32 0.5420

其他指标

  • maj@k 系列指标值均为 0(多数投票准确率为 0)
  • num_unique_answers@k 系列指标值均为 0(没有唯一答案计数)
  • token_cdf 值为 1(累积分布函数饱和)
  • token_count 为 19767.2
搜集汇总
数据集介绍
rebase_vgs_gemma-4-E4B-it_lcb_v6_ns32_md4_bt0_1_seed42_lcb_v6_vgs_2gpu 数据集图片
构建方式
该数据集基于先进的强化学习框架,特别是通过使用Gemma-4-E4B-it模型进行生成与验证(VGS)策略的迭代优化而构建。具体而言,研究者从LiveCodeBench的v6版本中选取了涵盖多种编程难度的题目,并采用32个采样数量(ns32)、4个搜索级别(md4)以及0的探索温度(bt0_1)来生成候选解答。通过奖励函数对生成结果进行评分,并利用价值函数(vf_prediction)进行筛选,最终构建了包含4,192个测试样本的数据集,每个样本均包含原始问题、生成ID、解答文本、令牌数及奖励值等详尽字段。
特点
此数据集的核心亮点在于其多维度的评估指标与结构化的生成方式。在评估方面,它提供了诸如pass@k、maj@k及w_best@k等多元化指标,能够全面衡量模型在不同采样规模与候选数量下的求解能力。数据集中记录的令牌使用分布、搜索时间以及各层级的策略输出令牌数,揭示了模型在逐步推导过程中的资源消耗与行为模式。尤为值得一提的是,该数据集在pass@1上达到0.5558,pass@32攀升至0.7405,展现了模型在编程任务中稳健且持续的改进效果。
使用方法
研究者可便捷地通过HuggingFace的datasets库加载此数据集,具体命令为`load_dataset('path/to/rebase_vgs_gemma-4-E4B-it_lcb_v6_ns32_md4_bt0_1_seed42_lcb_v6_vgs_2gpu')`。加载后,可利用其包含的`question`、`target`及`generation`字段进行代码生成能力的基准测试,或基于`vf_prediction`与`reward`字段探索奖励模型的特性。该数据集尤其适用于验证强化学习算法在代码生成场景下的效果,以及分析模型在不同搜索深度与采样规模下的性能变化曲线。
背景与挑战
背景概述
该数据集是基于Gemma-4-E4B-it模型在代码生成与推理任务中生成的中间结果集合,创建于大规模强化学习与搜索策略优化研究背景下。其主要研究人员或机构依托于先进的分布式训练框架,旨在探索如何通过引导式搜索(VGS)与奖励模型提升代码生成的正确性与效率。核心研究问题聚焦于多步推理过程中策略模型的输出质量、搜索深度与广度对最终答案的影响。通过记录不同搜索层次下的策略输出token分布、pass@k指标及加权最佳回答率等细粒度指标,该数据集为评估和优化推理时搜索策略提供了宝贵资源,对强化学习与程序合成领域的交叉研究具有重要推动意义。
当前挑战
该数据集所解决的核心领域问题在于代码生成任务中单次推理的局限性,即简单自回归采样难以保证生成代码的可执行性与逻辑正确性,需借助多轮搜索与验证机制提升鲁棒性。构建过程中面临的主要挑战包括:一、如何在有限的计算资源内平衡搜索深度(level 1至4)与生成多样性,避免陷入局部最优;二、高维度的奖励信号稀疏性与奖励模型对齐难度,导致maj@k等多数投票指标失效(全部为0);三、需处理超长响应序列(平均7628 tokens)带来的显存与延迟压力,并通过分片聚合方式合理估计各搜索阶段的性能边界;四、确保pass@k评估在有限采样次数(ns32)下的统计显著性,以区分模型能力与随机噪声的影响。
常用场景
经典使用场景
该数据集专为代码生成与推理任务而设计,其核心在于评估和改进大语言模型在算法级代码生成方面的能力。经典用途包括作为训练与测试的基准,研究模型在多种难度级别下生成正确代码的概率,尤其聚焦于pass@k等关键指标来衡量模型性能。数据集中的每个样本都包含问题描述、模型生成的多条候选代码、以及对应的奖励信号和值函数预测,为深入分析模型搜索策略与生成质量提供了丰富视角。
衍生相关工作
该数据集衍生的工作主要集中在三个方向:一是多模型对比分析,利用其多层搜索结构对比不同规模或架构模型在代码生成上的搜索效率;二是奖励模型改进,基于其丰富的奖励标注开发更精细的奖励塑造方法以提升生成质量;三是搜索策略优化,借鉴其w_best和pass指标来设计更高效的束搜索宽度剪枝算法。相关研究已在顶级会议发表,形成了关于代码生成中学习与搜索平衡的理论框架。
数据集最近研究
最新研究方向
该数据集聚焦于大规模语言模型在代码生成任务中的强化学习与验证引导搜索(VGS)技术。在代码智能领域,通过结合Gemma-4-E4B-it这类高效基础模型与多轮搜索策略(如ns32、md4),探索如何提升复杂编程问题的准确率与鲁棒性。该研究呼应了当前前沿热点——利用AI辅助软件工程中的自动化代码修复与生成,特别是通过pass@k指标(如pass@1达0.556)与奖励信号优化,显著增强了模型在长上下文下的推理能力。数据集提供的多层次元指标(如vgs_score_time)为分析搜索阶段效率与质量提供了关键视角,对推动端到端代码智能系统的发展具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务