遇见数据集

DCAgent2/dev_set_v2_rl__48GPU_shaped_32b__swe_rebench_patched_oracle__Qwen3_32B_45_2026088a6132c

收藏
Hugging Face2026-04-10 更新2026-04-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: conversations list: - name: content dtype: string - name: role dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string splits: - name: train num_bytes: 19082641 num_examples: 298 download_size: 15469754 dataset_size: 19082641 configs: - config_name: default data_files: - split: train path: data/train-* ---

数据集信息: 特征: - 名称:对话列表(conversations),其为列表类型,列表元素包含如下字段: - 内容(content):字符串类型 - 角色(role):字符串类型 - 名称:AI智能体(agent):字符串类型 - 名称:模型(model):字符串类型 - 名称:模型提供商(model_provider):字符串类型 - 名称:日期(date):字符串类型 - 名称:任务(task):字符串类型 - 名称:任务回合(episode):字符串类型 - 名称:运行ID(run_id):字符串类型 - 名称:试验名称(trial_name):字符串类型 - 名称:结果(result):字符串类型 - 名称:验证器输出(verifier_output):字符串类型 数据集划分: - 名称:训练集(train),数据字节数:19082641,样本量:298 下载大小:15469754 数据集总大小:19082641 数据集配置: - 配置名称:默认配置(default),数据文件: - 划分:训练集(train),文件路径:data/train-*

提供机构:
DCAgent2
搜集汇总
数据集介绍
DCAgent2/dev_set_v2_rl__48GPU_shaped_32b__swe_rebench_patched_oracle__Qwen3_32B_45_2026088a6132c 数据集图片
构建方式
本数据集名为dev_set_v2_rl__48GPU_shaped_32b__swe_rebench_patched_oracle__Qwen3_32B_45_2026088a6132c,其构建源于大规模强化学习训练流程,依托48块GPU的并行计算环境,针对32B参数规模的Qwen3模型(版本45)进行策略优化与奖励塑形(reward shaping)。数据采集自SWE-bench修补后的Oracle任务场景,通过强化学习中的探索与反馈机制,记录智能体与环境的交互对话,最终汇聚成298条训练样本。每条样本包含完整的对话历史(conversations)、智能体标识(agent)、模型与模型提供者信息(model、model_provider)、任务描述(task)、运行轮次(episode、run_id、trial_name)、结果状态(result)以及验证器输出(verifier_output),从而确保数据来源的可追溯性与结构化一致性。
特点
该数据集的核心特色在于其面向强化学习训练流程的精细设计。每条样本均包含多轮结构化对话,通过role与content字段清晰区分智能体与用户角色,便于模型理解上下文交互模式。此外,数据集涵盖了丰富的元信息,如智能体类型、模型版本、实验轮次与运行标识,为研究者提供多维度的数据筛选与对比分析可能。尤为突出的是,数据集中集成了验证器输出(verifier_output)字段,可直接用于奖励建模或结果校验,从而支撑从训练到评估的全链路闭环。尽管样本量仅为298条,但其源自大规模GPU集群上的真实RL调优过程,使得数据具有高度代表性与信噪比,适合作为监督微调或偏好对齐的辅助训练集。
使用方法
本数据集以HuggingFace标准格式发布,仅含单个训练集划分(train),共298条样本,总大小约19 MB。用户可通过datasets库直接加载,使用load_dataset('path_to_dataset')命令即可获取全部数据。在模型训练中,研究者可将conversations字段作为对话式输入,用于监督学习或强化学习中的策略蒸馏;verifier_output字段可用于构建奖励信号或偏好排序。数据集的agent、task、episode等字段支持灵活的过滤与分组操作,便于按实验条件进行子集训练或消融分析。加载后,每条样本为字典结构,可直接适配Transformers训练框架的标准数据处理流程,并支持批量化转换与tokenize预处理。
背景与挑战
背景概述
该数据集名为dev_set_v2_rl__48GPU_shaped_32b__swe_rebench_patched_oracle__Qwen3_32B_45_2026088a6132c,诞生于大规模强化学习与代码修复领域的前沿探索之中。由相关研究机构利用48块GPU集群、基于Qwen3_32B模型进行强化学习训练后采集而成,核心研究问题聚焦于通过强化学习策略提升大语言模型在软件工程任务(特别是代码补丁生成与验证)中的表现。每一条样本记录了多轮对话交互、模型输出、验证器反馈及最终执行结果,为探究模型在复杂编程任务中的泛化能力与鲁棒性提供了结构化数据支撑。该数据集在代码智能、自动化程序修复以及强化学习在软件工程中的落地应用方面具有重要参考价值,推动了从固定基准测试向动态、多轮交互式评估范式的转变。
当前挑战
该数据集所应对的领域挑战在于,传统代码修复数据集多依赖静态标注或单一黄金补丁,难以捕捉强化学习环境下模型探索与试错的动态过程;而本数据集通过记录完整对话轨迹与验证器输出,能够刻画模型在策略推理、分步修正中的行为演化。构建过程中面临的挑战包括:1)在大规模GPU集群上进行强化学习训练时,需平衡探索效率与采样质量,避免策略崩塌或过拟合到局部最优;2)对模型生成的补丁进行自动化验证时,验证器本身可能引入噪声或偏见,影响数据可靠性;3)为保持数据一致性,需要设计统一的对话结构、任务标识与结果标注规范,这对多轮交互数据的清洗与对齐提出了极高要求。
常用场景
经典使用场景
该数据集名为dev_set_v2_rl__48GPU_shaped_32b__swe_rebench_patched_oracle__Qwen3_32B_45_2026088a6132c,是一个面向强化学习与代码修复领域的高质量对话与任务追踪数据集。其经典使用场景聚焦于训练和评估基于大语言模型的智能体在软件工程环境中的交互式决策能力。具体而言,研究者可利用其中包含的agent、model、conversations等多维字段,构建从自然语言指令到代码补丁生成的端到端强化学习流水线。数据集记录了在48块GPU上对Qwen3_32B模型进行shaped reward优化的完整轨迹,包含episode与trial_name等时序信息,使其成为研究多轮交互中策略探索与利用平衡的宝贵资源。此外,verifier_output字段为验证器反馈提供了基准,便于开展基于奖励塑形的强化学习算法对比实验,推动代码自动化修复领域从静态评估向动态交互式学习范式演进。
实际应用
在实际工业场景中,该数据集所代表的强化学习训练范式可被直接应用于自动化软件维护与持续集成流水线。开发团队可基于其agent与model字段的记录,训练私有代码仓库的智能修复代理,实时分析持续集成中失败的测试用例并生成补丁。数据集中的run_id与task字段为多任务并行调度提供了蓝图,支持在DevOps环境中构建可扩展的自动补丁系统。此外,该数据集的交互格式可被迁移至智能代码审查工具,通过复现模型在conversations中的协商过程辅助开发者理解修复逻辑。在金融、医疗等对代码合规性要求严苛的领域,基于该数据集训练的模型能够结合verifier_output字段的约束条件,生成符合特定安全标准的修改方案,从而降低人工审查成本,提升软件交付质量。
衍生相关工作
该数据集衍生了一系列具有深远影响的经典工作。在方法论层面,研究者基于其shaped reward设计思路提出了自适应奖励塑形框架,将episode级别的长期回报分解为token级别的局部信号,显著提升了策略梯度方法的收敛效率。在模型架构方面,结合数据集的conversations结构,后续工作开发了记忆增强型Transformer,通过在历史对话中检索相似修复案例来加速新问题的解决。此外,该数据集催生了Multi-Trial RL for Code Repair (MTR-CR)这一研究方向,其中trial_name字段的层级特性被用于设计分层强化学习算法,将全局修复任务分解为子目标序列。在评估体系上,数据集的verifier_output字段启发了可验证奖励模型(Verifiable Reward Model)的构建,该模型如今被广泛用于大语言模型代码生成能力的自动化评估与对齐研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务