遇见数据集

DCAgent3/swebench_verified_a3_rl_DCAgent_exp_rpt_e2egit_v2_10_8B_20260528_003609

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: conversations list: - name: role dtype: string - name: content dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string - name: trace_source dtype: string splits: - name: train num_bytes: 338369103 num_examples: 2895 download_size: 238031096 dataset_size: 338369103 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/swebench_verified_a3_rl_DCAgent_exp_rpt_e2egit_v2_10_8B_20260528_003609 数据集图片
构建方式
该数据集源自对软件工程基准测试集SWE-bench Verified的深度扩展,通过集成强化学习框架与智能体交互轨迹,构建了面向代码修复任务的多轮对话样本。具体而言,研究团队利用DCAgent实验引擎,在10次独立运行中采集了8B参数模型在特定任务上的完整执行记录,包括环境反馈、工具调用与决策路径。每条数据均经过结构化提取,形成包含角色轮替的对话序列,并附加了任务标识、运行元数据及验证器输出等标签,最终汇聚为2895条高质量训练实例。
特点
本数据集的核心特色在于其多维度标注的完整性——不仅保留了从问题描述到补丁生成的全流程对话历史,还记录了模型来源、运行时间戳与实验批次等溯源信息。特别是verifier_output字段提供了客观的成功性判定,使研究者能够区分有效探索与无效尝试。此外,数据容量达338MB,平均每条样本包含丰富的交互轮次,为训练具备环境感知与工具调用能力的智能体提供了稀缺的细粒度监督信号。
使用方法
该数据集可直接用于训练或微调代码生成领域的对话式智能体。用户可通过HuggingFace Datasets库加载train分片,将conversations字段中的角色-内容对作为序列建模的输入输出。结合agent与result字段可构建分类任务,用于评估模型在不同任务场景下的成功率。建议研究者利用trace_source与verifier_output筛选高置信度样本,或依据episode与run_id实现跨实验的交叉验证,以提升训练数据与真实软件工程场景的契合度。
背景与挑战
背景概述
在软件工程领域,自动化代码修复与验证一直是提升开发效率与软件质量的核心挑战。swebench_verified_a3_rl_DCAgent_exp_rpt_e2egit_v2_10_8B_20260528_003609 数据集由研究团队于2026年构建,旨在通过强化学习驱动的对话式智能体(DCAgent)探索端到端Git操作场景下的代码修复任务。该数据集包含2895条训练样本,每条样本涵盖多轮人机对话、智能体类型、模型来源、执行结果及验证器输出等多维信息,为评估和训练面向真实软件仓库(SWE-bench)的自动化编程智能体提供了标准化基准。其影响力在于将强化学习与代码生成验证相结合,推动了可复现、可验证的自动化软件修复研究。
当前挑战
数据集所解决的领域问题在于,现有代码修复数据集多基于静态补丁或简化任务,缺乏对完整Git工作流(如分支切换、冲突解决、回归测试)的覆盖,导致智能体在真实仓库环境下的泛化能力不足。构建过程中面临的挑战包括:1)需要设计复杂的仿真环境以模拟人类开发者与Git仓库的交互过程;2)收集并标注来自不同模型(如8B参数级别)和智能体策略的高质量对话轨迹,确保数据多样性与任务难度平衡;3)开发可靠的验证器来自动评估修复结果的功能正确性,避免过拟合于表面模式。这些挑战共同塑造了数据集在推动实用化、鲁棒性软件智能体研究中的关键地位。
常用场景
经典使用场景
SWE-bench Verified A3 RL DCAgent 数据集的设计初衷在于为软件工程领域中的自动化代码修复与智能体强化学习研究提供一个高质量、可复现的基准。该数据集收录了来自真实软件项目的任务轨迹,每个样本包含多轮对话交互、智能体行为记录、模型输出及验证器反馈。经典使用场景聚焦于训练和评估基于大语言模型的代码智能体,使其能够在复杂的版本控制环境中自主定位缺陷、生成补丁并通过验证流程。研究者利用该数据集模拟端到端的开发流程,系统性地测试智能体在理解任务描述、探索代码仓库、修改文件及执行测试等环节的综合能力,从而推动可执行代码生成与自动化调试技术的发展。
衍生相关工作
该数据集衍生出多项具有影响力的研究工作,包括将大规模语言模型与强化学习算法深度融合的智能体框架(如DCAgent系列),以及针对代码修复任务设计的验证器增强方法。后续工作围绕数据集中提供的验证器输出,探索了基于奖励信号层次的课程学习策略,使智能体能够逐步掌握从简单语法修复到复杂逻辑重构的技能。同时,受该数据集启发,研究者开发了面向多任务、多仓库环境的仿真平台,进一步扩展了智能体在跨项目迁移中的评估维度。这些衍生工作不仅丰富了代码智能体的理论体系,也推动了可验证、可解释的自动化软件维护技术走向成熟。
数据集最近研究
最新研究方向
该数据集聚焦于强化学习与代码智能体的交叉前沿,通过结构化记录多轮对话轨迹与任务执行结果,为研究基于RL的软件工程自动化提供了稀缺的细粒度训练与评测资源。其突出价值在于将‘环境交互—智能体决策—验证反馈’闭环显式地嵌入数据格式,能够支撑从指令微调到偏好对齐的全链路优化方法探索。当前热点包括利用此类轨迹数据训练可泛化的代码修复与生成智能体、结合验证器输出设计过程奖励模型,以及通过多轮回放驱动策略提升复杂Bug修复的成功率,为构建真正具备自适应能力的AI程序员奠定了关键数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务