DCAgent3/swebench_verified_a3_rl_DCAgent_exp_rpt_e2egit_large_15_8B_20260528_064431
收藏数据链接:
官方服务:
资源简介:
该数据集包含2607个示例,主要用于记录和分析对话交互数据,涉及角色(如用户和助手)的对话内容、代理、模型信息(包括模型提供者)、日期、任务类型、剧集、运行ID、试验名称、结果、验证器输出和跟踪来源。数据以train拆分形式提供,适用于自然语言处理任务,如对话系统评估、模型性能分析或多智能体交互研究。
This dataset contains 2607 examples, primarily designed for recording and analyzing conversational interaction data. It includes dialogue content with roles (e.g., user and assistant), agent, model information (including model provider), date, task type, episode, run ID, trial name, result, verifier output, and trace source. The data is provided in a train split and is suitable for natural language processing tasks such as dialogue system evaluation, model performance analysis, or multi-agent interaction research.
提供机构:
DCAgent3搜集汇总
数据集介绍

构建方式
该数据集源自对SWE-bench已验证子集的深度加工,通过部署强化学习驱动的DCAgent智能体展开大规模实验。具体而言,基于e2egit_large_15_8B模型架构,在历时性追踪中捕获智能体与环境交互的全流程数据,涵盖任务指令、模型决策及执行结果。每一条记录均包含结构化对话历史、执行代理类型、模型来源信息以及时标验证输出,从而形成多层次、可复现的实验语料库。最终经过清洗与整合,构建出包含2607条训练样本的高质量数据集。
特点
本数据集的核心特色在于其精细的粒度和多维度标注体系。每条样本不仅记录完整的多轮人机对话序列,还附带了任务标识、运行批次ID以及智能体轨迹来源等元信息。尤为独特的是,数据集中嵌入了验证器输出的结果字段,能够直接反映模型生成的代码补丁在测试环境中的真实通过率,从而为效果评估提供客观基准。此外,统一的日期戳与试验名称设计使得不同实验条件下的数据可进行横向对比与联合分析。
使用方法
使用时,开发者可便捷地利用HuggingFace Datasets库加载默认配置下的训练分片。数据结构清晰明了,适用于监督式微调与基于对话的强化学习范式。研究者能够依据'result'和'verifier_output'字段筛选高质量样本用于模型精炼,或借助'task'与'episode'字段划分训练与验证子集。数据集的JSON Lines格式保证了与主流深度学习框架的无缝对接,而丰富的元数据则为分析不同策略或模型家族间的性能差异提供了可靠支撑。
背景与挑战
背景概述
该数据集由研究团队于2025年创建,聚焦于软件工程领域中基于强化学习的代码智能体行为优化。核心研究问题在于如何通过细粒度的轨迹数据提升代码生成与调试模型在复杂任务上的泛化能力。数据集收录了来自swebench_verified基准的2607条训练样本,每条样本包含多轮对话、模型输出、验证器结果及完整的任务执行轨迹,为代码智能体的训练提供了结构化的行为反馈。该数据集的发布填补了大规模、高质量代码智能体行为数据稀缺的空白,推动了强化学习方法在软件自动修复与代码生成任务中的实证研究。
当前挑战
当前挑战主要体现在两个层面:领域问题层面,代码智能体需应对多样化的编程任务与动态执行环境,现有模型在跨语言、跨仓库任务上的泛化能力仍显不足,且对长序列执行轨迹的推理存在信息衰减;构建层面,数据采集需同步记录模型推理、环境执行与外部验证器的多源输出,确保轨迹完整性与一致性是一项工程挑战。此外,2607条样本的规模对于训练鲁棒的强化学习策略尚显有限,数据标注的精度与覆盖度亦需进一步提升以支持更复杂的多步推理任务。
常用场景
经典使用场景
该数据集以SWE-bench验证集为基础,记录了强化学习智能体(如DCAgent)在软件工程任务中的交互轨迹与结果。其经典使用场景是作为训练和评估基于代码的智能体(code agent)的对话数据集,研究者可从中提取有效的对话策略,用于微调大语言模型(LLM)以提升其在真实软件工程场景中的任务完成能力,尤其适用于代码生成、程序修复及自动化调试等方向的研究。
衍生相关工作
该数据集衍生的相关工作包括基于SWE-bench的智能体评估框架、多轮对话推理的强化学习算法(如利用该数据训练DCAgent的迭代优化版本),以及将验证器(verifier)结果用于提升模型自我纠错能力的研究。此外,该数据还催生了针对代码智能体的行为克隆与偏好学习工作,通过分析高质量历史轨迹来改进模型在未知任务上的决策策略,进一步拓展了LLM在自动化软件工程领域的应用边界。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程领域中的智能体自动化任务求解,特别是结合强化学习与大语言模型的代码生成与验证闭环。最新研究方向集中在利用多轮对话记录、智能体执行轨迹与验证器反馈,构建端到端(E2E)的代码修复与任务完成能力评估体系。当前热点关联大模型驱动的自主软件开发(AI Software Engineering),通过收集智能体在真实软件仓库(如SWE-bench)上的操作日志与最终执行结果,探索模型在复杂工程场景下的鲁棒性与泛化性。该数据集的发布为研究多智能体协作、奖励塑造与过程监督提供了标准化训练语料,推动了从单步代码生成向交互式任务求解的范式演进,对评估和提升语言模型在现实开发环境中的实用能力具有里程碑意义。
以上内容由遇见数据集搜集并总结生成



