遇见数据集

DCAgent3/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_e2egit_v2_10_8B_202645aa82be

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: conversations list: - name: role dtype: string - name: content dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string - name: trace_source dtype: string splits: - name: train num_bytes: 69208154 num_examples: 565 download_size: 44726166 dataset_size: 69208154 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
DCAgent3
搜集汇总
数据集介绍
构建方式
该数据集基于SWE-bench的验证集,从中随机抽取100个任务实例,并利用DCAgent框架在强化学习环境下进行多轮交互式探索。每个任务通过Agent与环境的对话轨迹被完整记录,涵盖问题解析、代码修改、补丁生成及验证反馈等环节。最终收集到565条高质量样本,每条样本包含完整的多轮会话、模型信息、任务元数据及验证结果,构建为一个结构化的对话式训练数据集。
特点
数据集的核心特色在于其真实软件工程场景下的多轮对话与代码修改轨迹。每条数据保留了Agent从理解问题到生成补丁的完整推理过程,并附带自动化验证器的通过/失败结果(verifier_output),这使得数据不仅可用于训练对话模型,更适用于研究代码生成中的错误修正与策略优化。此外,数据集包含了agent、model、run_id等多维元信息,便于进行细粒度的性能分析与对比实验。
使用方法
该数据集以标准对话格式存储,可直接用于微调大语言模型,特别是针对代码生成与软件工程任务的模型。使用者可通过conversations字段获取多轮交互文本,并结合verifier_output字段筛选成功或失败的修复轨迹进行特定策略的学习。数据集已按train split划分,加载时只需指定default配置即可通过data/train-*路径读取全部565条样本,适合直接接入HuggingFace数据集加载流程。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_e2egit_v2_10_8B_202645aa82be,基于SWE-bench Verified基准构建,由DeepCode AGent团队于2025年创建,聚焦于利用强化学习优化代码编辑智能体在真实软件工程任务中的表现。核心研究问题在于探索大规模语言模型(如8B参数模型)在复杂代码仓库中自主完成缺陷修复与功能实现的可行性。该数据集收录了565条对话轨迹,每条包含角色、模型来源、运行参数及验证结果,为多轮交互式代码生成与智能体行为分析提供了标准化评估资源,推动自动化软件工程领域从静态代码补全向动态任务求解演进。
当前挑战
数据集面临的核心挑战包括:其一,所解决的领域问题——软件工程自动化中的“可信执行”难题,即确保智能体生成的代码修改不仅能通过语法检查,还需在真实运行环境中符合预期行为,这要求模型具备跨文件上下文理解与副作用推理能力;其二,构建过程中的数据稀缺性与多样性平衡,该数据集仅包含565个实例,且每例涉及多轮对话与复杂环境交互,采集成本极高,如何从有限样本中泛化出鲁棒的策略仍待突破;此外,verifier_output字段的存在暗示了自动验证的噪声挑战,即测试用例覆盖不全可能引入虚假的正向反馈,干扰强化学习训练信号的有效性。
常用场景
经典使用场景
该数据集源自SWE-bench已验证的子集,经过精心筛选与增强,收录了565条高质量的对话轨迹,每条轨迹均包含多轮交互记录与最终的任务执行结果。其经典使用场景在于构建和评估基于语言模型的软件工程代理,特别是针对真实GitHub仓库中的代码修复与功能实现任务。研究者可以借助该数据集训练模型如何通过自然语言指令与代码环境交互,逐步定位问题、生成补丁并验证修复效果,从而推动AI在自动化软件维护领域的深度应用。
实际应用
在实际应用中,该数据集可直接用于训练和微调面向软件开发的AI编码助手,使其能够模仿代理的交互模式,在集成开发环境或代码协作平台中协助开发者自动修复缺陷、实现功能需求。例如,企业可基于此数据集构建智能机器人,响应GitHub Issue自动生成补丁并提交拉取请求,从而缩短开发周期。此外,数据集中包含的多样化任务类型也支持应用于教育场景,用于培养学生调试与测试代码的能力,通过模拟真实代理行为提供交互式学习反馈。
衍生相关工作
该数据集的衍生工作主要围绕强化学习与逆强化学习在软件代理训练中的应用展开。例如,研究者常基于其对话轨迹构建奖励模型,探索如何通过偏好学习方法优化代理的决策策略;另有经典工作利用数据中的多轮交互序列提取状态-动作对,训练具有长期记忆的代码修复系统。此外,该数据集还催生了若干关于代理可解释性分析的研究,通过剖析决策路径来理解模型如何权衡搜索空间与修复质量,进一步推动了基于大语言模型的自主软件开发方法论体系的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务