遇见数据集

DCAgent3/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_e2egit_large_15_8B_209d3faf5

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: conversations list: - name: role dtype: string - name: content dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string - name: trace_source dtype: string splits: - name: train num_bytes: 60685833 num_examples: 525 download_size: 40415526 dataset_size: 60685833 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_e2egit_large_15_8B_209d3faf5 数据集图片
构建方式
该数据集源自公开的swebench_verified基准测试,经过随机抽取100个真实软件工程任务构建而成。每一条数据均记录了一个完整的多轮对话交互过程,其中包含问题、解决方案及验证结果。通过引入强化学习与智能体协作机制(如DCAgent框架),结合大规模的8B参数模型,在e2egit环境中生成实际编码与调试轨迹。最终,对话数据被结构化整理并存储,涵盖角色、内容、模型、任务、运行标识与验证输出等关键字段,形成可用于训练与评测的高质量交互记录。
特点
数据集最为显著的特点在于其真实性、复杂性与完整性。所有100个任务均选自实际软件工程问题,覆盖错误修复与代码优化等场景。每个样本包含完整的agent与用户多轮对话,忠实还原了智能体在调试、定位与修正过程中的思考与行动链条。此外,数据附带详细的验证器输出(verifier_output)与最终结果(result),使得模型训练不仅是模仿对话,更能够从成功与失败的经验中学习。数据集规模虽仅525条,但每条记录信息密度高,适合用于探索智能体在真实任务中的行为模式与策略优化。
使用方法
该数据集可直接用于指令微调与强化学习训练,尤其适用于训练能够执行实际软件工程任务的代码智能体模型。使用者可按train-*模式加载全部525条训练样本。每条样本的conversations字段提供了结构化的角色与内容,便于构建对话式输入格式。agent与model字段可用于区分不同配置来源的数据,task与episode字段则用于识别具体任务轮次。建议在训练时结合verifier_output进行奖励信号建模,或利用result字段进行二元分类任务评估,以提升模型在真实软件修复场景中的表现能力。
背景与挑战
背景概述
近年来,随着软件工程的复杂性和敏捷开发需求的日益增长,自动化软件代理(Agent)在代码生成、调试与维护任务中展现出巨大潜力。然而,现有研究多聚焦于简单脚本或隔离环境下的性能评估,缺乏对真实世界软件仓库中端到端任务(如跨文件编辑、依赖解析与验证)的全面度量。在此背景下,swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_e2egit_large_15_8B_209d3faf5数据集应运而生。该数据集由研究团队于近期构建,旨在为强化学习驱动的代码代理提供细粒度、可复现的评估基准。其核心研究问题围绕如何通过多轮交互(conversations)和验证器输出(verifier_output)来量化代理在复杂仓库级任务中的决策过程与成功率。通过对525个训练样例的精心设计,数据集捕捉了从任务描述到最终验证的完整轨迹,为代理的泛化能力和鲁棒性研究提供了重要支撑,在自动化软件工程与AI辅助编程领域产生了初步影响。
当前挑战
该数据集直面软件工程领域的双重挑战。首先,在领域问题层面,现有代理模型在应对真实仓库中多文件修改、版本冲突及构建环境差异时表现脆弱,亟需一个能够模拟这些复杂耦合场景的评估体系。数据集通过引入随机文件夹划分、大模型(8B参数)干预及端到端Git操作(e2egit),迫使代理处理非确定性依赖和跨模块一致性约束,从而推动从简单代码生成向综合性软件维护的跨越。其次,在构建过程中,数据收集面临三大技术壁垒:一是如何从海量开源仓库中筛选出具备明确验证路径(verifier_output)的任务,以避免噪音标签;二是设计多轮对话轨迹(conversations)时,需平衡人工标注成本与模拟环境的真实性;三是确保不同运行实例(run_id)和试验(trial_name)之间结果的统计稳定性,以支撑后续强化学习训练的可靠性。这些挑战反映了现代数据集建设从静态标注向动态交互验证的范式转型。
常用场景
经典使用场景
在软件工程与人工智能交叉研究领域,swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_e2egit_large_15_8B_209d3faf5数据集为多轮对话驱动的代码智能体研究提供了标准化评测基准。该数据集收录了525条包含角色标注的对话轨迹,每条轨迹详细记录了代码智能体从任务接收、代码修改到验证反馈的完整交互过程,适用于训练和评估基于大型语言模型的代码补全、错误修复及自动化编程助手。研究者可借助其结构化的“角色-内容”对话对,深入分析智能体在真实仓库场景下的决策逻辑与演化路径。
实际应用
在工程实践中,该数据集可直接用于增强企业级代码审查与持续集成流程。例如,通过微调语言模型使其学会在收到代码测试失败反馈后自动定位错误根因并生成修正补丁,减少开发人员手动调试耗时。同时,数据集中的多样化任务示例(如跨文件修改、依赖调整)可作为RAG系统的知识库,辅助智能体在复杂仓库环境中引用项目级上下文进行精准修改。金融、医疗等领域的核心软件维护团队亦可利用该数据集训练定制的自动化运维智能体,降低生产环境缺陷修复延迟。
衍生相关工作
围绕该数据集已衍生出多类代表性工作。在模型架构层面,研究者基于对话轨迹开发了融合记忆网络的代码智能体,通过显式存储历史验证结果提升长程决策一致性。在训练范式方面,反馈驱动强化学习(如DCAgent)利用该数据集中的正负样本差异优化策略网络,使模型学会在早期步骤主动提交测试以避免无效修改。此外,结合验证器输出重建错误因果链的工作,催生了可解释性代码修复研究方向,相关论文在ICSE、NeurIPS等顶会发表,进一步推动了数据驱动的软件工程方法论演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务