遇见数据集

DCAgent3/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_curriculum_easy_21_880803ee7

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: conversations list: - name: role dtype: string - name: content dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string - name: trace_source dtype: string splits: - name: train num_bytes: 77210314 num_examples: 644 download_size: 51698523 dataset_size: 77210314 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_curriculum_easy_21_880803ee7 数据集图片
构建方式
该数据集立足于软件工程自动化与智能体评测的交叉领域,依托SWE-bench Verified基准任务,经由随机采样与结构化折叠策略筛选出100个任务实例,并引入强化学习驱动的DCAgent与课程学习机制,按照由易到难的渐进顺序采集交互轨迹。构建过程以真实代码仓库中的问题修复为起点,完整记录智能体与模型在多轮会话中的推理、工具调用及反馈信息,同时对每条轨迹进行验证器输出标注与结果判定,确保数据在多阶段训练中兼具难度梯度与可复现性。
特点
数据集在结构与语义层面均体现出鲜明的工程化特征。对话内容以角色-内容二值形式组织,保留智能体与模型之间的完整交互脉络,并辅以任务标识、运行编号、试验名称、模型提供方及日期等元信息字段,形成可追溯的会话档案。验证器输出与结果标签共同构成监督信号,使数据不仅适用于行为克隆,也可支撑强化学习中的奖励建模与策略评估。随机选取的折叠式任务集合有助于降低过拟合风险,而课程学习的难度排序则为渐进式能力培养提供了天然支撑。
使用方法
使用该数据集时,研究者可将conversations字段作为智能体轨迹的主要输入,解析角色与内容序列以还原多轮交互过程,并借助task、episode与run_id等字段进行任务级或回合级的数据划分。result与verifier_output字段可直接用于监督微调中的标签构造,或作为强化学习环境中奖励函数的设计依据。结合agent、model与model_provider信息,可开展跨模型与跨智能体的对比实验。课程学习场景下,可依据任务难度或episode顺序安排训练样本的呈现次序,从而观察策略性能随课程推进的演化规律。
背景与挑战
背景概述
SWE-bench是软件工程领域评估大语言模型解决真实GitHub问题能力的基准测试,由普林斯顿大学等机构的研究人员于2023年提出。该数据集基于SWE-bench Verified版本,通过随机选取100个文件夹构建,旨在评估智能体在代码修复任务中的表现。其核心研究问题在于探索语言模型如何理解复杂代码库并生成有效补丁,对自动化软件维护和智能编程助手的发展具有重要推动作用。
当前挑战
该数据集所解决的领域问题是自动修复真实世界软件缺陷,其挑战在于代码库规模庞大、依赖关系复杂,模型需精准定位错误并生成可通过测试的补丁。构建过程中面临任务筛选与验证的挑战,需确保每个实例具有明确的问题描述和可靠的测试用例,同时避免数据泄漏。此外,智能体需在多轮交互中保持上下文一致性,并应对不同编程语言和项目结构的多样性。
常用场景
经典使用场景
在软件工程自动化领域,该数据集脱胎于SWE-bench Verified基准,聚焦于代码修复任务的智能体训练与评估。其经典使用场景在于构建并测试基于强化学习的代码生成智能体,通过提供多轮对话记录、任务描述及验证器输出,模拟真实开发环境中的缺陷修复流程。研究者常将其作为课程学习策略的实践平台,以渐进式难度任务驱动智能体掌握代码理解、补丁生成与测试验证等核心能力。
解决学术问题
该数据集有效回应了学术研究中智能体在复杂软件工程任务上泛化能力不足、训练信号稀疏等痛点。通过整合验证器反馈与多轮交互轨迹,它为强化学习算法提供了密集奖励信号,助力探究课程学习对智能体性能提升的增益机制。其意义在于推动了代码智能体从静态基准测试向动态训练范式的转变,为可复现的软件工程智能体研究奠定了数据基础。
衍生相关工作
围绕该数据集,后续研究衍生出多种智能体架构与训练策略的对比实验,如基于课程学习的渐进式微调、结合验证器反馈的强化学习优化等。相关经典工作探索了不同模型提供方与智能体框架的协同效果,并催生了针对代码生成任务的多轮对话评估方法。这些工作共同丰富了软件工程智能体的方法论体系,推动了基准测试与训练数据的迭代更新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务