遇见数据集

swebench_verified_random_100_folders_a3_rl_DCAgent_selfinstruct_naive_sandboxes_2_c2a08420

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条记录由对话历史(conversations,包含角色和内容)、代理(agent)、模型(model)、模型提供者(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)等字段组成。数据集共有7991个训练样本,总大小约1.4GB。适用于对话系统评估、模型行为分析、代理交互研究等场景。

This dataset contains multi-turn conversation records. Each record consists of fields such as conversation history (conversations, including role and content), agent, model, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. The dataset has 7,991 training samples, with a total size of approximately 1.4GB. It is suitable for scenarios such as dialogue system evaluation, model behavior analysis, and agent interaction research.

提供机构:
LAION eV
创建时间:
2026-08-30
原始信息汇总

数据集概述

基本信息

  • 数据集名称laion/swebench_verified_random_100_folders_a3_rl_DCAgent_selfinstruct_naive_sandboxes_2_c2a08420
  • 数据集地址:https://huggingface.co/datasets/laion/swebench_verified_random_100_folders_a3_rl_DCAgent_selfinstruct_naive_sandboxes_2_c2a08420
  • 数据集大小:下载大小约 725 MB,完整数据集大小约 1.4 GB
  • 数据拆分:仅包含 train 拆分,共 7,991 条样本

数据特征

数据集每条样本包含以下字段:

字段名 类型 说明
conversations 列表(包含 rolecontent 两个子字段,均为字符串) 对话记录,包含角色(如用户/助手)和内容
agent 字符串 智能体标识
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 日期信息
task 字符串 任务描述
episode 字符串 回合/情节编号
run_id 字符串 运行标识
trial_name 字符串 试验名称
result 字符串 任务结果
verifier_output 字符串 验证器输出
trace_source 字符串 轨迹来源

数据来源与应用

  • 该数据集基于 SWE-bench Verified 数据集构建,随机选取了 100 个文件夹。
  • 数据由 DCAgent 智能体在 self-instruct 模式下生成,使用 naive sandboxes 环境(沙盒编号为 2)。
  • 数据集中包含运行标识 c2a08420,可作为该次数据生成的唯一批次标识。

适用场景

该数据集可用于以下方向的研究与应用:

  • 代码智能体(Agent)的行为轨迹分析与评估
  • 软件工程任务(SWE)的自动求解与验证
  • 强化学习(RL)环境下的智能体训练
  • 多轮对话系统的训练与评测
搜集汇总
数据集介绍
swebench_verified_random_100_folders_a3_rl_DCAgent_selfinstruct_naive_sandboxes_2_c2a08420 数据集图片
构建方式
该数据集源于SWE-bench Verified基准,通过随机抽样100个真实软件工程问题,并结合DCAgent智能体框架进行交互式任务求解,利用自我指令(self-instruct)策略生成多轮会话数据。数据采集在沙盒环境中进行,确保操作安全与可复现性,最终获得7991条包含完整对话轨迹、代理行为记录及验证结果的样本。
使用方法
适用于训练和评估基于大语言模型的代码智能体,研究者可将对话序列作为监督信号进行微调,或利用episode和run_id字段进行轨迹级分析。数据集规模约1.4GB,支持批量加载,建议在配备高性能计算资源的环境中处理,以复现或扩展智能体在软件工程任务中的性能表现。
背景与挑战
背景概述
该数据集由DCAgent研究团队于近期创建,源自SWE-bench Verified基准,精选100个真实软件工程问题,通过自指令(self-instruct)方法生成对话轨迹,并部署于朴素沙盒环境中进行强化学习(RL)训练。核心研究问题在于探究强化学习在复杂编码任务中的泛化能力,以及多轮交互数据对智能体决策的优化作用。其影响力体现在为软件工程领域提供了大规模、细粒度的强化学习训练语料,填补了高质量智能体行为数据稀缺的空白。该数据集包含7991个训练样本,涵盖多种模型与运行轨迹,为构建可泛化的自动化编码系统奠定了数据基础。
当前挑战
领域挑战方面,SWE-bench Verified任务本身要求智能体在真实代码仓库中完成从问题定位、修改到验证的完整流程,涉及长期推理与多步决策,远超传统代码生成任务的复杂度。构建过程中,作者需从原始SWE-bench任务中筛选高置信度样本,确保可验证性;同时,通过自指令方法生成多样化的交互轨迹,耗费大量计算资源;此外,在不同沙盒环境中运行智能体以收集数据,需处理环境差异及结果验证的一致性问题。这些挑战共同决定了数据集的稀缺性与构建成本,也凸显了其在推动智能化软件工程研究中的关键地位。
常用场景
经典使用场景
该数据集源自SWE-bench验证集的随机采样子集,并融合了强化学习训练轨迹,旨在捕获智能体在真实软件工程任务中的交互会话。其经典使用场景聚焦于代码智能体(如DCAgent)的策略学习与评估,研究者可利用其中的多轮人机对话记录,复现智能体在给定问题陈述和代码仓库环境下的决策过程,从而验证和改进基于大型语言模型的自主程序修复系统在复杂代码库上的泛化能力。
解决学术问题
该数据集系统性地缓解了软件工程自动化研究中缺乏真实、细粒度交互轨迹的困境,为探究智能体如何通过自然语言指令理解、代码检索与修改来解决问题提供了实证基础。其蕴含的会话级标注(如角色、结果、验证器输出)使学者能够量化分析不同学习策略(如自我指令构建)对任务成功率的影响,进而推动从静态基准评测向动态过程监督的范式转变,深化了对自主代码生成与调试机制的理解。
实际应用
在产业实践中,该数据集可助力构建面向软件开发流程的智能辅助工具,例如用于自动生成补丁、缺陷定位或代码审查建议的对话式代理。通过利用其中的多样化操作轨迹,团队可以训练模型适应私有代码库的语义特性,提升持续集成环境中的缺陷修复效率。此外,其丰富的沙盒运行记录为云端代码执行平台的安全监控与故障诊断提供了高保真模拟场景,从而支撑了从原型验证到生产部署的完整链路。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程基准测试(SWE-bench)的强化学习与智能体交互轨迹,最新研究动向在于利用自指导(self-instruct)与沙箱环境生成大规模对话数据,以训练和评估代码生成与修复智能体。当前前沿方向包括:通过多轮交互轨迹优化策略模型,结合验证器输出形成闭环反馈,提升智能体在真实仓库级任务上的成功率和鲁棒性;同时,研究数据多样性和任务复杂度对模型泛化能力的影响,推动从静态基准向动态、自适应的评估体系演进。该数据集为构建可泛化的编码智能体提供了高价值训练语料,对自动化软件维护、缺陷修复及智能编程助手的发展具有里程碑意义,其大规模、细粒度的轨迹记录也为可解释性和安全性研究开辟了新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务