遇见数据集

swebench_verified_random_100_folders_a3_rl_DCAgent_inferredbugs_sandboxes_verifierb984e9c9

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集是一个多轮对话记录集合,包含7373条训练样本,总大小约1.3GB。每条样本包含完整的对话历史(conversations),其中每条消息由角色(role)和内容(content)组成;同时记录了对话所涉及的智能体(agent)、模型名称(model)、模型提供商(model_provider)、对话日期(date)、任务描述(task)、回合编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。该数据集适用于对话系统训练、多轮对话建模、任务型对话评估、模型输出验证等场景。

This dataset is a collection of multi-turn dialogue records, containing 7373 training samples with a total size of approximately 1.3GB. Each sample includes a complete conversation history (conversations), where each message consists of a role and content. It also records the agent involved in the dialogue, model name, model provider, dialogue date, task description, episode number, run ID, trial name, result, verifier output, and trace source. This dataset is suitable for dialogue system training, multi-turn dialogue modeling, task-oriented dialogue evaluation, model output verification, and other scenarios.

提供机构:
LAION eV
创建时间:
2026-08-30
原始信息汇总

数据集详情总结

数据集名称

laion/swebench_verified_random_100_folders_a3_rl_DCAgent_inferredbugs_sandboxes_verifierb984e9c9

数据集简介

本数据集源自 LAION 团队,专注于软件工程基准测试(SWE-bench)中的验证任务,包含通过强化学习(RL)随机抽取的 100 个文件夹样本,涉及 DCAgent 推断缺陷的沙箱验证结果。数据集中记录了智能体与模型在解决软件工程问题时的完整对话、执行轨迹及验证器输出,适用于研究、训练和评估代码生成与缺陷修复智能体。

数据集规模

  • 总大小:约 1.31 GB(1,309,886,431 字节)
  • 下载大小:约 647.88 MB(647,878,827 字节)
  • 样本数量:7,373 条(训练集)
  • 数据划分:仅包含一个 train 划分,无单独的测试集或验证集

数据集特征(字段说明)

字段名 类型 描述
conversations 列表 包含多轮对话,每个对话有 role(角色)和 content(内容)两个字段
agent 字符串 使用的智能体名称
model 字符串 使用的模型名称
model_provider 字符串 模型提供方(如 OpenAI 等)
date 字符串 数据生成日期
task 字符串 具体的软件工程任务标识
episode 字符串 强化学习中的回合编号
run_id 字符串 运行 ID
trial_name 字符串 实验尝试名称
result 字符串 任务执行结果
verifier_output 字符串 验证器的输出信息
trace_source 字符串 追踪来源(如沙箱日志等)

数据配置

  • 配置名称default(唯一配置)
  • 数据文件:位于 data/train-* 路径下,支持流式加载。

数据用途

该数据集主要服务于以下场景:

  • 评估和比较不同智能体(如 DCAgent)在软件缺陷推断与修复任务上的性能。
  • 训练或微调代码生成模型、对话式智能体。
  • 分析强化学习策略在真实软件工程任务中的表现,以及验证器反馈的有效性。

其他说明

  • 数据集文件格式为 Hugging Face 标准数据集格式,支持 datasets 库直接加载。
  • 数据内容包含完整的对话历史和执行轨迹,适合进行细粒度的行为分析和错误诊断。
搜集汇总
数据集介绍
swebench_verified_random_100_folders_a3_rl_DCAgent_inferredbugs_sandboxes_verifierb984e9c9 数据集图片
构建方式
该数据集是基于SWE-bench Verified基准精心构建的,选取了其中100个随机样本,并针对每个样本设计了多种推断故障注入场景。通过强化学习环境与DCAgent智能体交互,生成了包含多轮对话、动作序列及验证器反馈的完整轨迹数据。数据采集过程严格遵循沙盒隔离原则,确保实验的安全性与可复现性。每条记录均附带了模型、运行标识符及验证器输出等元数据,以支持细粒度的分析。最终,数据以7373个训练样本的形式呈现,总大小约为1.3GB,覆盖了任务执行的全生命周期信息。
特点
该数据集的核心特色在于其复合型结构,融合了对话历史、智能体行为轨迹以及自动化验证结果,构成了一个多维度的智能体决策资源库。其中,conversations字段详尽记录了交互过程中的角色交替与语义内容,而verifier_output则提供了客观的解决方案评估信号。此外,数据集中包含了任务、实验、试运行等多级标识符,便于研究者进行纵向跟踪与横向比较。这种丰富的信息粒度不仅适用于行为克隆、强化学习等训练场景,也为离线评估智能体在真实编码任务中的鲁棒性提供了坚实基础。
使用方法
使用时,研究者可直接加载train划分中的JSON文件,利用其标准化的字段结构快速构建训练管线。对于监督微调,可将conversations序列作为输入输出对,并结合result及verifier_output作为质量过滤或奖励信号。在强化学习场景中,agent、episode与run_id字段可用于划分轨迹片段,支撑策略优化与信用分配。同时,该数据集也可作为沙盒环境中的测试集,通过task字段映射至原始SWE-bench问题,以评估生成补丁在真实错误上的修复能力。建议根据具体需求对数据进行预处理,如截断长对话或重采样以平衡任务分布。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a3_rl_DCAgent_inferredbugs_sandboxes_verifierb984e9c9,创建于近期,由研究团队为探索强化学习在代码智能体中的应用而构建。其核心研究问题聚焦于利用强化学习提升代码修复智能体在真实软件工程任务中的性能,通过集成DCAgent和推断缺陷沙盒验证机制,旨在增强智能体对复杂代码库的理解与修改能力。作为SWE-bench验证集的一个随机子集,该数据及百个文件夹的规模确保了评估的多样性与代表性。该数据集对代码智能体领域具有重要影响力,为衡量和推动自动化程序修复技术的进步提供了标准化基准,促进了强化学习与软件工程交叉研究的发展。
当前挑战
该数据集面临的挑战首先在于领域问题本身——代码修复智能体需在真实软件仓库中准确识别缺陷、生成补丁并验证有效性,涉及对上下文的理解、代码语义的把握及多步决策的复杂性。构建过程中,挑战包括:从SWE-bench验证集中随机抽取样本时需确保分布均衡;对推断缺陷的标注需依赖人工验证,成本高昂且易出错;沙盒环境的搭建需模拟真实运行场景,以确保验证的可靠性;最后,强化学习训练所需的奖励信号设计需与代码修复目标精确对齐,避免局部最优。这些挑战共同构成了数据集在促进通用代码智能体发展中的核心难点。
常用场景
经典使用场景
该数据集基于SWE-bench验证集构建,精心筛选了100个真实世界的软件工程问题,并注入了DCAgent等智能体在修复过程中的推断缺陷与验证器输出。其核心应用在于评测和训练代码生成模型及自动化程序修复系统,通过多轮对话轨迹和运行结果,为研究者提供了高保真的交互环境,用于模拟智能体在复杂代码库中的调试与修复流程。
解决学术问题
该数据集直面软件工程领域中自动化缺陷定位与修复的长期挑战,解决了传统基准测试中缺乏真实交互反馈和动态验证的问题。它使得研究者能够系统性地评估强化学习策略在代码修复任务中的泛化能力,深入探究智能体在探索、决策和反思环节的瓶颈,推动了从静态代码生成向动态环境交互的研究范式转变。
衍生相关工作
基于该数据集,衍生出一系列围绕交互式代码修复的优化研究,如改进奖励塑形机制、设计分层决策策略,以及开发多智能体协作框架。相关成果已出现在顶级AI与软件工程会议中,进一步激发了基于真实项目反馈的终身学习模型和跨项目迁移学习方法的探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务