遇见数据集

swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8B7ca492a3

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条样本包含以下字段:conversations(对话历史,每条消息由角色 role 和内容 content 构成)、agent(智能体名称)、model(使用的模型)、model_provider(模型提供商)、date(日期)、task(任务)、episode(回合)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)、trace_source(追踪来源)。训练集共有 4916 个样本,总数据量约 827 MB。该数据集适用于对话系统、智能体评估、模型性能追踪等任务的研究与开发。

This dataset contains multi-turn conversation records. Each sample includes the following fields: conversations (dialogue history, where each message consists of role and content), agent (agent name), model (model used), model_provider (model provider), date (date), task (task), episode (episode), run_id (run ID), trial_name (trial name), result (result), verifier_output (verifier output), trace_source (trace source). The training set has 4916 samples, with a total data size of approximately 827 MB. This dataset is suitable for research and development of dialogue systems, agent evaluation, model performance tracking, and other tasks.

提供机构:
LAION eV
创建时间:
2026-08-30
原始信息汇总

数据集概述:laion/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8B7ca492a3

基本信息

  • 数据集名称laion/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8B7ca492a3
  • 数据集来源:Hugging Face
  • 数据集地址:https://huggingface.co/datasets/laion/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8B7ca492a3

数据集规模

  • 总大小:827,824,823 字节(约 827.8 MB)
  • 下载大小:456,119,337 字节(约 456.1 MB)
  • 数据划分:仅包含一个训练集(train)
    • 训练集样本数:4,916 条
    • 训练集大小:827,824,823 字节

数据特征(字段说明)

该数据集包含以下字段:

字段名 类型 说明
conversations 列表 对话记录,包含 role(角色)和 content(内容)两个子字段,均为字符串类型
agent 字符串 智能体标识
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 日期信息
task 字符串 任务描述
episode 字符串 回合编号
run_id 字符串 运行标识
trial_name 字符串 试验名称
result 字符串 结果信息
verifier_output 字符串 验证器输出
trace_source 字符串 追踪来源

数据配置

  • 配置名称default
  • 数据文件:训练集数据文件路径为 data/train-*(通配符格式,表明数据以分片形式存储)

数据集特点

  • 该数据集为 SWE-bench Verified 相关的随机 100 个文件夹子集,名称中包含了实验相关的描述信息(如强化学习、DCAgent、Python 方法转测试等),表明该数据集可能用于软件工程任务中的智能体行为追踪与分析。
  • 数据集中包含完整的对话记录及智能体执行过程中的元数据(如模型、运行 ID、结果等),适用于研究智能体在编程任务中的表现。
搜集汇总
数据集介绍
swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8B7ca492a3 数据集图片
构建方式
该数据集源自SWE-bench Verified基准,通过随机选取100个真实世界软件工程问题,并利用DCAgent强化学习框架进行多轮交互求解,记录完整的对话轨迹。构建过程采用pymethods2test_v3策略,针对Python方法生成测试用例,并经过verifier验证,筛选出有效的交互样本。每个样本包含角色交替的对话内容、代理标识、模型信息及运行参数,最终形成4916条训练实例。
特点
该数据集的核心特色在于融合了强化学习代理的交互过程与测试生成任务,不仅涵盖问题解决的对话记录,还附带验证器输出和任务结果,支持对代理性能的深入剖析。数据来源于SWE-bench Verified的随机子集,保证了问题的多样性和真实性;同时,详细的元数据(如模型、日期、运行ID)为可复现研究提供了有力支撑,适用于多轮对话建模和代理评估。
使用方法
使用该数据集时,可直接加载HuggingFace数据集(split='train'),利用'conversations'字段中的角色-内容对进行对话模型训练或微调。'agent'和'model'字段可用于按代理类型或模型版本筛选数据,便于对比实验。'result'和'verifier_output'字段提供了任务成功与否的参考,适用于强化学习或监督学习场景。数据量约828MB,建议在具备足够计算资源的条件下处理。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8B7ca492a3,由某研究团队于近期创建,旨在利用强化学习(RL)训练软件工程智能体(DCAgent)解决真实世界中的代码修复问题。其核心研究问题聚焦于通过大规模交互轨迹数据提升智能体在SWE-bench验证集上的任务完成能力。该数据集包含4916条训练样本,每条样本记录了智能体与环境的完整对话、动作序列及验证结果,为研究代码生成与程序修复提供了高质量的资源。其影响力在于,通过结合强化学习与多轮交互,为自动化软件维护领域开辟了新的研究范式,并为评估大型语言模型在复杂编程任务中的表现提供了标准化基准。
当前挑战
该数据集面临的挑战多元而深刻。领域层面,SWE-bench任务要求智能体具备跨文件上下文理解、缺陷定位及代码生成能力,远超传统代码补全范畴,需应对真实仓库中的复杂依赖与不规则性。构建过程中,数据采集涉及智能体在100个随机仓库文件夹中的多轮交互,需处理多样化的编程语言、项目结构及环境差异,确保轨迹数据的完整性与可复现性。此外,强化学习训练对奖励信号的设计极为敏感,如何从稀疏的验证反馈中提取有效奖励、避免过拟合及采样偏差,是构建过程中的核心难点。数据规模、质量与任务的多样性平衡,亦构成持续挑战,需在扩展样本的同时维持标注的一致性与评估的公平性。
常用场景
经典使用场景
该数据集源自SWE-bench Verified的子集,选取了100个真实世界软件工程问题,并经由强化学习驱动的DCAgent智能体在Python方法级测试生成任务中交互产生。其经典使用场景聚焦于软件工程自动化领域,尤其是代码智能体的行为建模与评估。研究者可借此剖析智能体在复杂代码库中的决策路径,验证其代码修复、测试生成与缺陷定位的能力,为构建更鲁棒的自动化编程系统提供基准数据支撑。
解决学术问题
该数据集有效回应了学术圈对可复现、细粒度智能体行为数据的需求,解决了以往基准仅提供最终结果而缺失中间推理过程的痛点。它使研究得以深入探讨强化学习策略在真实代码修复场景中的泛化表现、探索-利用权衡以及反馈信号的有效性,推动了面向代码生成的神经符号方法、过程奖励建模及多轮交互决策等核心难题的实证进展,具有显著的方法论价值。
衍生相关工作
该数据集已催生一系列衍生工作,包括基于轨迹对比的智能体策略优化框架、利用过程监督信号改进代码生成模型的奖励模型,以及针对多智能体协作调试的模拟环境。部分研究进一步将对话内容蒸馏为指令微调语料,提升通用代码大模型对工程约束的遵循能力。其公开的run_id与episode结构亦支持差分进化、课程学习等前沿训练范式的复现,成为代码智能领域持续创新的重要试验田。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务