遇见数据集

swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8Bc8b3394d

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集记录了AI代理与语言模型之间的多轮对话及其相关元数据,包含以下字段:对话历史(conversations,每个对话包含角色role和内容content)、代理标识(agent)、模型名称(model)、模型提供者(model_provider)、日期(date)、任务描述(task)、回合编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集共包含5055个训练样本,总大小约1GB,适用于研究代理与模型的交互行为、任务执行效果、结果验证等场景。

This dataset records multi-turn conversations between AI agents and language models along with their associated metadata. It includes the following fields: conversation history (conversations, each containing role and content), agent identifier (agent), model name (model), model provider (model_provider), date (date), task description (task), episode number (episode), run ID (run_id), trial name (trial_name), result (result), verifier output (verifier_output), and trace source (trace_source). The dataset contains a total of 5055 training samples, with a total size of approximately 1GB, suitable for studying agent-model interaction behavior, task execution effectiveness, and result verification.

提供机构:
LAION eV
创建时间:
2026-08-30
原始信息汇总

数据集概述:laion/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8Bc8b3394d

基本信息

  • 数据集名称:laion/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8Bc8b3394d
  • 数据集地址:https://huggingface.co/datasets/laion/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8Bc8b3394d
  • 数据集大小:约 10亿字节(1,001,766,687 字节)
  • 下载大小:约 4.7亿字节(469,748,185 字节)

数据划分

该数据集仅包含一个划分:

  • train(训练集):共 5,055 个样本

数据特征(列字段)

数据集包含以下字段:

字段名 类型 说明
conversations 列表(包含 role 和 content 两个子字段,均为字符串类型) 对话记录,包含角色和内容
agent 字符串 智能体名称
model 字符串 模型名称
model_provider 字符串 模型提供商
date 字符串 日期
task 字符串 任务描述
episode 字符串 回合/片段编号
run_id 字符串 运行标识符
trial_name 字符串 试验名称
result 字符串 结果
verifier_output 字符串 验证器输出
trace_source 字符串 轨迹来源

数据格式

  • 配置文件名称:default
  • 数据文件路径:data/train-*(多个分片文件)

数据集内容推测

从数据集名称和字段结构来看,该数据集似乎与SWE-bench验证任务相关,涉及智能体(agent)在强化学习(RL)环境下的交互轨迹数据,可能记录了智能体在代码生成、测试或软件工程任务中的对话历史、模型响应、验证结果等信息。

搜集汇总
数据集介绍
swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_pymethods2test_v3_10_8Bc8b3394d 数据集图片
构建方式
该数据集源自SWE-bench Verified基准,通过随机抽样选取100个真实世界软件工程问题,并结合强化学习代理(RL DCAgent)进行交互式任务求解。数据采集过程中,代理在每轮实验中生成包含角色与内容的对话记录,同时系统化记录代理类型、模型版本、运行日期、任务编号、试验轮次及结果等信息。每个样本均附有验证器输出与追踪来源,确保数据的可追溯性与实验完整性。最终以Parquet格式存储,训练集包含5055个样本,总数据量约1GB,构建过程严谨且具有高度可复现性。
特点
该数据集的核心特色在于其多维度结构化设计,不仅涵盖丰富的对话交互序列,还同步注入代理、模型、运行环境等元数据,为分析强化学习代理在真实编程任务中的行为模式提供了全景视角。其验证器输出与结果字段相互印证,支撑对代理性能的客观评估。此外,数据规模适中且来源统一,兼具领域针对性与平衡性,特别适合用于研究多轮对话策略、工具调用效能及智能体决策轨迹,展现了极强的科研应用潜力。
使用方法
使用该数据集时,研究者可直接加载训练分割数据,利用conversations字段训练或微调对话型智能体,通过agent与model字段过滤特定策略的样本以进行对照实验。结合task与episode信息可重构任务场景,而result与verifier_output则用于监督信号或奖励建模。建议先进行数据清洗与格式转换,适配Transformers或PyTorch框架,随后基于这些丰富元数据设计个性化评估指标,深入探索智能体协作与强化学习机制的优化路径。
背景与挑战
背景概述
该数据集源自SWE-bench Verified基准,由OpenAI等机构于2024年创建,旨在评估大型语言模型在真实软件工程任务中的自动化修复能力。其核心研究问题聚焦于多智能体协作框架(如DCAgent)在代码生成与测试驱动开发(TDD)中的性能表现。通过选取100个随机文件夹进行强化学习实验,数据集记录了5055条交互轨迹,涵盖智能体决策、模型输出及验证结果,为软件工程与AI交叉领域提供了高保真度的训练与评测资源,推动了自动化程序修复技术的实证研究。
当前挑战
该数据集构建面临双重挑战:领域层面,软件工程任务的高度复杂性(如跨文件依赖、环境配置)使得自动化修复难以达到人类专家水平,现有模型在漏洞定位与补丁生成上仍存在显著偏差;构建层面,从SWE-bench精选样本的随机采样需确保代表性,多轮交互数据的采集需严格控制噪声与冗余,同时大规模多智能体轨迹(逾千兆字节)的存储与标注耗时耗力,对数据质量保障和计算资源提出了严苛要求。
常用场景
经典使用场景
该数据集源自SWE-bench验证集,精选100个随机文件夹,专为训练和评估基于强化学习的代码智能体(DCAgent)而构建。在软件工程与人工智能的交叉领域,它被广泛用作基准测试平台,用于度量智能体在真实世界GitHub问题解决中的端到端性能。研究者利用其丰富的对话轨迹、执行结果和验证器输出,模拟复杂的编码挑战,从而深入探究智能体在代码仓库导航、错误定位、补丁生成等环节的决策能力。其结构化的多轮交互记录为复现智能体行为、分析策略演化提供了高保真数据支撑,成为代码智能体研究中的关键资源。
解决学术问题
该数据集直面软件工程与机器学习交叉领域的核心难题——如何客观评估和提升智能体的代码修复能力。传统静态数据集难以捕捉动态编程过程中的上下文依赖与试错机制,而本数据集通过记录完整交互轨迹与环境反馈,突破性地提供了过程性监督信号,使研究者能够分析强化学习中的奖励稀疏、探索效率等学术挑战。其构建推动了从结果导向到过程感知的评估范式转变,为比较不同强化学习算法、探究模型泛化边界供给实证基础,深刻影响了代码智能体学习理论的演进。
衍生相关工作
由该数据集衍生出的经典工作包括:基于其对话轨迹微调的大型语言模型,其代码生成准确率显著提升;针对其强化学习环境设计的奖励塑形方法,有效缓解了稀疏奖励问题;以及利用其验证器输出构建的代理奖励模型,实现了无需人工标注的智能体性能预测。此外,研究者还基于该数据集提出新的评价指标,如多轮修复效率与策略多样性,丰富了代码智能体的评估框架。这些工作不仅验证了数据集的广泛适用性,也持续推动着自动化软件工程研究向更高层次迈进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务