遇见数据集

swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_e2egit_large_15_8B_2026ddfac428

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集包含5806个训练样本,总大小约947MB。每条样本记录了一个多轮对话(conversations),对话由不同角色(role)和内容(content)构成。此外,每条样本还提供了代理(agent)、模型(model)、模型提供商(model_provider)、日期(date)、任务(task)、轮次(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)等元信息。该数据集适用于训练或评估基于多轮对话的AI代理,尤其关注不同模型在不同任务下的表现与验证结果。

This dataset contains 5,806 training samples with a total size of approximately 947 MB. Each sample records a multi-turn conversation (conversations) consisting of different roles and content. Additionally, each sample provides metadata such as agent, model, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. The dataset is suitable for training or evaluating AI agents based on multi-turn conversations, with a particular focus on the performance and verification results of different models across various tasks.

提供机构:
LAION eV
创建时间:
2026-08-30
原始信息汇总

数据集概述:swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_e2egit_large_15_8B_2026ddfac428

基本信息

该数据集来源于 Hugging Face 平台,路径为 laion/swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_e2egit_large_15_8B_2026ddfac428,是一个用于记录多轮对话及智能体(Agent)执行轨迹的实验数据集合。

数据规模

  • 数据集总大小:947,082,877 字节(约 903 MB)
  • 下载大小:497,707,537 字节(约 475 MB)
  • 数据划分:仅包含 train 划分
    • 样本数量:5,806 条
    • 该划分大小:947,082,877 字节

数据特征(Features)

数据集中每条样本包含以下字段:

  1. conversations(列表类型)

    • 每项包含两个子字段:
      • role(字符串):对话角色
      • content(字符串):对话内容
  2. agent(字符串):智能体名称或标识

  3. model(字符串):使用的模型名称

  4. model_provider(字符串):模型提供商

  5. date(字符串):日期信息

  6. task(字符串):任务描述

  7. episode(字符串):回合或情景编号

  8. run_id(字符串):运行标识符

  9. trial_name(字符串):试验名称

  10. result(字符串):执行结果

  11. verifier_output(字符串):验证器输出

  12. trace_source(字符串):轨迹来源

配置信息

  • 配置名称default
  • 数据文件路径data/train-*(对应 train 划分)

内容特点

该数据集主要记录多轮对话(conversations)以及智能体(agent)在执行任务时的完整过程,包含模型信息、运行参数、验证结果等元数据,适合用于研究强化学习(RL)环境下的智能体行为分析、对话系统评估或代码生成与验证等场景。

搜集汇总
数据集介绍
swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_e2egit_large_15_8B_2026ddfac428 数据集图片
构建方式
该数据集基于SWE-bench验证集,随机抽取100个文件夹构建任务样本,并利用强化学习(RL)与DCAgent框架,以e2e-git-large-15-8B模型驱动生成对话轨迹。数据构建过程包含多轮交互记录,每个样本包含角色交替的对话内容,并附带agent、model、model_provider、date、task、episode、run_id、trial_name等元数据,以及任务执行结果和验证器输出。数据收集自特定运行批次,确保了任务来源的多样性与可追溯性。
特点
数据集具备高维度结构化特征,核心为多轮对话序列,每轮包含角色(用户或助手)与内容,真实反映智能体在代码生成任务中的交互过程。同时,数据集覆盖5806个训练样本,总大小约947MB,规模适中。其独特之处在于融合了强化学习实验的轨迹数据,附带了完整的推理上下文与结果验证信息,便于分析模型在不同任务情境下的策略演化与错误模式,为研究智能体在复杂代码环境中的决策行为提供了宝贵资源。
使用方法
使用该数据集时,可直接加载HuggingFace数据集的默认配置,以train分割进行模型训练或评估。建议将conversations字段作为输入序列,结合result和verifier_output作为监督信号,用于微调语言模型或强化学习策略。由于数据规模较大,可考虑分批处理或使用数据加载器进行流式读取。研究者可根据task字段筛选特定类型任务,或依据episode、run_id等元数据划分实验组,以支持对比分析与消融研究。
背景与挑战
背景概述
该数据集(swebench_verified_random_100_folders_a3_rl_DCAgent_exp_rpt_e2egit_large_15_8B_2026ddfac428)由研究机构于2024年创建,旨在推动软件工程领域的大规模语言模型(LLM)智能体在真实代码仓库上的自动化问题解决能力。数据集基于SWE-bench Verified基准,随机选取100个文件夹,并利用强化学习(RL)驱动的DCAgent策略进行实验,通过大规模(15B参数模型)的端到端生成与验证流程,记录了完整的智能体交互轨迹、运行结果及验证器输出。该数据集的核心研究问题在于:如何评估和提升LLM在复杂、真实的软件工程任务中的推理、代码生成与调试能力。其发布为软件工程自动化、智能代码修复等领域提供了宝贵的训练与评估资源,对推动AI辅助软件开发的研究具有重要影响力。
当前挑战
该数据集所解决的领域挑战根植于软件工程智能体的核心难题:真实世界代码库的复杂性与多样性,要求智能体具备跨文件理解、依赖解析与错误定位能力。构建过程中,研究人员面临诸多挑战:一是数据采集的规模化与多样性,需从SWE-bench中随机抽取100个任务,确保代表性;二是强化学习训练的高计算成本与不稳定性,尤其在大参数模型(15B)下,需精细调优策略与奖励信号;三是确保数据标注的一致性,包括每个episode的完整轨迹记录与验证器输出的可靠对齐,以支持后续的模型训练与评估。这些挑战共同构成了数据集在构建过程中的核心难点,也为后续研究提供了方法论的参考。
常用场景
经典使用场景
该数据集源于SWE-bench的验证子集,精选100个跨领域真实软件仓库问题,每个问题对应多条智能体交互轨迹。其核心用途在于评测与训练基于大语言模型的自主代码修复代理,尤其侧重多轮决策过程。研究者可借此分析代理在复杂代码库中的路径规划、工具调用策略及错误恢复能力,是衡量指令跟随、上下文理解与代码生成协同效能的基准。
实际应用
在实际应用中,该数据集可服务于自动化代码审查、缺陷修复辅助及开发者新手培训。借助其中多步骤交互记录,可训练代理高效定位缺陷、生成可合并补丁,并实时提供修复建议。同时,其轨迹数据可用于模拟真实调试过程,评估企业内部编码助手的决策质量,从而提升研发效率与代码质量。
衍生相关工作
该数据集催生了多项后续探索,如基于轨迹对比的策略梯度方法、元学习框架下的跨任务泛化研究,以及将验证器输出作为奖励信号的反事实分析。同时,其衍生工作延伸至多模态代码理解、仓储级上下文压缩技术,并启发了针对长视野任务的分层强化学习模型,推动领域从静态补丁生成向动态自主推理演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务