遇见数据集

swebench_verified_random_100_folders_a1_stack_bash_20260818_162718

收藏
Hugging Face2026-08-20 更新2026-08-22 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条样本由以下字段组成:对话历史(conversations,包含角色role和内容content)、代理名称(agent)、模型名称(model)、模型提供方(model_provider)、日期(date)、任务描述(task)、回合编号(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及跟踪来源(trace_source)。数据集仅提供训练集,包含10,660条样本,总数据量约为1.7GB。

This dataset contains multi-turn dialogue records, each sample consisting of the following fields: conversation history (conversations, including role and content), agent name (agent), model name (model), model provider (model_provider), date (date), task description (task), episode number (episode), run ID (run_id), trial name (trial_name), result (result), verifier output (verifier_output), and trace source (trace_source). The dataset provides only the training set, containing 10,660 samples with a total data size of approximately 1.7GB.

提供机构:
LAION eV
创建时间:
2026-08-20
原始信息汇总

数据集概述

该数据集由LAION发布,为SWE-bench Verified 数据集的随机子集,专注于软件工程任务,包含100个任务文件夹,每个文件夹对应一个代码仓库中的随机文件夹,并带有特定于Stack和Bash环境的代理轨迹

基本信息

  • 数据集名称: laion/swebench_verified_random_100_folders_a1_stack_bash_20260818_162718
  • 数据集规模:
    • 总大小: 1,719,233,781 字节(约1.6 GB)
    • 下载大小: 1,069,926,003 字节(约1 GB)
    • 样本数量: 10,660 条(单分割 train
  • 发布时间: 2026年8月18日

数据特征

每条样本包含以下字段:

字段名 类型 说明
conversations 列表(含 rolecontent 两字段) 代理与环境交互的多轮对话记录
agent 字符串 代理标识
model 字符串 使用的模型名称
model_provider 字符串 模型提供商
date 字符串 运行日期
task 字符串 具体任务标识
episode 字符串 回合编号
run_id 字符串 运行ID
trial_name 字符串 试验名称
result 字符串 任务结果
verifier_output 字符串 验证器输出
trace_source 字符串 轨迹来源

数据用途

该数据集适用于评估和训练软件工程任务中的AI代理,特别是:

  • 测试代理在代码修复Bug定位等SWE-bench场景下的表现
  • 研究在Stack(代码堆栈)Bash(命令行) 环境下代理的行为轨迹
  • 分析不同模型(由 model 字段标识)和代理(agent 字段)的任务解决效果

数据格式与结构

  • 数据文件以 Parquet 格式存储(路径为 data/train-*),单分割 train
  • 核心数据存储在 conversations 字段中,以角色-内容对形式记录完整交互历史
  • 每条样本包含任务运行的全部元信息,便于过滤和对比分析
搜集汇总
数据集介绍
swebench_verified_random_100_folders_a1_stack_bash_20260818_162718 数据集图片
构建方式
该数据集基于SWE-bench Verified基准精心构建,选取了100个随机文件夹作为任务来源,并通过固定的Agent配置(A1)与工具链(Stack与Bash环境)进行实例化。数据采集过程记录了多轮人机协作或自动代理完成的对话轨迹,每条样本包含完整的conversations列表,以角色-内容对形式存储。同时,每个样本关联了代理标识、模型名称与提供商、执行日期、任务描述、运行轮次(episode)、运行ID、试验名称及最终结果。验证器输出(verifier_output)与轨迹来源(trace_source)字段确保了结果的客观性和可追溯性。全部10660条样本汇总于单个train分割,形成了结构化的多维度记录体系。
特点
该数据集的核心特色在于其高仿真度与结构化深度。对话数据忠实还原了代理在真实软件工程问题解决中的交互序列,从问题理解、方案设计到代码执行的完整认知过程均被完整捕获。每个样本携带丰富的元数据,覆盖从模型选择到运行环境的全链路信息,便于细粒度分析不同因素对最终性能的影响。验证器输出字段提供了标准化的成功/失败判定,而轨迹来源则区分了数据产生动机,增强了样本的多样性和可解释性。此外,数据规模适中,兼具统计代表性与计算可行性,适用于多轮对话建模、代理行为分析及决策过程研究。
使用方法
该数据集适用于多种机器学习与软件工程研究场景。研究者可将conversations字段作为多轮对话文本输入,用于微调语言模型以增强其在代码生成与调试任务中的表现。利用agent、model、model_provider等元数据,可构建条件式生成模型,探索不同参数配置对任务完成度的影响。result与verifier_output可服务于监督学习中的二分类任务(成功与否),或作为强化学习环境中的奖励信号来源。数据集的标准化结构使其可直接适配HuggingFace Datasets库,支持快速加载与批次处理。研究者亦可按date或run_id划分训练与验证子集,进行时间序列或重复实验的稳定性分析。
背景与挑战
背景概述
随着软件开发自动化需求的日益增长,基于真实代码仓库的智能体评估基准成为研究热点。该数据集创建于2026年,由专注于代码智能体研究的团队构建,旨在解决SWE-bench基准中真实软件工程任务验证的稀缺性问题。其核心研究问题在于,通过从SWE-bench已验证集中随机抽取100个实例,并采用特定的文件结构与Bash执行环境,探索代码修复智能体在复杂真实仓库中的表现。数据集收录了10660条交互记录,涵盖多轮对话、代理行为与验证结果,为评估模型的问题定位、补丁生成能力提供了大规模、高保真的测试平台。自发布以来,该数据集对代码智能体的可复现性研究产生了深远影响,成为衡量通用智能体在真实开发场景中效能的可靠标杆。
当前挑战
该数据集所应对的领域挑战,源于真实软件工程问题固有的高复杂度与环境多样性。SWE-bench任务要求智能体在庞大代码库中精准定位缺陷,并生成可通过测试的补丁,这对模型的长程依赖建模与工具调用能力提出了严苛要求。构建过程同样面临多重考验:随机抽样需兼顾任务难度分布的均衡性,而A1栈配置与Bash环境的集成则需确保执行结果的确定性,以规避环境差异导致的验证失效。此外,数据集需在保留完整交互轨迹的同时,去除冗余噪声,确保每一条对话记录都能真实反映智能体的决策路径,这要求精细的数据清洗与质量校验。最终,数据规模的膨胀(超过1.7GB)对存储与处理效率构成挑战,驱动了高效序列化与压缩策略的采用。
常用场景
经典使用场景
该数据集源自SWE-bench验证集合,精选100个随机样本,并配备多智能体系统(如A1 Stack)在Bash环境下生成的完整交互轨迹。其核心用途在于评估和提升代码大型语言模型在真实软件工程任务中的端到端性能,涵盖问题理解、代码编辑、测试运行与修复等环节。研究者可据此复现多轮推理的动态过程,深入剖析智能体在复杂代码库中的决策机制,是软件工程智能体研究中的基准测试场。
实际应用
实际应用场景集中于辅助开发者的智能化代码审查与自动修复工具。依托该数据集训练的模型,可部署于持续集成流水线,实时识别并修复缺陷、优化补丁生成流程,显著降低人工介入成本。此外,其交互轨迹数据能用于构建企业级的软件工程助手,支持自然语言描述到代码修改的映射,为开源社区和商业软件团队提供从问题报告到解决方案的一站式支持,加速软件迭代周期。
衍生相关工作
该数据集的发布催生了多项衍生研究,包括基于轨迹的偏好优化方法(如DPO应用于智能体行为微调)、多智能体协作框架的效能对比,以及针对工具调用协议的高效推理策略。后续工作还探索了将验证反馈转化为奖励信号以训练强化学习模型,并衍生出适配不同编程语言和构建环境的变体。这些进展共同丰富了软件工程智能体的评测体系,推动了自修复代码模型和自动化调试工具向更通用、更可靠的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务