遇见数据集

swebench_verified_random_100_folders_a1_taco_20260819_162248

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

该数据集包含11580个训练样本,每个样本主要由一个多轮对话(conversations)组成,对话中每条消息包含角色(role)和内容(content)。此外,每个样本还附带了丰富的元数据字段:agent(代理名称)、model(使用的模型)、model_provider(模型提供商)、date(日期)、task(任务)、episode(回合编号)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)以及trace_source(追踪来源)。数据规模约为1.5GB。该数据集适用于多轮对话系统的训练、agent行为分析、模型评估等任务。

This dataset contains 11,580 training samples, each primarily consisting of a multi-turn conversation, where each message in the conversation includes a role and content. Additionally, each sample is accompanied by rich metadata fields: agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The data size is approximately 1.5GB. The dataset is suitable for tasks such as training multi-turn dialogue systems, agent behavior analysis, and model evaluation.

提供机构:
LAION eV
创建时间:
2026-08-22
原始信息汇总

数据集详情总结:swebench_verified_random_100_folders_a1_taco_20260819_162248

基本信息

  • 数据集名称:swebench_verified_random_100_folders_a1_taco_20260819_162248
  • 所属机构:LAION
  • 数据集页面:https://huggingface.co/datasets/laion/swebench_verified_random_100_folders_a1_taco_20260819_162248
  • 数据集大小:约1.58 GB(1578847669 字节)
  • 下载大小:约1.13 GB(1125506359 字节)
  • 数据分割:仅包含训练集(train),共11,580条样本

数据特征(Features)

该数据集包含以下字段:

字段名 类型 说明
conversations 列表(包含role和content两字段) 对话记录,role为字符串类型,content为字符串类型
agent 字符串 智能体名称
model 字符串 使用的模型
model_provider 字符串 模型提供方
date 字符串 日期
task 字符串 任务描述
episode 字符串 回合/轮次标识
run_id 字符串 运行ID
trial_name 字符串 试验名称
result 字符串 结果
verifier_output 字符串 验证器输出
trace_source 字符串 追踪来源

数据格式

  • 配置文件:default
  • 数据文件路径:data/train-*
  • 数据分割类型:仅提供train分割

数据用途概述

该数据集来自LAION,涉及SWE-bench验证任务,包含随机选取的100个文件夹,其命名中的“a1_taco”和“20260819_162248”暗示了特定的实验配置和时间戳。数据集记录了智能体(agent)在软件开发任务中的完整对话轨迹、运行信息、模型信息及验证结果,适用于研究智能体在编程任务中的行为分析、模型评估和对话追踪。

搜集汇总
数据集介绍
swebench_verified_random_100_folders_a1_taco_20260819_162248 数据集图片
构建方式
该数据集立足于软件工程领域中智能体自动化修复代码缺陷的研究脉络,以SWE-bench Verified基准所涵盖的真实代码仓库缺陷任务为筛选基底,从中随机抽取100个文件夹对应的任务实例作为核心素材。构建过程将智能体在执行修复任务时产生的多轮对话轨迹予以完整记录,涵盖用户指令与模型响应交替构成的会话内容,并同步采集智能体类型、底层模型及其提供方、执行时间、任务标识、运行标识、试验名称等元数据。每个任务实例的执行结果、验证器输出以及轨迹来源信息亦被一并纳入,从而形成从任务输入到结果验证的端到端结构化记录。数据集最终以训练集单一划分形式组织,共收录11580条样本,数据规模约为1.58GB。
特点
数据集的核心特质在于其对智能体软件工程修复过程的细粒度留存,每条样本均以对话序列形态呈现,使研究者得以追溯智能体在真实缺陷修复任务中的推理路径与操作步骤。元数据字段的丰富性构成另一显著优势,agent、model、model_provider等字段支持按智能体架构与基础模型进行分层分析,task、episode、run_id、trial_name等标识则为多次试验与跨轮次对比提供了索引依据。result与verifier_output字段的并存使成功与失败案例均可被纳入考察,配合trace_source字段可辨析轨迹来源。单文件规模较大的数据组织方式适配对执行效率有要求的训练与评测流程,整体呈现出面向软件工程智能体研究的可复现性与可扩展性。
使用方法
使用该数据集时,研究者可通过HuggingFace datasets库以默认配置直接加载train划分,借助conversations字段解析智能体的多轮交互内容,并结合role字段区分用户与助手角色以重构完整轨迹。针对特定研究目的,可依据model或model_provider字段筛选来自不同基础模型或提供方的样本,或利用task与run_id字段定位同一缺陷任务下的多次运行记录,进而开展成功率、修复策略或推理模式的对比分析。result与verifier_output字段可用于构建监督信号或评估指标,trace_source字段则有助于区分数据来源以控制分析偏差。由于数据体量较大,实际使用中建议采用流式加载或分片读取方式以控制内存开销,并结合任务需求对会话内容进行截断、过滤或格式转换。
背景与挑战
背景概述
SWE-bench Verified系软件工程领域评测大语言模型解决真实GitHub代码库缺陷能力的基准数据集,由普林斯顿大学等机构研究人员于2023至2024年间构建,其核心问题在于评估模型能否自主定位并修复跨文件、跨模块的工程级缺陷。该基准从开源仓库中筛选出可复现、有明确测试验证的修复任务,推动了代码智能体在真实软件开发场景中的能力边界探索。在此基础上衍生的随机子集与智能体轨迹变体,进一步记录了多轮对话、验证反馈与多模型执行过程,为研究自主编程智能体的行为模式提供了细粒度数据支撑。
当前挑战
该数据集所对应的领域问题在于真实软件缺陷修复的开放性与长程依赖性,模型需在庞大代码库中定位缺陷、理解跨文件依赖并生成通过测试的补丁,而单次生成往往难以成功。构建过程中的挑战包括:从海量提交中筛选出可验证且非平凡的任务,确保测试环境可复现,以及统一异构智能体的轨迹格式与验证输出。衍生数据集还需处理多轮交互中的冗余信息、失败轨迹的标注一致性,以及不同模型提供商输出格式差异带来的对齐难题。
常用场景
经典使用场景
在软件工程自动化与代码智能体评估领域,该数据集依托SWE-bench Verified基准,通过随机抽样构建了100个任务文件夹,每个文件夹内蕴含多轮人机对话轨迹与验证器输出,典型使用场景聚焦于评估大语言模型驱动智能体在真实代码仓库中定位缺陷、生成补丁并迭代修复的能力,同时记录不同模型提供方、智能体框架与试验配置的全景交互过程。
解决学术问题
该数据集有效缓解了代码智能体研究中可复现基准匮乏与评估维度单一的问题,借助结构化对话轨迹与验证器反馈,为学术社区探究智能体推理链条、工具调用策略及失败模式提供了细粒度观测数据,推动了自动化程序修复与交互式代码生成领域实证研究的规范化进程。
衍生相关工作
围绕该数据集已衍生出多类经典工作,包括基于轨迹蒸馏的智能体训练方法、结合验证器信号的强化学习策略、面向代码修复的检索增强生成框架,以及针对多智能体协作模式的对比分析研究,这些工作持续拓展了软件工程自动化基准的深度与广度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务