遇见数据集

swebench_verified_random_100_folders_a1_taskmaster2_20260819_162250

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集仅包含训练集,共15183个样本,总大小约2.33GB。每条样本包含以下字段:conversations(对话列表,每条对话包含role和content字段,分别表示角色和内容)、agent(代理名称)、model(模型名称)、model_provider(模型提供商)、date(日期)、task(任务)、episode(轮次)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)、trace_source(追踪来源)。数据以键值对形式组织,可用于记录和分析AI代理在不同任务、模型下的对话轨迹及验证结果。

This dataset contains only the training set, with 15,183 samples and a total size of approximately 2.33 GB. Each sample includes the following fields: conversations (a list of dialogues, each containing role and content fields), agent (agent name), model (model name), model_provider (model provider), date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The data is organized in key-value pairs and can be used to record and analyze the dialogue trajectories and verification results of AI agents under different tasks and models.

提供机构:
LAION eV
创建时间:
2026-08-21
原始信息汇总

数据集概述

该数据集名为 laion/swebench_verified_random_100_folders_a1_taskmaster2_20260819_162250,托管于 Hugging Face,主要面向 AI 智能体(agent)在多轮对话与任务执行场景下的行为记录与分析。

数据规模与结构

  • 总大小:数据集大小约 2.34 GB(2,336,477,308 字节),下载大小约 1.66 GB(1,656,249,611 字节)。
  • 划分:仅包含一个 train 分割,包含 15,183 个样本。
  • 存储格式:数据文件以 data/train-*. 形式存储,支持流式读取。

特征字段

每个样本包含以下字段:

字段名 类型 说明
conversations 列表(含 rolecontent,均为字符串) 多轮对话内容,记录交互角色与消息内容
agent 字符串 涉及的智能体标识
model 字符串 使用的模型名称
model_provider 字符串 模型提供商
date 字符串 日期信息
task 字符串 任务描述
episode 字符串 会话轮次或片段编号
run_id 字符串 运行标识
trial_name 字符串 试验名称
result 字符串 任务结果
verifier_output 字符串 验证器的输出内容
trace_source 字符串 追踪来源

数据用途

该数据集记录了智能体在 SWE-bench 场景下(针对随机 100 个文件夹)与任务执行相关的对话、运行配置和验证结果,适用于评估智能体在复杂软件工程任务中的表现、分析对话轨迹、以及研究模型行为与验证机制之间的关系。

搜集汇总
数据集介绍
swebench_verified_random_100_folders_a1_taskmaster2_20260819_162250 数据集图片
构建方式
该数据集名为swebench_verified_random_100_folders_a1_taskmaster2_20260819_162250,其构建源于SWE-bench Verified基准的随机抽样,选取了100个文件夹中的任务,并整合了Taskmaster2风格的交互数据。数据集中每条记录包含详细的对话历史、代理信息、模型标识、运行参数及验证结果,通过系统化的轨迹追踪,完整记录了从任务发起至结果验证的全过程。数据集由多个字段结构化组织,涵盖角色与内容、代理与模型、时间与任务标识等维度,确保了对每个交互环节的精确刻画。
特点
该数据集的核心特点在于其多维度信息融合与高结构化程度。每个样本不仅包含丰富的多轮对话,还关联了代理类型、模型来源及提供商,实现了对任务执行环境的全面描述。同时,数据标注了日期、任务标识、运行批次和试验名称,为细粒度分析与复现提供了便利。结果字段与验证器输出相结合,使数据集不仅支持行为分析,还能用于评估代理性能与模型鲁棒性。
使用方法
使用该数据集时,科研人员可直接加载JSON格式的对话数据,进行多轮交互的语义分析。通过过滤'result'字段,可筛选出成功或失败的案例,用于训练强化学习模型或进行错误分析。结合'verifier_output',可评估模型在软件工程任务上的准确率。数据集规模达到15,183条样本,适合构建微调数据集或作为评测基准。用户可借助HuggingFace的datasets库,通过指定split加载,并利用各字段进行个性化处理。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a1_taskmaster2_20260819_162250,源于SWE-bench的扩展,聚焦于软件工程问题的自动化解决。创建于2026年8月,由研究团队整合SWE-bench Verified子集,随机抽取100个文件夹,并配以TaskMaster2代理轨迹,形成包含15,183个对话样本的语料库。核心研究问题在于评估大型语言模型在多轮交互中解决真实GitHub问题的能力,涵盖代码生成、调试与测试验证。该数据集为软件工程领域提供了高保真的基准,推动了自主代理从静态代码生成向动态环境交互的范式转变,对代码智能研究具有里程碑意义。
当前挑战
该数据集面临的挑战包括:其一,领域问题层面,软件工程任务需处理复杂依赖、代码库上下文及多文件修改,远超传统代码生成,要求模型具备程序理解、定位与修复能力,同时需通过测试验证,复杂度高。其二,构建过程中,从SWE-bench中筛选并复现任务,涉及环境配置、依赖安装与测试运行,需确保数据一致性;随机取样需保持代表性,避免偏差;多轮对话记录需同步代理状态,数据量庞大(2.3GB),对存储与处理效率提出高要求;同时需保证轨迹的完整性与质量,避免噪声干扰模型评估。
常用场景
经典使用场景
该数据集名为swebench_verified_random_100_folders_a1_taskmaster2_20260819_162250,源自SWE-bench的验证子集,聚焦于真实世界软件工程问题的自动化解决。其经典使用场景在于评估和训练代码生成与修复模型,特别是针对GitHub issue的自动补丁生成。研究人员可借助此数据集,构建端到端的智能体系统,使其理解问题描述、检索相关代码、生成修改并验证正确性。数据集中包含的对话记录(conversations)、代理轨迹(agent)及结果(result)字段,为多轮交互式编程提供了细粒度的监督信号,从而推动从静态代码生成向动态、交互式问题求解的范式转变。
解决学术问题
该数据集主要解决了软件工程与人工智能交叉领域中的关键学术难题:如何客观、可复现地评估大语言模型在真实代码维护任务上的能力。传统基准多采用人工构造的编程问题,与工业实践脱节;而该数据集基于真实仓库的issue和测试用例,提供了可验证的基准(verifier_output),使研究者能够量化模型在代码修复、缺陷定位和回归测试上的表现。通过大规模样本(15183条)和统一评估协议,它缓解了先前研究中小规模、非标准评估带来的结果不可比问题,为比较不同模型架构、训练策略和推理框架提供了标准化的实验平台,进而促进鲁棒、可靠代码智能体的理论发展。
衍生相关工作
围绕该数据集,衍生了一系列推动代码智能领域发展的研究脉络。在数据集构建层面,类似SWE-bench的基准启发了多语言、多类型的扩展版本,如SWE-bench-java或针对安全漏洞的专门数据集,用于探测模型在特定领域的迁移能力。在方法论上,研究者基于此类数据提出并验证了多种智能体框架,如将检索增强生成(RAG)与工具调用相结合的系统,或采用强化学习优化决策链的途径。数据集中的轨迹数据(trace_source)还促进了关于模型推理可解释性的工作,探索如何从执行日志中提取决策依据。此外,针对verifier_output的分析催生了错误诊断与测试选择方向的研究,为自适应测试生成提供依据。这些衍生工作共同形成了以真实世界代码执行为导向的研究生态,持续推动着自动化软件工程走向成熟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务