遇见数据集

swebench_verified_random_100_folders_a1_stack_pytest_withtests_20260818_162725

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集包含多轮对话数据,每条记录由多个字段组成:conversations字段为对话列表,每条对话包含角色(role)和内容(content);此外还包括代理(agent)、模型(model)、模型提供商(model_provider)、日期(date)、任务(task)、片段(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集仅包含训练集,共10092个样本,总数据大小约为2.3GB。该数据集可能用于对话系统、代理评估或模型行为分析等任务。

This dataset contains multi-turn conversation data. Each record consists of multiple fields: the conversations field is a list of dialogues, each dialogue contains a role and content; additionally, it includes agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset contains only a training set with 10,092 samples, with a total data size of approximately 2.3 GB. This dataset may be used for tasks such as dialogue systems, agent evaluation, or model behavior analysis.

提供机构:
LAION eV
创建时间:
2026-08-20
原始信息汇总

数据集概述

基本信息

  • 数据集名称: laion/swebench_verified_random_100_folders_a1_stack_pytest_withtests_20260818_162725
  • 数据集地址: https://huggingface.co/datasets/laion/swebench_verified_random_100_folders_a1_stack_pytest_withtests_20260818_162725
  • 数据集大小: 2,342,048,547 字节(约2.34 GB)
  • 下载大小: 1,151,342,023 字节(约1.15 GB)

数据集划分

  • 划分名称: train(训练集)
  • 样本数量: 10,092 条
  • 数据字节数: 2,342,048,547 字节

数据特征(Features)

对话内容(conversations)

  • role(角色): 字符串类型,表示对话中的角色(如用户或助手)
  • content(内容): 字符串类型,表示对话的具体内容

其他字段

  • agent(代理): 字符串类型,表示执行任务的代理信息
  • model(模型): 字符串类型,表示使用的模型名称
  • model_provider(模型提供者): 字符串类型,表示模型的提供方
  • date(日期): 字符串类型,表示数据记录的日期
  • task(任务): 字符串类型,表示具体任务描述
  • episode(会话轮次): 字符串类型,表示会话的轮次信息
  • run_id(运行ID): 字符串类型,表示运行标识符
  • trial_name(试验名称): 字符串类型,表示试验的名称
  • result(结果): 字符串类型,表示任务执行的结果
  • verifier_output(验证器输出): 字符串类型,表示验证器的输出结果
  • trace_source(追踪来源): 字符串类型,表示追踪数据的来源

配置信息

  • 配置名称: default
  • 数据文件路径: data/train-*(通配符形式,表示包含多个数据文件)

数据集特点

该数据集基于 SWE-bench 验证集构建,从随机选取的 100 个文件夹中采样,涉及使用 pytest 进行测试并包含测试用例的数据,属于软件工程领域的数据集,用于评估模型在代码生成、测试执行等任务上的表现。

搜集汇总
数据集介绍
swebench_verified_random_100_folders_a1_stack_pytest_withtests_20260818_162725 数据集图片
构建方式
该数据集基于SWE-bench Verified基准精心构建,从其中随机选取了100个真实世界软件工程问题,并针对每个问题生成了多个智能体交互轨迹。数据集构建过程中,采用了特定的代码仓库状态(a1_stack)和pytest测试框架作为验证手段,确保了任务的可复现性和评估的严谨性。每条记录详细记录了智能体与环境的完整对话会话(conversations),并附带了智能体类型(agent)、模型(model)及提供商(model_provider)等元数据,以及任务标识(task)、运行编号(run_id)和试验名称(trial_name)等信息。最终结果(result)和验证器输出(verifier_output)被一并纳入,形成了包含10,092个样本的丰富数据集,总大小约2.34GB。
特点
该数据集的最显著特点在于其以任务为中心的全面覆盖——每个样本不仅包含完整的多轮对话历史,还整合了智能体配置、推理时间(date)、任务上下文(task)和精确的验证结果(verifier_output)。这种结构化设计使得研究者能够深入分析不同智能体在复杂软件工程任务中的决策过程和成功率。数据集来源(trace_source)字段进一步增加了可追溯性,便于进行根因分析。此外,样本数量超过一万条,规模可观,为训练或评估代码生成模型提供了充足的语料。数据集的构建紧跟SWE-bench Verified的标准,确保了任务难度和现实性,是评估和提升代码智能体能力的宝贵资源。
使用方法
研究者可直接加载此数据集用于多种应用场景,例如训练对话式代码生成模型、评估智能体策略或进行离线强化学习。数据集的HuggingFace结构支持通过datasets库轻松加载,默认配置下包含train分割。每条样本的conversations字段可用于序列建模,而result和verifier_output提供了明确的二元或数值标签,便于监督学习。结合agent和model字段,可以对比不同系统的性能差异。对于需要生成环境的场景,task字段可关联到SWE-bench的原始仓库,实现模拟环境中的评估。建议使用者在加载后对数据进行预处理,如过滤掉不完整的会话或转换格式,以适应下游任务需求。
背景与挑战
背景概述
本数据集名为swebench_verified_random_100_folders_a1_stack_pytest_withtests_20260818_162725,创建于2026年8月18日,由某研究机构为评估代码生成智能体在真实软件工程任务中的性能而构建。其核心研究问题在于,针对SWE-bench Verified基准中随机抽取的100个仓库文件夹,利用堆栈(stack)与pytest测试框架,生成带测试用例的交互轨迹,以追踪智能体从问题解析到代码修补的完整过程。该数据集收录了超过一万条对话记录,每条轨迹均标注了智能体类型(agent)、模型(model)、提供方(model_provider)、日期、任务、回合(episode)、运行标识(run_id)、试验名称(trial_name)、最终结果(result)以及验证器输出(verifier_output),为代码智能体的可复现性研究与行为分析提供了翔实的数据基础。其影响力在于推动软件工程自动化领域从静态基准向动态交互评估的范式转移,成为后续研究对比智能体策略与模型能力的重要参照。
当前挑战
该数据集构建过程中面临的挑战首先源于领域问题的复杂性:SWE-bench Verified任务要求智能体不仅理解自然语言描述的问题,还需在大型代码库中精确定位缺陷,并生成满足隐藏测试用例的补丁,这涉及代码理解、程序合成与测试驱动开发等多重能力的协同,远超传统代码生成任务的难度。其次,构建过程本身充满挑战,包括从100个仓库文件夹中随机采样以确保代表性而避免偏差,协调堆栈环境与pytest工具的兼容性,以及为每个任务生成有效的测试用例以验证补丁正确性。此外,记录全程对话轨迹需处理长序列数据的存储与标注一致性,确保不同智能体、模型及运行轮次间数据的可比性。最终,数据集规模庞大(约2.34GB),对存储与传效率提出要求,同时如何从多样化的运行结果中提炼可靠评估指标亦是一大考验。
常用场景
经典使用场景
该数据集源自SWE-bench验证集,精选了100个真实世界软件仓库中的问题实例,并经由随机采样形成。其核心使用场景在于评估和强化大型语言模型在自动软件修复任务中的端到端性能,尤其关注模型能够依据自然语言描述的问题报告,定位并生成符合测试用例的代码补丁。数据集中每一条样本都包含完整的对话轨迹、智能体行为、模型输出及验证器结果,为研究多轮交互式代码生成、工具调用及环境反馈学习提供了高保真的实验床。典型评测范式包括基于检索的补丁生成、基于强化学习的策略优化,以及基于上下文的代码编辑等,旨在推动模型从静态代码理解迈向动态问题求解的跨越。
衍生相关工作
依托此数据集,学术社区已孵化出多个方向的衍生工作。在基准层面,研究者基于其样本构建了更细粒度的失败测试分类体系,分析了补丁正确性与测试覆盖度、代码风格之间的关联。在方法层面,衍生出检索增强生成(RAG)框架,将相关历史提交与相似问题检索纳入生成流程,提升了修复准确率;亦催生了多智能体协作架构,通过规划、编辑和验证角色的相互校验来攻克复杂缺陷。评价指标方面,衍生出了融合编译成功率、测试通过率与代码差异最小化的复合度量,平衡了语言模型的生成偏好与功能正确性。这些工作共同织就了从数据到理论再到工具链的完整生态,持续反哺自动化软件工程研究。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程领域中的自动化缺陷修复与代码验证前沿,通过大规模记录智能体在真实世界编程任务中的交互轨迹,为探究代码生成模型的鲁棒性、工具调用策略及多轮决策机制提供了宝贵资源。当前研究热点集中于利用此类细粒度过程数据训练推理增强的代码大模型,以及开发基于验证器反馈的自我修正算法,旨在提升模型在复杂工程环境下的动态适应能力。其影响在于推动从静态代码生成向交互式、环境感知的智能编程助手演进,为构建可泛化的软件开发自动化系统奠定了数据基础,对评估下一代AI编程助手的实际效能具有重要基准意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务