遇见数据集

swebench_verified_random_100_folders_a1_stack_pytest_synthetic_gpt5nano_20260818_162724

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条样本包含以下字段:对话轮次(conversations,含角色和内容)、代理名称(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务(task)、剧集(episode)、运行ID(run_id)、实验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集仅提供训练集,共12493个样本,总大小约2.37GB,数据文件位于data/train-*路径下。该数据集可能用于训练或评估对话代理、模型推理或任务执行效果。

This dataset contains multi-turn conversation records. Each sample includes the following fields: conversation turns (conversations, including role and content), agent name (agent), model name (model), model provider (model_provider), date (date), task (task), episode (episode), run ID (run_id), trial name (trial_name), result (result), verifier output (verifier_output), and trace source (trace_source). The dataset only provides a training set, with a total of 12493 samples, approximately 2.37GB in size, and data files located under the data/train-* path. This dataset may be used for training or evaluating dialogue agents, model reasoning, or task execution performance.

提供机构:
LAION eV
创建时间:
2026-08-21
原始信息汇总

数据集详情总结

基本信息

  • 数据集名称:laion/swebench_verified_random_100_folders_a1_stack_pytest_synthetic_gpt5nano_20260818_162724
  • 数据集地址:https://huggingface.co/datasets/laion/swebench_verified_random_100_folders_a1_stack_pytest_synthetic_gpt5nano_20260818_162724

数据集特征

该数据集包含以下特征字段:

字段名 类型 说明
conversations 列表 对话记录,由 role(角色,字符串)和 content(内容,字符串)组成
agent 字符串 智能体标识
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 日期
task 字符串 任务描述
episode 字符串 会话轮次
run_id 字符串 运行标识符
trial_name 字符串 试验名称
result 字符串 结果
verifier_output 字符串 验证器输出
trace_source 字符串 追踪来源

数据划分

  • 数据划分:仅包含 train 划分
  • 训练集样本数:12,493 条
  • 训练集大小:2,376,764,652 字节(约 2.38 GB)
  • 下载大小:1,432,458,370 字节(约 1.43 GB)
  • 总数据集大小:2.38 GB

数据文件

  • 数据文件路径data/train-*(使用通配符匹配多个文件)
  • 配置名称default
搜集汇总
数据集介绍
swebench_verified_random_100_folders_a1_stack_pytest_synthetic_gpt5nano_20260818_162724 数据集图片
构建方式
本数据集源自SWE-bench Verified基准,通过随机抽样选取100个真实软件工程问题,并针对每个问题构建多智能体协作调试场景。数据集采用GPT-5nano模型生成合成对话,模拟开发者与AI代理在代码修复过程中的交互,同时集成pytest测试验证机制,确保生成内容的质量与可执行性。每个样本包含完整的对话历史、代理标识、模型信息、运行参数及验证结果,构建过程严谨且具有代表性,旨在为多轮代码修复任务的研究提供标准化数据支持。
特点
该数据集的核心特色在于其高度结构化的多轮交互记录与多维度元数据标注。每个样本不仅包含角色交替的对话内容,还附带了代理类型、模型来源、时间戳、任务描述、实验轮次及唯一运行ID,便于研究者进行细粒度的消融实验与轨迹分析。此外,验证器输出与结果字段的深度集成,使得数据集能够直接反映每一个交互回合的实际执行效果,为评估AI代理在真实代码修复任务中的表现提供了可靠的量化依据。
使用方法
数据集以HuggingFace格式存储,支持通过datasets库便捷加载,并提供了train-*分片文件,用户可将其用于监督微调或作为强化学习的交互环境。针对多智能体协作场景,研究者可依据agent字段拆分数据,分析不同策略的贡献;通过model与model_provider字段,可对比不同生成模型的输出差异。同时,结合verifier_output字段,可设计奖励模型或有监督微调的损失函数,以提升模型在代码补全及错误修复环节的鲁棒性。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a1_stack_pytest_synthetic_gpt5nano_20260818_162724,由科研团队于2026年8月创建,旨在评估和优化大型语言模型在真实软件工程任务中的自动修复能力。其核心研究问题在于,如何利用合成数据与多智能体协作框架,提升模型对SWE-bench Verified基准中随机选取的100个文件夹内代码缺陷的定位与修复效率。该数据集通过记录智能体交互轨迹(conversations)、模型输出及验证器结果,为软件工程自动化领域提供了高保真训练与评测资源,对推动AI辅助编程、缺陷修复及持续集成测试的发展具有显著影响力。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两个层面。在领域问题上,核心难点在于软件缺陷修复的复杂性与多样性,模型需理解多层代码库结构、识别隐式依赖并生成正确补丁,同时确保修复不引入回归错误,这对现有语言模型的推理与代码生成能力构成严峻考验。在构建过程中,挑战包括数据清洗与标准化,需从SWE-bench Verified中筛选随机样本并生成合成交互轨迹,确保对话与验证输出的一致性;此外,2.38GB的大规模数据存储与高效处理、多智能体(agent)行为记录的完整性及模型输出与真实修复结果的精确对齐,均需严密的工程设计与质量控制,以保障数据集的可信度与可复现性。
常用场景
经典使用场景
该数据集在软件工程与人工智能交叉领域扮演着关键角色,其核心价值在于为评估和训练代码生成与修复模型提供了大规模的交互式轨迹。它源自SWE-bench验证集中的随机样本,并辅以多文件夹结构,使得研究者能够深入探索多文件代码库中的缺陷定位与修复。常见的应用方式包括利用其中包含的对话历史、智能体行为以及测试验证结果,来对大型语言模型(LLM)进行微调或零样本评估,聚焦于基准测试中自动化程序修复(APR)任务的性能。数据集独特的‘pytest’验证器输出和‘stack’式会话结构,使其成为研究如何将自然语言理解、代码搜索与补丁生成能力相结合的理想平台,从而推动更稳健、更实用的自动化编程助手的发展。
衍生相关工作
基于此类交互式代码修复轨迹数据集,一系列前沿研究方向被显著催化。直接衍生的经典工作包括开发更高效的检索增强生成(RAG)策略,用于在大型代码库中智能检索相关上下文;以及设计新的强化学习奖励模型,利用其‘verifier_output’标签优化补丁搜索过程。进一步地,研究者借鉴其对话结构,提出了多智能体协作框架,其中规划、检索和编码智能体分工协同,有效提升了复杂问题的解决率。此外,该数据集也常被用作构建模拟环境,用于预训练和评估代码专用工具调用与错误规避的基础智能体,其‘trace_source’特性则促使了关于跨项目迁移学习以及对学习轨迹内数据污染影响的研究,形成了追踪与防御错误信息传播的研究分支。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程领域中的自动化缺陷修复与代码生成前沿探索,融合了SWE-bench验证基准与随机抽取的100个真实代码仓库场景,采用GPT-5Nano等先进语言模型生成合成测试样本,旨在模拟智能体在复杂编程环境下的交互轨迹。当前研究热点集中于利用大规模语言模型驱动的多轮对话式编程代理,强化其在单元测试生成、错误定位及补丁合成方面的能力,尤其关注pytest框架下的验证精度与泛化性能。该数据集通过记录完整的agent交互日志与验证结果,为评估模型在真实世界软件工程任务中的鲁棒性提供了关键资源,推动了从静态代码理解向动态、交互式问题求解范式的转变,对自动化软件维护和智能编程助手的演进具有重要实证意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务