遇见数据集

swebench_verified_random_100_folders_a1_stackexchange_tor_20260819_162242

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集包含6925个样本,每个样本记录了AI代理或模型在特定任务中的完整交互轨迹。数据字段包括多轮对话(conversations,包含角色和内容)、代理名称(agent)、模型名称(model)、模型提供商(model_provider)、日期(date)、任务类型(task)、轮次(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及轨迹来源(trace_source)。数据集仅包含训练集,总大小约1.63GB,适用于对话系统、模型评估、推理验证或强化学习策略分析等场景。

This dataset contains 6,925 samples, each recording the complete interaction trajectory of an AI agent or model in a specific task. Data fields include multi-turn conversations (conversations, containing role and content), agent name (agent), model name (model), model provider (model_provider), date (date), task type (task), episode (episode), run ID (run_id), trial name (trial_name), result (result), verifier output (verifier_output), and trace source (trace_source). The dataset only contains a training set, with a total size of approximately 1.63 GB, suitable for scenarios such as dialogue systems, model evaluation, reasoning verification, or reinforcement learning strategy analysis.

提供机构:
LAION eV
创建时间:
2026-08-21
原始信息汇总

数据集概述

基本信息

  • 名称laion/swebench_verified_random_100_folders_a1_stackexchange_tor_20260819_162242
  • 地址:https://huggingface.co/datasets/laion/swebench_verified_random_100_folders_a1_stackexchange_tor_20260819_162242
  • 数据集大小:1,632,886,597 字节(约 1.63 GB)
  • 下载大小:724,653,344 字节(约 724.65 MB)

数据划分

  • 训练集(train):包含 6,925 个样本,大小为 1,632,886,597 字节

数据特征

数据集包含以下字段:

字段名 类型 说明
conversations 列表(含 rolecontent 两个子字段,均为字符串) 对话记录
agent 字符串 智能体标识
model 字符串 使用的模型
model_provider 字符串 模型提供方
date 字符串 日期
task 字符串 任务描述
episode 字符串 回合编号
run_id 字符串 运行标识
trial_name 字符串 试验名称
result 字符串 结果
verifier_output 字符串 验证器输出
trace_source 字符串 轨迹来源

数据集配置

  • 配置名称:default
  • 数据文件:训练集位于 data/train-*

数据集特点

该数据集属于 SWE-bench Verified 相关项目的高质量子集,包含随机的 100 个文件夹样本,附加了 StackExchange 相关的数据,并带有 Tor 网络标识,推测用于特定场景下的智能体评估与训练。

搜集汇总
数据集介绍
swebench_verified_random_100_folders_a1_stackexchange_tor_20260819_162242 数据集图片
构建方式
该数据集源自SWE-bench Verified基准,通过随机抽样100个文件夹并整合StackExchange与Tor网络数据,于2026年8月19日构建而成。其构建过程涉及多轮对话采集,每条样本包含角色与内容字段,并附带智能体类型、模型信息、提供方及时间戳等元数据。数据集共含6925个训练样本,总大小达1.63GB,确保了丰富的交互记录与场景覆盖。
使用方法
使用时,可直接加载训练分割,通过conversations字段访问多轮交互数据,结合agent、model等元数据筛选特定条件下的样本。result与verifier_output字段可用于监督学习或强化学习的奖励建模。该数据集适合用于训练和评估代码生成、问题解决等任务的智能体系统,亦可作为多轮对话与决策过程的语料库进行深入挖掘。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a1_stackexchange_tor_20260819_162242,创建于2026年8月19日,由研究机构(推测为SWE-bench团队)构建,旨在评估和提升大型语言模型在真实软件工程任务上的自动化解决能力。其核心研究问题在于如何利用含验证器的多轮交互对话数据,训练模型在复杂代码库中定位缺陷并生成修复补丁。该数据集从SWE-bench的已验证子集中随机抽取100个文件夹,并结合StackExchange的Tor相关讨论,形成包含6925个样例的多样本对话集,覆盖多个模型和智能体,为代码生成与修复领域提供了高价值的基准资源,对推动自动化编程和软件维护研究具有显著影响力。
当前挑战
该数据集所解决的领域问题包括:软件工程中代码缺陷修复的自动化,尤其是跨文件、跨模块的复杂错误定位与修复,这要求模型具备深层代码理解和推理能力。构建过程中面临的挑战在于:筛选高质量且多样化的任务实例,确保覆盖多种编程语言和框架;设计有效的验证器以准确评估修复正确性;生成多轮对话数据以模拟实际交互场景,同时平衡数据规模与标注成本。此外,整合来自不同来源(SWE-bench和StackExchange)的数据并保持格式一致性,以及确保对话流程的真实性和任务相关性,也是构建过程中的关键难点。
常用场景
经典使用场景
该数据集源于SWE-bench验证集,精选了100个真实世界软件工程问题,每个问题对应一个代码仓库文件夹,并混合了StackExchange的问答数据。其经典使用场景聚焦于评估和训练基于大语言模型的自主代理在软件工程任务上的表现,尤其是代码修复与问题解决能力。研究者可利用其标准化的会话结构、代理轨迹和验证结果,复现或对比不同模型(如GPT-4、Claude)在端到端编程挑战中的效能,从而深入探究模型在复杂代码库环境下的推理、调试与回溯能力。
解决学术问题
该数据集直面软件工程与人工智能交叉领域的核心学术难题——如何量化评估大语言模型在真实编程场景中的自主性问题解决能力。传统基准测试多局限于代码生成或漏洞检测,而本数据集通过引入完整的问题描述、补丁轨迹及验证器输出,解决了以往评估中缺乏环境交互和动态反馈的缺陷。它使研究者能够系统性地分析模型在状态搜索、依赖管理和错误定位等环节的决策过程,推动了对模型泛化能力、鲁棒性及故障恢复机制的实证研究,为构建更可靠的编程代理提供了理论依据和实验基准。
实际应用
在实际应用中,该数据集可作为开发智能编程助手和自动代码修复工具的训练与测试平台。开发团队可基于其对话记录和轨迹数据,微调模型以提升在集成开发环境(IDE)中的实时问题诊断能力,或用于构建能自主提交补丁的CI/CD机器人。此外,StackExchange语料的融合支持跨社区知识迁移,使得助手能够利用社区讨论中的解决方案,更精准地响应开发者在新兴框架或罕见错误上的求助。这种数据驱动的方法有助于减少人工维护成本,提升软件开发的整体效率与质量。
数据集最近研究
最新研究方向
该数据集聚焦于软件开发智能体在真实世界编程任务中的性能评估与行为追踪,其名称中“swebench_verified”暗示源自SWE-bench验证集,并经随机抽样与多文件夹组织,结合StackExchange问答语料与Tor网络环境,旨在探索代码生成、漏洞修复及自主代理的鲁棒性。当前前沿研究方向涵盖基于大语言模型的端到端软件开发自动化,强调多轮交互对话中的决策可解释性,以及跨领域知识迁移(如从技术论坛到代码仓库)对提升代理泛化能力的贡献。该数据集包含6925条训练样本,记录完整对话轨迹、模型来源、执行结果与验证器输出,为复现和比较不同代理架构(如ReAct、Reflexion)提供了标准化基准,其规模与结构化字段设计支持对长程任务规划、工具调用策略及失败模式分析的研究,对推动软件工程与人工智能交叉领域的实证进展具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务