遇见数据集

swebench_verified_random_100_folders_a1_stackexchange_overflow_20260818_162729

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集包含多轮对话交互记录,每条样本包括对话内容(conversations,包含角色和消息文本)、代理名称(agent)、使用的模型(model)及模型提供商(model_provider)、日期(date)、任务描述(task)、轮次(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集共包含8556个训练样本,总大小约1GB,适用于对话代理评估、模型性能分析、多轮交互研究等任务。

This dataset contains multi-turn dialogue interaction records. Each sample includes conversation content (conversations, containing roles and message texts), agent name, model used and model provider, date, task description, episode, run ID, trial name, result, verifier output, and trace source. The dataset contains 8556 training samples with a total size of approximately 1GB, suitable for tasks such as dialogue agent evaluation, model performance analysis, and multi-turn interaction research.

提供机构:
LAION eV
创建时间:
2026-08-20
原始信息汇总

数据集概述:swebench_verified_random_100_folders_a1_stackexchange_overflow_20260818_162729

基本信息

  • 数据集地址:https://huggingface.co/datasets/laion/swebench_verified_random_100_folders_a1_stackexchange_overflow_20260818_162729
  • 数据集规模:训练集包含 8,556 条样本,总大小约 1,040,079,246 字节(约 992 MB),下载大小约 768,691,428 字节(约 733 MB)。

数据特征

该数据集包含以下字段:

字段名 类型 说明
conversations 列表(包含 rolecontent,均为字符串) 对话内容,角色与内容成对出现
agent 字符串 智能体标识
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 日期信息
task 字符串 任务标识
episode 字符串 回合/场景编号
run_id 字符串 运行编号
trial_name 字符串 试验名称
result 字符串 结果信息
verifier_output 字符串 验证器输出
trace_source 字符串 轨迹来源

数据划分

  • 仅包含 train 划分,共 8,556 条样本。
  • 数据文件路径为 data/train-*,采用通配符匹配多个文件。

适用场景

该数据集包含对话轨迹及多种元数据(如智能体、模型、任务、验证结果等),适用于以下研究和应用场景:

  • 智能体行为分析与评估
  • 多轮对话建模与生成
  • 强化学习或模仿学习中的轨迹数据处理
  • 模型性能验证与结果分析
搜集汇总
数据集介绍
swebench_verified_random_100_folders_a1_stackexchange_overflow_20260818_162729 数据集图片
构建方式
该数据集基于SWE-bench Verified基准中的100个随机样本构建,每个样本关联于StackExchange Overflow上的相关讨论。通过特定的文件夹结构组织,每个样本包含一个agent与环境的交互会话,记录为多轮对话。对话数据包含角色(用户或助手)和内容,同时记录了agent类型、模型名称、模型提供方、日期、任务描述、episode、运行ID、试验名称、最终结果及验证器输出等元信息。整个数据集被整合为training split,包含8556个样本。
特点
数据集的核心特色在于其对话记录与软件工程任务的深度绑定,每个会话均对应一个具体的SWE-bench任务。元数据的丰富性使得研究者能够追踪每次运行的agent行为、模型选择及性能表现。此外,数据集源自StackExchange Overflow,天然融合了社区讨论的上下文,增强了数据的真实性和多样性。文件配置支持灵活的数据加载,便于大规模训练和评估。
使用方法
使用该数据集时,可通过HuggingFace datasets库加载train split,访问conversations字段获取多轮对话,结合其他元数据字段(如task、result)进行任务分析。适用于训练对话式AI代理,或在软件工程领域微调模型。数据集的JSON格式便于转换为自定义训练格式,而提供的验证器输出可用于评估生成结果的质量。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a1_stackexchange_overflow_20260818_162729,由人工智能研究社区于2026年8月18日构建,旨在评估和提升大型语言模型在软件工程任务中的自主能力。其核心研究问题聚焦于模型在真实世界代码仓库中解决GitHub问题的效能,特别是结合StackExchange Overflow知识迁移的情境。数据集基于SWE-bench Verified基准,随机选取100个代码仓库,并融入Stack Overflow问答数据,构建了涵盖多轮交互的对话记录。该数据集由多家机构的研究人员联合创建,发布在HuggingFace平台,对推动自主代码修复、智能编程助手等领域具有重要影响力,为评估模型在复杂软件工程任务中的泛化能力提供了标准化测试平台。
当前挑战
该数据集面临的挑战多维且复杂。首先,在领域问题层面,其核心挑战在于攻克软件工程任务中固有的高复杂度与歧义性,包括跨文件代码修改、依赖环境配置以及问题复现的不确定性,这些均对模型的上下文理解、推理与代码生成能力提出严苛要求。其次,在构建过程中,数据集需从SWE-bench Verified中精心筛选100个多样化的仓库,确保覆盖不同编程语言和难度,同时融合Stack Overflow的辅助知识,需处理噪声数据与知识迁移的有效性。此外,构建多轮对话交互和评估验证过程也涉及显著的计算资源消耗与标注一致性难题,所有环节均需精密设计以保证数据质量与评估可靠性。
常用场景
经典使用场景
该数据集源于SWE-bench验证集,精选100个真实软件工程问题,并融合Stack Exchange社区问答的语境,构建了多轮人机对话轨迹。其经典使用场景聚焦于评估和训练AI代理在复杂代码库中的问题解决能力,通过分析对话中的推理与行动序列,研究者可深入探究大语言模型在自主编程、缺陷修复和代码维护等任务上的性能边界,为智能编程助手的研发提供标准化的测试基准。
衍生相关工作
该数据集衍生的相关工作包括基于对话轨迹的强化学习策略优化,用于提升代理的决策一致性;开发多模态代码理解模型,整合Stack Overflow中的非结构化文本与代码上下文;以及设计新的评估指标,如任务完成率、代码正确性和对话效率,以更全面衡量智能代理性能。这些工作进一步催生了工具增强的代理架构和自修复代码生成技术,推动了AI软件工程领域的发展。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程基准测试(SWE-bench)与大规模对话式智能体交互的交叉前沿,汇聚了8556条经过验证的复杂编程任务执行轨迹,每条轨迹均涵盖人机多轮对话、模型推理及环境反馈,为研究智能体在真实世界代码修复任务中的决策过程提供了宝贵的语料。当前研究热点集中于利用此类高保真交互数据训练和评估具备深度上下文理解与自适应规划能力的大语言模型,尤其在自动化缺陷定位、补丁生成及验证反馈循环方面。该数据集的发布恰逢AI辅助编程工具迅猛发展与软件工程自动化需求激增之际,其结构化地记录了成功与失败的完整试错路径,为探究智能体的策略探索、错误恢复机制及跨问题泛化能力提供了实证基础。相较传统静态基准,此数据集的动态交互属性契合了从被动代码生成向主动问题求解范式转变的学术诉求,预期将有力推动可解释、可交互的智能软件体研究,并为构建更健壮的自动化编程助手奠定数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务