遇见数据集

eval-laion_stageB-channel-80-8B_DCAgent2_swebench-verified-random-100-folders-traces

收藏
Hugging Face2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

该数据集是一个结构化对话交互记录集合,包含1636个训练样本。数据核心特征为多轮对话内容(conversations字段,包含角色role和内容content子字段),并关联了丰富的元数据:执行代理(agent)、使用模型(model及模型提供商model_provider)、任务描述(task)、时间戳(date)、执行场景标识(episode, run_id, trial_name)、任务执行结果(result)、验证器输出(verifier_output)以及数据来源标识(trace_source)。数据集适用于分析多轮对话系统、智能体任务执行、模型行为评估等场景,为研究对话交互、任务完成度评估及不同代理/模型在特定任务上的表现提供了结构化数据。

This dataset is a collection of structured dialogue interaction records, containing 1636 training samples. Its core features include multi-turn dialogue content (conversations field, with subfields for role and content), along with rich metadata: execution agent (agent), model used (model and model provider model_provider), task description (task), timestamp (date), execution scenario identifiers (episode, run_id, trial_name), task execution result (result), verifier output (verifier_output), and data source identifier (trace_source). The dataset is suitable for analyzing multi-turn dialogue systems, agent task execution, model behavior evaluation, and other scenarios, providing structured data for research on dialogue interactions, task completion assessment, and the performance of different agents/models in specific tasks.

提供机构:
LAION eV
创建时间:
2026-06-17
原始信息汇总
  • 数据集名称:eval-laion_stageB-channel-80-8B_DCAgent2_swebench-verified-random-100-folders-traces
  • 数据集链接:https://huggingface.co/datasets/laion/eval-laion_stageB-channel-80-8B_DCAgent2_swebench-verified-random-100-folders-traces
  • 数据集规模
    • 总下载大小:约 140.2 MB
    • 数据集总大小:约 241.8 MB
    • 训练集样本数:1,636 条
  • 数据特征
    • conversations:对话列表,包含内容(content,字符串)和角色(role,字符串)
    • agent:代理标识符(字符串)
    • model:模型名称(字符串)
    • model_provider:模型提供方(字符串)
    • date:日期(字符串)
    • task:任务描述(字符串)
    • episode:轮次编号(字符串)
    • run_id:运行ID(字符串)
    • trial_name:试验名称(字符串)
    • result:结果(字符串)
    • verifier_output:验证器输出(字符串)
    • trace_source:轨迹来源(字符串)
  • 数据划分:仅包含训练集(train
  • 配置文件:默认配置(default),数据文件路径为 data/train-*
搜集汇总
数据集介绍
eval-laion_stageB-channel-80-8B_DCAgent2_swebench-verified-random-100-folders-traces 数据集图片
构建方式
该数据集源自LAION项目,在Stage B管道中,通过通道数为80、参数量为8B的模型进行构建。具体而言,它聚焦于SWE-bench验证集,采用随机策略从100个文件夹中抽取轨迹数据,并结合DCAgent2智能体框架生成交互记录。每条样本包含完整的对话历史、智能体类型、模型信息、时间戳、任务描述、运行标识符以及最终结果与验证器输出,形成结构化的多轮交互数据。
使用方法
该数据集可直接用于训练或评估基于对话的软件工程智能体模型。使用时,加载'train'分割中的JSON格式数据,提取'conversations'字段作为输入序列,利用'result'与'verifier_output'字段作为监督信号进行微调或性能评估。研究人员可依据'agent'、'model'等字段进行子集筛选,对比不同智能体架构或基座模型在SWE-bench任务上的表现。
背景与挑战
背景概述
该数据集由LAION研究机构于2023年创建,聚焦于软件工程领域中的自动化代码代理(Code Agent)评估。核心研究问题在于如何有效验证和评估大语言模型驱动的代理在复杂软件开发任务中的表现,特别是针对SWE-bench已验证的真实软件缺陷修复场景。数据集包含1636个训练样本,每个样本详细记录了代理与环境的交互对话、模型来源、任务描述及验证结果等信息。其影响力体现在为自动化代码修复领域提供了一个可复现、结构化的评估基准,填补了传统基准测试在代理行为轨迹细粒度分析方面的空白,推动了代码智能体在真实开发环境中的应用研究。
当前挑战
当前挑战主要源于两个方面:其一,领域问题层面,自动化代码代理需应对软件缺陷修复中的不确定性,包括缺陷定位不精确、补丁生成与现有代码的兼容性冲突以及验证器输出的二义性。数据集通过记录完整交互轨迹和多重验证结果,试图缓解这些挑战,但代理在复杂多文件项目中的泛化能力仍显不足。其二,构建过程中,数据采集面临代理行为多样性与可复现性的矛盾——不同模型或同一模型多次运行可能产生迥异轨迹,而筛选高质量交互样本需人工干预验证,导致数据集规模受限(仅1636条),且分布式追踪片段的整合与对齐增加了预处理复杂度。
常用场景
经典使用场景
在软件工程与人工智能的交叉领域中,该数据集主要被用于评估和训练基于大型语言模型的代码智能体在真实软件工程任务中的表现。具体而言,它包含了来自SWE-bench验证集的一百个随机选取的软件仓库问题实例,每个实例都记录了智能体与环境的完整交互对话、模型推理轨迹以及最终修复结果。研究者利用这些结构化的对话数据和丰富的元信息,能够系统性地分析模型在代码理解、调试、补丁生成等环节的能力,从而推动代码智能体在复杂软件维护场景下的性能提升。
解决学术问题
该数据集精准地回应了自动化程序修复领域中一个长期存在的学术难题:如何构建能够自主完成真实世界软件仓库级别缺陷修复的智能体。传统方法往往依赖于预定义的规则或有限的人工标注,难以应对多样化、大规模的开源代码库。此数据集通过提供标准化、多轮交互的智能体行为轨迹,使得学术界能够量化比较不同模型在端到端软件任务上的成功率、效率及错误模式,从而为开发更通用的、具备上下文理解与策略规划的代码智能体奠定了坚实的基准基础。
实际应用
在实际应用层面,该数据集直接服务于持续集成与持续交付流程中的自动化缺陷修复环节。软件工程团队可以利用基于此数据集训练的模型,自动分析来自GitHub等平台的issue报告,生成初步的代码补丁建议,显著减少人工审查和调试的时间成本。此外,数据集内的多轮对话结构也使模型能够模拟人类开发者与CI系统交互的过程,未来可被集成到IDE插件或代码审查工具中,为开发者提供实时、智能的修复提示,提升整体软件开发的效率与质量。
数据集最近研究
最新研究方向
该数据集聚焦于代码智能体在软件工程任务中的行为轨迹与评估范式研究,特别是针对SWE-bench已验证的软件工程问题。通过记录多轮对话、模型决策路径及验证器输出,为探索大型语言模型驱动的自主代码修复、调试与任务完成能力提供了标准化评估基准。当前前沿方向包括利用该轨迹数据训练更鲁棒的智能体策略,分析模型在复杂编程环境中的失败模式,以及构建可复现的自动化软件工程流水线。该数据集的出现推动了将交互式代码生成从单轮问答转向多步推理与工具调用,在AI辅助编程领域具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务