遇见数据集

eval-laion_loopshape-30-8B_DCAgent2_swebench-verified-random-100-folders-traces

收藏
Hugging Face2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

该数据集记录了AI代理或模型在特定任务上的执行过程与结果,包含1847个训练样本。每个样本由多个字段构成:conversations字段以列表形式存储多轮对话内容,包括content(文本内容)和role(角色);其他字段如agent(代理标识)、model(模型名称)、model_provider(模型提供商)、date(日期)、task(任务类型)、episode(情节标识)、run_id(运行ID)、trial_name(试验名称)、result(执行结果)、verifier_output(验证输出)和trace_source(追踪来源),共同描述了实验的配置、执行轨迹及验证信息。数据集适用于AI代理评估、任务导向对话分析、模型性能比较等场景,支持对多模态实验运行数据的结构化研究。

This dataset records the execution processes and results of AI agents or models on specific tasks, containing 1847 training samples. Each sample consists of multiple fields: the conversations field stores multi-turn dialogue content in a list format, including content (text content) and role (role); other fields such as agent (agent identifier), model (model name), model_provider (model provider), date (date), task (task type), episode (episode identifier), run_id (run ID), trial_name (trial name), result (execution result), verifier_output (verifier output), and trace_source (trace source) collectively describe the experimental configuration, execution trajectory, and verification information. The dataset is suitable for scenarios such as AI agent evaluation, task-oriented dialogue analysis, and model performance comparison, supporting structured research on multimodal experimental run data.

提供机构:
LAION eV
创建时间:
2026-06-17
原始信息汇总
  • 数据集名称: eval-laion_loopshape-30-8B_DCAgent2_swebench-verified-random-100-folders-traces
  • 来源: Hugging Face Datasets (laion/eval-laion_loopshape-30-8B_DCAgent2_swebench-verified-random-100-folders-traces)
  • 任务类型: 未明确指定,但包含对话、代理、模型、任务等字段,推测为多轮对话或代理行为评估任务
  • 数据规模: 训练集包含 1,847 个样本,总数据大小约 306.9 MB,下载大小约 172.0 MB
  • 特征字段:
    • conversations: 对话列表,每条对话包含 content(字符串类型)和 role(字符串类型)
    • agent: 代理名称(字符串)
    • model: 模型名称(字符串)
    • model_provider: 模型提供者(字符串)
    • date: 日期(字符串)
    • task: 任务描述(字符串)
    • episode: 轮次(字符串)
    • run_id: 运行 ID(字符串)
    • trial_name: 试验名称(字符串)
    • result: 结果(字符串)
    • verifier_output: 验证器输出(字符串)
    • trace_source: 追踪来源(字符串)
  • 数据划分: 只有训练集(train),数据文件路径为 data/train-*
搜集汇总
数据集介绍
eval-laion_loopshape-30-8B_DCAgent2_swebench-verified-random-100-folders-traces 数据集图片
构建方式
该数据集源自LAION项目,专注于评估循环形状(loopshape)的30个任务,基于8B参数的DCAgent2模型在SWE-bench已验证的100个随机文件夹轨迹上构建。数据通过自动化Agent在软件开发环境中执行任务,收集其与系统的交互对话、操作结果及验证器输出,形成包含1847个样本的训练集,每个样本详细记录了对话内容、代理标识、模型信息、任务描述及运行结果。
特点
数据集独具特色地融合了多维度元数据,包括agent、model、task和result字段,便于追踪不同模型和代理在复杂软件开发任务中的表现。其verifier_output字段直接提供了自动化验证结果,增强了评估的客观性。此外,数据涵盖丰富的对话历史,可支持对话式强化学习与智能体行为分析,为研究自然语言驱动的任务自动化提供宝贵资源。
使用方法
数据集已按HuggingFace标准格式组织,含train分片,可通过datasets库轻松加载。使用时,用户可提取conversations字段用于对话模型训练,或利用agent和result字段进行行为分析。适用于微调代码生成代理、评估任务执行效率或构建基于强化学习的智能体系统。建议将数据划分为训练与验证集,以优化模型泛化能力。
背景与挑战
背景概述
该数据集由LAION团队于近期构建,旨在推动代码生成与软件工程自动化领域的发展。其核心研究问题聚焦于评估大规模语言模型在复杂软件工程任务中的自主代理能力,尤其是通过SweBench验证集对模型生成的补丁进行自动化验证。数据集包含1847个样本,记录了解码代理(DCAgent2)在多轮交互中的对话历史、执行结果与验证输出,为研究多步推理、环境交互与错误恢复提供了标准化基准。作为连接自然语言指令与可执行代码的桥梁,该数据集对提升软件缺陷修复、功能实现等任务的自动评估具有重要价值。
当前挑战
该数据集面临的挑战主要体现在两个方面。领域层面,软件工程自动化要求模型具备精准理解高复杂度任务、生成可靠代码并适配动态环境的能力,而现有模型常因缺乏对项目结构或依赖关系的深度理解导致补丁失效。构建过程中,从大规模日志中提取结构化代理轨迹面临数据稀疏性与噪声干扰,需确保对话历史与任务结果之间的因果一致性;同时,自动化验证器(Verifier)的准确性直接影响标签可靠性,错误判断可能掩盖真实模型性能差异。
常用场景
经典使用场景
该数据集聚焦于软件工程领域中代码生成与自动修复任务的评估,其经典使用场景在于衡量基于代理的代码生成模型在复杂编程任务上的表现。具体而言,研究者通过向模型提供自然语言描述的问题或缺陷,利用数据集中的对话历史、代理行为及验证结果,来测试模型能否生成符合预期的代码补丁。这一过程通常结合循环验证框架,以模拟真实开发环境中的迭代调试流程,从而评估模型的鲁棒性与修正能力。
衍生相关工作
基于该数据集,衍生出一系列关于代码智能体训练的经典工作。研究者借鉴其多轮交互结构,提出了强化学习框架以优化代理的决策策略,例如通过结果验证信号进行偏好优化。同时,数据集的对话格式促进了多代理协作模型的开发,相关工作探索了如何利用历史轨迹提升代码修复的准确率。此外,该数据集还被用作基准,比较不同规模语言模型在代理范式下的表现,催生了关于模型架构与任务复杂度的系统性研究。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程领域中代码智能体的自动化评估与优化,特别是基于大规模语言模型驱动的代理在执行复杂编程任务时的行为轨迹与性能分析。近期前沿研究方向包括利用此类包含多轮对话、智能体行为及验证器输出的细粒度数据,来训练和评测代码生成与调试模型的鲁棒性、工具调用能力及自主决策水平。结合当下AI辅助编程的热点事件,如SWE-bench等标准化基准的兴起,本数据集通过提供随机采样自真实仓库的任务轨迹,为研究智能体在开放环境下的任务完成率、错误恢复策略及跨文件夹上下文理解提供了关键资源,其意义在于推动从简单代码补全到全流程自动化软件维护的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务