遇见数据集

eval-laion_64GPU_base_32b-55-32B_DCAgent2_swebench-verified-random-100-folders-traces

收藏
Hugging Face2026-06-21 更新2026-06-22 收录
官方服务:

资源简介:

该数据集是一个结构化对话记录集合,专门用于评估和分析对话系统性能。它包含738个训练样本,每个样本记录了一次多轮对话的完整交互过程及相关元数据。核心数据字段包括:对话内容(conversations),其中包含按角色(role)组织的多条消息内容(content);执行对话的智能体标识(agent);使用的模型信息(model)及其提供商(model_provider);对话发生日期(date);任务类型(task);对话轮次标识(episode);运行ID(run_id);试验名称(trial_name);对话结果(result);验证器输出(verifier_output);以及数据来源追踪(trace_source)。该数据集适用于对话系统评估、多轮对话分析、不同模型或智能体的性能比较、任务导向对话研究等场景。数据以结构化格式存储,便于进行定量分析和实验复现。

This dataset is a structured collection of dialogue records, specifically designed for evaluating and analyzing dialogue system performance. It contains 738 training samples, each recording the complete interaction process of a multi-turn dialogue along with related metadata. Key data fields include: dialogue content (conversations), which consists of multiple message contents (content) organized by role (role); agent identifier (agent) executing the dialogue; model information (model) and its provider (model_provider); date of dialogue (date); task type (task); dialogue episode identifier (episode); run ID (run_id); trial name (trial_name); dialogue result (result); verifier output (verifier_output); and trace source for data provenance (trace_source). The dataset is suitable for scenarios such as dialogue system evaluation, multi-turn dialogue analysis, performance comparison of different models or agents, and task-oriented dialogue research. Data is stored in a structured format, facilitating quantitative analysis and experimental reproducibility.

提供机构:
LAION eV
创建时间:
2026-06-21
原始信息汇总
  • 数据集名称: eval-laion_64GPU_base_32b-55-32B_DCAgent2_swebench-verified-random-100-folders-traces
  • 数据集地址: https://huggingface.co/datasets/laion/eval-laion_64GPU_base_32b-55-32B_DCAgent2_swebench-verified-random-100-folders-traces

数据集特征:

  • conversations: 由多条消息组成,每条消息包含 content(字符串类型)和 role(字符串类型)两个字段。
  • agent: 字符串类型,表示智能体。
  • model: 字符串类型,表示模型。
  • model_provider: 字符串类型,表示模型提供方。
  • date: 字符串类型,表示日期。
  • task: 字符串类型,表示任务。
  • episode: 字符串类型,表示回合。
  • run_id: 字符串类型,表示运行ID。
  • trial_name: 字符串类型,表示试验名称。
  • result: 字符串类型,表示结果。
  • verifier_output: 字符串类型,表示验证器输出。
  • trace_source: 字符串类型,表示追踪来源。

数据规模:

  • 仅包含一个 train 划分。
  • 训练集样本数量: 738 条。
  • 数据集总大小: 132,771,609 字节(约 126.6 MB)。
  • 下载大小: 73,465,614 字节(约 70.1 MB)。
搜集汇总
数据集介绍
eval-laion_64GPU_base_32b-55-32B_DCAgent2_swebench-verified-random-100-folders-traces 数据集图片
构建方式
该数据集基于LAION-64GPU平台,通过部署32B参数的DCAgent2模型在SWE-bench验证集上执行随机选取的100个文件夹任务并记录完整轨迹构建而成。数据采集过程依托高性能64GPU集群,确保了大规模并行推理的效率与稳定性,最终收录738条会话样本,每条包含模型输出、验证器反馈及执行栈追踪等结构化信息。
特点
数据集具备多维度元数据标注体系,涵盖agent标识、模型来源、任务描述及运行环境等关键字段,特别设计的'conversations'字段以对话序列形式存储交互记录。数据规模达132MB,支持通过verifier_output字段直接对比模型生成的修复代码与标准验证结果,为评估代码修复智能体的推理能力提供了标准化基准。
使用方法
适用于训练或评估代码生成与缺陷修复类对话模型。用户可通过HuggingFace Datasets库加载train分片数据,利用'conversations'字段中的角色轮次结构构建监督学习输入,或结合'result'与'verifier_output'字段设计强化学习奖赏信号。建议以'agent'和'model'为分组键进行跨任务性能分析,同时注意仅包含单条轨道的序列化存储格式。
背景与挑战
背景概述
在软件工程与人工智能的交叉领域,自动化代码修复与生成任务正逐渐成为研究热点,尤其是在大规模语言模型(LLM)驱动的智能体(Agent)系统中。eval-laion_64GPU_base_32b-55-32B_DCAgent2_swebench-verified-random-100-folders-traces数据集由LAION等研究机构于近期创建,旨在评估基于对话的智能体在SweBench验证环境下的代码修复能力。该数据集包含738条训练样本,每条样本均记录了智能体与环境的完整交互对话(conversations)、所使用模型(model)及最终执行结果(result),为研究LLM在复杂软件工程任务中的推理与行动能力提供了标准化基准。其发布填补了当前缺乏细粒度、多轮交互式代码修复评估数据的空白,对推动自主编程智能体的发展具有重要影响。
当前挑战
该数据集所解决的核心领域挑战在于,现有代码修复数据集多聚焦于单轮静态补丁生成,而无法覆盖智能体在真实开发环境中的多步交互、错误回退与策略调整过程。构建过程中,面临的关键挑战包括:1)确保每个样本的对话序列完整且无歧义,需人工审核大量多轮交互日志以剔除噪声;2)在64GPU的高算力环境下复现智能体执行轨迹,需同步记录模型输出、动作与系统状态,对存储与同步机制要求严苛;3)从SweBench的随机文件夹样本中筛选验证性轨迹(verified-folders-traces),需自动化工具与领域专家协同标注以平衡规模与质量。
常用场景
经典使用场景
该数据集专为评估和训练基于大语言模型的软件工程智能体而设计,经典使用场景聚焦于自动化代码维护与缺陷修复任务。通过记录智能体在SWE-bench验证集上的完整交互轨迹,研究者可深入分析模型在真实软件仓库环境中的决策逻辑与代码生成能力。数据集包含738条高质量对话样本,每条样本详录了智能体从接收任务到产出修复补丁的完整链路,涵盖模型生成内容、中间验证结果及最终成效,为复现实验和对比不同智能体架构提供了标准化的评估基准。
解决学术问题
该数据集精准解决了软件工程领域中自动化缺陷修复缺乏可复现基准的学术困境。传统研究常因评估环境差异导致结果难以比较,而该数据集通过统一的任务生成协议与多维度元信息(如智能体类型、模型提供商、运行标识)构建了可溯源的评估框架。其核心价值在于:为验证大型语言模型在复杂代码库中的上下文理解、补丁生成与迭代纠错能力提供了实证基础,推动了从规则驱动到数据驱动的智能体性能衡量范式转变。
衍生相关工作
该数据集衍生了多个前沿研究方向,包括但不限于多智能体协作框架的构建、基于检索增强的代码修复策略以及智能体行为可解释性分析。研究者已基于其评估协议开发出性能更优的任务规划器与上下文压缩模块,部分工作将交互轨迹视为强化学习中的经验回放缓存以优化模型策略。更值得关注的是,该数据集催生了关于智能体失败模式分类学的系统性研究,通过对比不同模型在相同任务上的表现差异,推动了领域内对模型鲁棒性边界与知识迁移效率的深入探讨。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务