遇见数据集

laion/eval-laion_loopshape-30-8B_DCAgent2_swebench-verified-random-100-folders-traces

收藏
Hugging Face2026-06-19 更新2026-06-21 收录
官方服务:

资源简介:

该数据集是一个多轮对话数据集,包含3382个训练示例,用于记录AI代理在任务执行中的交互过程。每个示例包括对话内容(conversations,其中含角色和消息)、代理标识(agent)、模型信息(model和model_provider)、日期(date)、任务类型(task)、情节(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和来源追踪(trace_source)。数据集旨在支持AI代理的评估和训练,涵盖多种任务和交互场景。

This dataset is a multi-round conversation dataset containing 3,382 training examples, designed to record interactions of AI agents during task execution. Each example includes conversation content (conversations, with roles and messages), agent identifier (agent), model information (model and model_provider), date (date), task type (task), episode (episode), run ID (run_id), trial name (trial_name), result (result), verifier output (verifier_output), and trace source (trace_source). The dataset aims to support the evaluation and training of AI agents, covering various tasks and interaction scenarios.

提供机构:
laion
搜集汇总
数据集介绍
laion/eval-laion_loopshape-30-8B_DCAgent2_swebench-verified-random-100-folders-traces 数据集图片
构建方式
该数据集基于LAION LoopShape-30-8B任务,结合DCAgent2框架与SWE-bench验证环境构建而成。通过随机选取100个文件夹的traces数据,系统性地收集了代理在代码工程任务中的交互轨迹。每条数据包含完整的对话历史、代理标识、模型信息及任务执行结果,其中verifier_output字段记录了验证器对代理行为的评估反馈,形成了一套涵盖多轮交互的闭环数据集。
特点
数据集特点在于其结构化与多维度的元数据标注,包含agent、model、model_provider等字段,便于进行代理行为分析与模型性能对比。同时,result与verifier_output字段提供了任务完成度与过程验证的双重评价标准。3382条训练样本均源自真实代码仓库的环境交互,确保了数据的高生态效度与领域相关性。
使用方法
该数据集适用于训练与评估基于对话的编程代理模型。使用者可通过conversations字段提取多轮对话序列,结合agent与task字段进行条件化建模。推荐将result作为监督信号,verifier_output作为辅助反馈,构建强化学习或偏好对齐的训练范式。数据以JSON格式存储,可便捷加载至HuggingFace Datasets库进行批处理与分 batches 训练。
背景与挑战
背景概述
该数据集由LAION团队与相关研究机构于近期创建,聚焦于评估和增强基于语言模型的智能代理(Agent)在复杂软件工程环境中的表现。核心研究问题在于如何通过结构化的多轮对话数据,提升代理在代码仓库中完成验证性任务的能力,尤其是在SWE-bench等基准测试中。数据集包含3382个训练样本,每个样本记录了从任务指令到最终结果的完整交互轨迹、代理类型、模型信息及验证结果,为研究代理的决策过程、错误模式及改进方向提供了宝贵资源。其影响力体现在推动代码智能代理从静态任务向动态、多步骤工程场景的演进,为自动化软件开发与调试领域奠定了数据基础。
当前挑战
领域层面,该数据集所解决的挑战是让语言模型代理理解并执行复杂的软件工程任务,如跨文件代码修改、依赖解析与测试修复,这些任务远超传统问答或简单代码生成,要求代理具备长期规划与上下文记忆能力。构建过程中,挑战包括:1) 从SWE-bench标准任务中精心筛选并构造100个真实文件夹轨迹,确保覆盖多样化的代码库与问题类型;2) 设计统一的对话格式以容纳多轮交互、代理状态及验证结果,同时保证数据的一致性与可解析性;3) 应对不同模型与代理产生的异构输出,人工或自动化地清洗和标注使得数据可用于训练验证,而规模仅3382例则凸显了高质量轨迹数据收集与标注的困难性。
常用场景
经典使用场景
该数据集聚焦于软件工程领域中基于轨迹的智能体行为评估,其经典使用场景在于对多轮对话式代码生成与调试任务的性能度量。通过记录智能体在复杂编程挑战中的完整操作轨迹(如代码修改、命令执行与日志解析),研究者可系统性地分析大语言模型驱动的代理在自动化软件修复与功能实现中的决策质量。数据集了包含验证器输出(verifier_output)与最终结果(result)字段,便于构建监督信号,从而训练或微调模型以优化其代码生成与调试策略。
实际应用
在实际应用中,该数据集可直接服务于自动化软件开发工具链的部署与优化。例如,可用于训练企业级代码审查助手,使其在识别逻辑漏洞后自主生成补丁并执行回归测试;或赋能持续集成流水线中的智能调试模块,通过历史操作轨迹学习高效排错策略。此外,基于该数据集的验证器输出,可构建面向初学者的交互式编程教学系统,实时反馈学习者的代码修改路径并提供优化建议,从而降低编程教育的入门门槛。
衍生相关工作
该数据集衍生出多项经典工作,包括基于轨迹对比学习的代理行为对齐方法、结合强化学习的代码修复策略优化模型,以及多智能体协作框架下的任务分解与分配机制。例如,研究者利用其episode和trace_source字段构建了层次化行为聚类模型,揭示了不同难度任务下智能体探索与利用模式的差异。另有工作将其与swebench官方基准结合,开发出融合验证器反馈的细粒度奖励函数,显著提升了代码智能体在未见仓库中的零样本修复成功率。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务