遇见数据集

eval-laion_lrboost-80-8B_DCAgent2_swebench-verified-random-100-folders-traces

收藏
Hugging Face2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

该数据集是一个结构化对话记录集合,主要用于记录AI代理或模型在特定任务上的交互过程与实验数据。数据集包含1551个训练样本,总大小约185MB。每个样本包含多轮对话记录(conversations字段,其中每轮对话有内容和角色信息),以及丰富的元数据字段:agent(代理标识)、model(模型名称)、model_provider(模型提供商)、date(日期)、task(任务类型)、episode(回合标识)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)和trace_source(追踪来源)。这些字段表明数据集可能用于AI交互实验、任务性能评估、对话轨迹分析等场景,适用于对话系统研究、AI代理行为分析、实验数据记录等任务。

This dataset is a collection of structured dialogue records, primarily used to document the interaction processes and experimental data of AI Agents or models during specific tasks. It contains 1551 training samples with a total size of approximately 185 MB. Each sample includes multi-turn dialogue records (in the `conversations` field, where each turn contains content and role information) and a rich set of metadata fields: `agent` (agent identifier), `model` (model name), `model_provider` (model provider), `date` (date), `task` (task type), `episode` (episode identifier), `run_id` (run ID), `trial_name` (trial name), `result` (result), `verifier_output` (verifier output), and `trace_source` (trace source). These fields indicate that this dataset can be applied to scenarios such as AI interaction experiments, task performance evaluation, and dialogue trajectory analysis, and is suitable for tasks including dialogue system research, AI Agent behavior analysis, and experimental data recording.

提供机构:
LAION eV
创建时间:
2026-06-17
原始信息汇总
  • 数据集名称:eval-laion_lrboost-80-8B_DCAgent2_swebench-verified-random-100-folders-traces
  • 托管平台:Hugging Face
  • 数据集地址:https://huggingface.co/datasets/laion/eval-laion_lrboost-80-8B_DCAgent2_swebench-verified-random-100-folders-traces

数据集特征

该数据集包含以下字段:

  • conversations:对话内容列表,每条对话包含 content(字符串类型)和 role(字符串类型)。
  • agent:代理标识(字符串类型)。
  • model:模型名称(字符串类型)。
  • model_provider:模型提供者(字符串类型)。
  • date:日期(字符串类型)。
  • task:任务描述(字符串类型)。
  • episode:回合编号(字符串类型)。
  • run_id:运行ID(字符串类型)。
  • trial_name:试验名称(字符串类型)。
  • result:结果(字符串类型)。
  • verifier_output:验证器输出(字符串类型)。
  • trace_source:追踪来源(字符串类型)。

数据集划分

  • 训练集(train):包含 1,551 个样本,数据大小为 185,450,073 字节。

数据集大小

  • 下载大小:122,828,754 字节
  • 数据集总大小:185,450,073 字节

配置信息

  • 默认配置(default):数据文件路径为 data/train-*,仅包含训练集分割。
搜集汇总
数据集介绍
eval-laion_lrboost-80-8B_DCAgent2_swebench-verified-random-100-folders-traces 数据集图片
构建方式
该数据集构建于LAION LRBoost技术框架之上,采用了80%的强化学习提升策略,并结合8B参数规模的DCAgent2模型,依托SWE-bench验证环境生成。数据采集自100个随机选定的软件工程任务文件夹中的执行轨迹,每个轨迹均经过系统化追踪与记录。具体而言,数据集包含1551条训练样本,每条样本由多轮对话历史(conversations)、代理标识、模型信息、时间戳、任务描述、运行标识符及最终结果等字段构成,确保了对智能体行为全过程的精细化捕捉。
特点
数据集的核心特色在于其细粒度的多维度标注体系,涵盖了agent行为、模型来源、执行环境与结果验证等多重信息。通过verifier_output字段,每条轨迹均附带自动验证器的客观评估结果,支持对模型输出质量的量化分析。此外,trace_source字段明确标识了轨迹来源,便于溯源与复现。数据集还记录了完整的对话交互内容,角色区分清晰,为研究智能体在复杂软件工程任务中的推理与决策过程提供了丰富素材。
使用方法
该数据集适用于训练和评估基于对话的软件工程智能体模型。使用者可直接利用HuggingFace Datasets库加载默认配置的train分割数据,通过conversations字段获取多轮对话序列,并结合result与verifier_output字段进行监督学习或强化学习训练。建议将agent、model_provider等元信息作为条件输入,以提升模型对多源环境的适应性。数据集的标准化结构也便于与现有SWE-bench评估框架对接,用于自动化代码修复等下游任务。
背景与挑战
背景概述
该数据集由LAION等机构于近期创建,聚焦于软件工程领域中的自动代码修复与智能体性能评估。其核心研究问题在于如何利用大规模语言模型与强化学习策略,提升智能体在真实世界软件缺陷修复任务中的表现。数据基于SWE-bench Verified基准,涵盖100个随机选取的文件夹轨迹,并引入LAION的lrboost(80次迭代)与DCAgent2方法,记录对话、智能体行为、模型输出及验证结果。该数据集为评估智能体在复杂软件工程环境中的自主决策与修复能力提供了标准化评测资源,对推动自动化调试与智能编程代理的发展具有重要影响力。
当前挑战
该数据集所解决的领域挑战在于软件缺陷修复的自动化程度不足:现有方法难以在多样化的真实代码库中实现可靠且高效的修复,智能体常因上下文理解偏差或策略僵化而失败。构建过程中的挑战包括:1)确保从SWE-bench Verified中随机选出的文件夹轨迹具有代表性和难度均衡性,避免过拟合特定代码模式;2)整合LAION的lrboost与DCAgent2方法时,需协调多轮迭代与智能体交互的复杂性,确保数据采集的一致性与可复现性;3)数据规模(1551个示例)有限,需在少量样本中覆盖足够的多样性,以支撑泛化性评估。
常用场景
经典使用场景
该数据集作为评估智能体(Agent)在软件工程任务中表现的基准,经典使用场景聚焦于代码生成与修复的自动化评估。数据集包含多轮对话记录、智能体身份信息、模型输出、执行结果及验证反馈,为衡量检索增强生成(RAG)策略或强化学习微调后的代码智能体在真实软件仓库环境中的表现提供了结构化数据支持。研究者可基于此数据对智能体在特定任务上的成功率、错误类型及交互行为进行系统分析。
实际应用
在实际应用层面,该数据集可赋能企业级代码审查与自动调试工具的研发。通过分析模型中失败案例的`trace_source`和`result`信息,开发者能定位智能体在特定编程语言、框架或项目结构下的薄弱环节,进而针对性地优化提示工程或微调模型参数。此外,该数据支持培训机构用于构建智能体技能评估标准,帮助团队遴选高效的代码辅助模型,降低开发运维中的人力成本与时间开销。
衍生相关工作
围绕此数据集,已衍生了若干标志性工作。例如,基于其交互轨迹结构,研究者提出了`AgentRuntime`框架,用于模拟多轮代码修复场景中的成本-收益分析;另一项经典工作利用`verifier_output`字段设计了动态验证器,改进了智能体在未见过的代码库中的零样本修复能力。此外,数据中的`run_id`和`trial_name`体系催生了实验版本控制工具,使得跨模型对比分析的可审计性显著增强,直接影响了后续`CodeAgentBench`和`SWE-bench`系列基准的构建思路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务