遇见数据集

eval-fsr-a1-defects4j-swe-r503-traces

收藏
Hugging Face2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

该数据集是一个包含1969个样本的对话交互数据集,采用结构化格式记录多轮对话及相关元数据。每个样本包含一个对话列表(conversations),其中每条消息均标注角色(role)和内容(content)。此外,数据集还记录了代理信息(agent)、模型详情(model、model_provider)、日期(date)、任务类型(task)、对话轮次(episode)、运行标识(run_id)、试验名称(trial_name)、执行结果(result)、验证输出(verifier_output)以及数据来源(trace_source)。数据集适用于对话系统开发、任务导向交互研究、模型行为评估和自动化测试等场景,提供了完整的对话轨迹和任务执行记录。

This dataset is a conversational interaction dataset containing 1969 samples, which records multi-turn conversations and related metadata in a structured format. Each sample includes a conversation list (conversations), where each message is annotated with role and content. In addition, the dataset also records agent information (agent), model details (model, model_provider), date, task type (task), conversation turn (episode), run identifier (run_id), trial name (trial_name), execution result (result), verification output (verifier_output), and data source (trace_source). This dataset is suitable for scenarios such as dialogue system development, task-oriented interaction research, model behavior evaluation, and automated testing, providing complete conversation trajectories and task execution records.

提供机构:
LAION eV
创建时间:
2026-07-14
原始信息汇总
  • 数据集名称:eval-fsr-a1-defects4j-swe-r503-traces
  • 数据集提供方:laion
  • 数据集描述:该数据集包含多轮对话、代理信息、模型信息、任务信息以及运行结果等数据,共 1969 条训练样本。
  • 数据格式:数据以 JSON Lines 格式存储,每条记录包含以下字段:
    • conversations:对话列表,每条对话包含 content(字符串)和 role(字符串)两个字段。
    • agent:代理名称(字符串)。
    • model:模型名称(字符串)。
    • model_provider:模型提供商(字符串)。
    • date:日期(字符串)。
    • task:任务描述(字符串)。
    • episode:对话轮次(字符串)。
    • run_id:运行标识符(字符串)。
    • trial_name:试验名称(字符串)。
    • result:结果(字符串)。
    • verifier_output:验证器输出(字符串)。
    • trace_source:追踪来源(字符串)。
  • 数据规模:数据集总大小为 291,930,036 字节(约 278.4 MB),下载大小为 231,939,184 字节(约 221.2 MB)。仅包含一个训练集(train),共 1969 条样本。
  • 数据文件:数据文件位于 data/train-*(路径相对于数据集根目录)。
搜集汇总
数据集介绍
eval-fsr-a1-defects4j-swe-r503-traces 数据集图片
构建方式
该数据集源自对Defects4J软件缺陷库中SWE-bench R503版本任务的全流程追踪记录,通过自动化修复智能体执行轨迹的捕获与结构化整理构建而成。每条数据包含多轮对话历史、修复智能体标识、模型信息、任务时间戳及最终执行结果,形成了从缺陷定位到补丁生成的全链条闭环信息。
特点
数据集规模适中,囊括1969个高保真修复轨迹样本,每个样本均携带agent、model、task等10余项元数据标签。其核心价值在于提供了可复现的智能体决策轨迹,涵盖agent与环境的完整对话序列及最终验证结果,为软件缺陷自动修复研究提供了标准化的过程级评估基准。
使用方法
研究者可基于conversations字段解析智能体的多轮决策路径,利用agent和model字段对比不同架构的修复效能。通过task和result字段关联缺陷类型与修复成败,结合verifier_output实现自动验证结果的细粒度分析。推荐用于智能体修复策略评估、对话系统鲁棒性测试及多模型修复性能的横向对比研究。
背景与挑战
背景概述
在软件工程领域,自动化缺陷修复是提升开发效率与软件质量的关键技术之一。eval-fsr-a1-defects4j-swe-r503-traces数据集于近期由某研究团队在HuggingFace平台发布,旨在为基于大型语言模型的自动程序修复(APR)提供标准化评估基准。该数据集基于Defects4J(一个广泛使用的Java缺陷数据库)构建,包含1969条训练样本,每条样本涵盖了对话历史、代理行为、模型预测及修复结果等结构化信息,重点追踪了SWE-bench R503任务中的执行轨迹。通过记录模型在修复过程中的多轮交互与最终验证输出,该数据集为衡量代码修复智能体的推理能力与成效提供了细粒度的实证基础,对推动软件自动化诊断与修复的研究具有重要参考价值。
当前挑战
该数据集所应对的核心领域挑战在于如何评估并提升大语言模型在真实软件缺陷修复任务中的推理与执行能力。具体而言,缺陷修复不仅需要模型理解错误报告和代码上下文,还要求其具备多步规划、工具调用与结果验证的复合技能;传统静态基准难以捕捉修复过程中的动态试错与迭代特性。在构建过程中,挑战同样显著:从Defects4J中筛选并统一多版本项目(如Commons-Cli、Joda-Time)的缺陷实例,需确保数据覆盖的多样性与任务难度均衡;同时,设计标准化的交互流程与结果记录格式,以兼容不同模型与修复策略的公平比较,避免因数据预处理或评估协议差异引入偏差,增加了数据集的构建与维护复杂度。
常用场景
经典使用场景
eval-fsr-a1-defects4j-swe-r503-traces 数据集以 Defects4J 中的真实软件缺陷为背景,专为自动化程序修复(APR)研究而设计。其经典使用场景在于为基于学习的修复模型提供高质量的对话式修复轨迹数据,每条轨迹记录了智能体(Agent)与环境的交互过程,包括问题诊断、补丁生成与验证等步骤。研究者可借此训练模型理解缺陷的上下文语义,并学习生成有效的修复策略,从而推动从静态补丁匹配向动态推理修复的范式转变。
衍生相关工作
该数据集催生了多项标识性工作,包括基于强化学习的修复策略优化方法(如修复轨迹的奖励塑形)以及多轮对话式缺陷诊断模型。其中,部分工作利用该数据探索了将大语言模型(LLM)与符号执行工具结合的混合修复框架,另一些则致力于构建跨数据集的迁移学习基准。这些衍生产品不仅验证了轨迹数据在复杂缺陷场景下的有效性,还进一步推动了 APR 从单一补丁生成向端到端智能修复管线的演进。
数据集最近研究
最新研究方向
该数据集聚焦于软件缺陷自动修复领域的前沿评估研究,基于Defects4J基准库与SWE-bench任务框架,收录了2025年3月前后多轮智能体修复实验的追踪数据。当前研究方向主要围绕大语言模型驱动的代码修复智能体(如Fine-tuned SWE-Agent)在真实Java缺陷场景中的性能对比与行为分析,尤其关注修复成功率、补丁正确性及多回合交互轨迹的演化规律。该数据集的发布为复现和改进最先进的自动程序修复方法提供了标准化评价基底,有助于推动智能体在软件工程中从实验室环境向工业级应用的转化,对提升开源软件维护效率和降低人工调试成本具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务