遇见数据集

eval-fsr-a1-r2egym-swe-r404-traces

收藏
Hugging Face2026-07-11 更新2026-07-12 收录
官方服务:

资源简介:

该数据集是一个包含多轮对话记录及丰富元数据的结构化数据集。核心数据为对话内容(conversations),每条记录包含一系列消息,每条消息由内容(content)和角色(role)组成。数据集还提供了对话的上下文与执行信息,包括:执行代理(agent)、使用的模型(model)及其提供商(model_provider)、对话日期(date)、任务类型(task)、所属回合(episode)、运行标识(run_id)、试验名称(trial_name)、任务执行结果(result)、验证器输出(verifier_output)以及数据来源追踪(trace_source)。数据集包含3,398个训练样本,总大小约514MB。该数据集适用于分析AI代理或模型在特定任务下的交互行为、性能评估、对话轨迹追踪以及多轮对话系统的研究与开发。

This dataset is a structured collection of multi-turn conversation records with rich metadata. The core data consists of conversation content, where each record includes a series of messages, with each message composed of content and role. The dataset also provides contextual and execution information for the conversations, including: agent, model and its provider (model_provider), date, task type, episode, run_id, trial_name, task execution result, verifier_output, and trace_source. It contains 3,398 training samples, with a total size of approximately 514MB. This dataset is suitable for analyzing the interactive behavior and performance evaluation of AI agents or models in specific tasks, tracking dialogue trajectories, and research and development of multi-turn dialogue systems.

提供机构:
LAION eV
创建时间:
2026-07-11
原始信息汇总
  • 数据集名称:eval-fsr-a1-r2egym-swe-r404-traces
  • 数据集提供方:LAION
  • 数据集大小:下载大小约 417.24 MB,数据集总大小约 514.80 MB
  • 数据划分:仅包含训练集(train),共 3398 个样本
  • 数据特征
    • conversations:对话列表,每条对话包含:
      • content:对话内容(字符串)
      • role:对话角色(字符串)
    • agent:代理名称(字符串)
    • model:模型名称(字符串)
    • model_provider:模型提供商(字符串)
    • date:日期(字符串)
    • task:任务描述(字符串)
    • episode:回合编号(字符串)
    • run_id:运行ID(字符串)
    • trial_name:试验名称(字符串)
    • result:运行结果(字符串)
    • verifier_output:验证器输出(字符串)
    • trace_source:追踪来源(字符串)
  • 数据格式:数据文件位于 data/train-*,为默认配置。
搜集汇总
数据集介绍
eval-fsr-a1-r2egym-swe-r404-traces 数据集图片
构建方式
该数据集源自对FSR(功能正确性评分)评估框架下智能体执行轨迹的深度采集与结构化整理,聚焦于R2E-Gym环境中Swe-bench任务(版本r404)的自动化验证过程。每条数据记录包含了完整的对话历史(conversations)、执行智能体标识(agent)、评估模型及其提供商(model, model_provider)、任务与回合信息(task, episode, run_id, trial_name),以及最终验证结果(result, verifier_output)和溯源路径(trace_source)。数据以JSON格式存储,共包含3398条训练样本,总大小约491MB,便于下游加载与处理。
特点
本数据集的一个显著特色在于其多维度的结构化字段设计,不仅记录了智能体与环境的完整交互对话,还精细标注了每次评估的模型来源、执行回合与运行标识符,为复现与比对提供了坚实依据。此外,通过引入验证器输出(verifier_output)字段,数据集能够揭示模型产出与客观验证结果之间的微妙差异,支持对FSR评估机制本身进行深入剖析。该数据集的构建兼顾了广度与深度,为智能体轨迹分析、验证器性能评测及多轮交互场景下的模型行为研究提供了高价值的数据基础。
使用方法
用户可通过HuggingFace Datasets库便捷地加载该数据集,指定`split='train'`即可获取全部3398条样本,每条样本以字典形式呈现。在应用层面,研究者可依据`agent`、`task`或`model`字段进行筛选与分组,以开展针对性分析。对话内容可通过`conversations`字段提取,该字段为角色与内容交替出现的列表结构,适合直接用于对话建模或监督微调。同时,`result`与`verifier_output`可组合用于训练验证一致性判别模型,或评估不同模型在特定任务上的表现稳定性。
背景与挑战
背景概述
该数据集名为eval-fsr-a1-r2egym-swe-r404-traces,创建于近年,由专注于AI智能体与强化学习研究的团队构建,核心研究问题聚焦于评估和追踪AI智能体在多轮对话任务中的表现轨迹。数据集包含3398条训练样本,每条记录涵盖对话历史、智能体身份、模型信息、执行结果及验证器输出等结构化字段,为深入研究智能体行为模式与任务完成质量提供了标准化基准。其影响力在于填补了智能体行为追踪数据集的空白,推动了对AI系统在复杂交互环境中可靠性与可解释性的评估方法发展。
当前挑战
该数据集所解决的领域问题在于应对智能体行为评估中缺乏细粒度追踪数据的挑战,现有基准多关注最终结果而忽略执行过程,导致难以诊断智能体的错误根源。构建过程中面临的主要挑战包括:如何设计统一的数据结构以兼容不同模型和任务的多样性,如何确保对话历史与验证器输出的完整性与一致性,以及如何在大规模多智能体交互场景中高效采集和标注高质量轨迹数据,避免数据偏差和噪声对模型评估的干扰。
常用场景
经典使用场景
在软件工程与人工智能的交叉领域中,eval-fsr-a1-r2egym-swe-r404-traces数据集主要服务于代码智能体的行为追踪与评估任务。该数据集的经典使用场景聚焦于对基于强化学习或监督学习驱动的自主编程智能体(如SWE-agent)在复杂软件工程环境中的交互轨迹进行系统化建模与评测。通过记录智能体在任务执行过程中的完整对话历史、决策动作、运行结果及验证器输出,研究人员能够深入剖析代码生成、调试与重构等子任务中智能体的行为模式与策略选择。
衍生相关工作
该数据集已衍生出一系列具有里程碑意义的学术成果。基于其丰富的轨迹数据,研究者提出了轨迹级行为克隆方法,将专家智能体的决策路径转化为可迁移的策略网络初始参数;同时催生了针对多轮对话场景的代码智能体评测框架,该框架首次引入了过程化奖励建模机制以替代传统的二进制结果判定。此外,该数据集还支撑了关于代码智能体鲁棒性对抗训练的探索工作,通过引入轨迹扰动学习增强了智能体对噪声指令与错误反馈的容错能力,相关成果发表于软件工程与人工智能顶级会议。
数据集最近研究
最新研究方向
该数据集聚焦于基于大语言模型的自主智能体在复杂交互式编程任务中的评估与验证,尤其在语义理解与行为一致性追踪方面展现出前沿价值。eval-fsr-a1-r2egym-swe-r404-traces作为包含多轮对话、代理动作轨迹及验证器输出的结构化数据,为研究强化学习对齐、可解释性推理以及任务导向型对话系统的鲁棒性提供了关键基准。其持续追踪的模型运行记录与结果反馈机制,正推动着AI辅助编程领域从静态代码生成向动态执行验证的范式转变,同时为跨智能体协作与错误根因分析的研究注入了新的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务