遇见数据集

longrca-bench

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

LongRCA Bench是一个用于诊断长程智能体(Agent)失败中责任角色和根因的数据集。它包含1,140条来自五个任务域(软件修复、终端任务、旅行规划、面向服务的工具使用、Web交互)的已观察、非注入式失败智能体轨迹。每条轨迹均有人类注释,标注了负责的角色、最早决定性的根因步骤以及基于轨迹的理由。数据集总共有177,884个记录的历史步骤,中位轨迹长度为145步,最大为728步。数据字段包括:question_ID(形式化源前缀轨迹标识符)、history(完整有序轨迹)、mistake_agent(参考责任角色)、mistake_step(参考的基于0的根因步骤)和mistake_reason(人工编写的理由,不参与评分)。该数据集可用于评估多智能体系统在长时间任务中的故障分析能力,责任角色和根因步骤独立评估,且角色不能从发出根因步骤的智能体自动推断。数据集通过HuggingFace Datasets加载,分割为test。

LongRCA Bench is a dataset for diagnosing responsible roles and root causes in long-range agent failures. It contains 1,140 observed, non-injected failure agent trajectories from five task domains (software repair, terminal tasks, travel planning, service-oriented tool use, web interaction). Each trajectory is annotated by humans with the responsible role, the earliest decisive root cause step, and trajectory-based reasoning. The dataset has a total of 177,884 recorded historical steps, with a median trajectory length of 145 steps and a maximum of 728 steps. Data fields include: question_ID (formalized source prefix trajectory identifier), history (complete ordered trajectory), mistake_agent (reference responsible role), mistake_step (reference 0-based root cause step), and mistake_reason (human-written reasoning, not used in scoring). This dataset can be used to evaluate fault analysis capabilities of multi-agent systems in long-horizon tasks, with responsible roles and root cause steps evaluated independently, and roles cannot be automatically inferred from the agent that issued the root cause step. The dataset is loaded via HuggingFace Datasets and split into test.

创建时间:
2026-08-19
原始信息汇总

LongRCA Bench 数据集概述

LongRCA Bench 是一个用于诊断长时程智能体(Agent)失败原因的人工标注基准数据集,包含 1,140 条 真实发生(非注入)的失败智能体轨迹,覆盖 5 个任务领域。数据集提供了人类专家对每条轨迹中 责任角色(responsible role)最早决定性根因步骤(earliest decisive root-cause step) 以及基于轨迹的 推理说明(rationale) 的标注。

数据集构成

来源基准 任务领域 轨迹数
SWE-bench Pro 软件修复 128
Terminal Bench 2 终端任务 42
TravelPlanner 旅行规划 685
VitaBench 面向服务的工具使用 108
WebArena Verified 网页交互 177
总计 5 个任务域 1,140
  • 数据集共包含 177,884 条 记录的历史步骤。
  • 轨迹长度的 中位数为 145 步最大长度为 728 步
  • 轨迹由 MiniMax-M2.5、Kimi-K2.5 和 Qwen3.5-Plus 在多种智能体组织方式(固定角色团队、专家群聊、顺序工作流、规划器-评论家-执行器工作流)下生成。

数据字段说明

字段 描述
question_ID 正式的源前缀轨迹标识符(格式为 <source>__NNN
history 完整的按顺序排列的轨迹
mistake_agent 参考责任角色
mistake_step 参考的基于 0 的根因步骤索引
mistake_reason 人工撰写的推理说明(不参与评分)

使用说明与评估要点

搜集汇总
数据集介绍
longrca-bench 数据集图片
构建方式
LongRCA Bench数据集的构建源于对多智能体系统在长程任务中失败模式的系统性观测。研究者从五个任务域(软件修复、终端操作、旅行规划、服务导向工具使用和Web交互)中采集了1,140条真实且非人为注入的失败轨迹。这些轨迹由多种主流大语言模型(如MiniMax-M2.5、Kimi-K2.5和Qwen3.5-Plus)在包括固定角色团队、专家小组聊天、顺序工作流以及规划-批评-执行工作流等多样化智能体组织架构下生成。每一条轨迹均经过领域专家的人工标注,明确了失败发生时的责任角色、最早的可判定根因步骤编号,并附有基于轨迹证据的详细理由说明。这种构建方式确保了数据集既覆盖了广泛的真实失败场景,又提供了精确的因果诊断信息。
特点
LongRCA Bench的特征在于其深度与规模的结合。数据集中包含177,884个历史步骤,每条轨迹的中位长度达145步,最长可达728步,充分体现了任务的长程特性。每个实例都包含完整的有序历史记录、独立的责任角色标签和根因步骤标签,且两者被设计为独立评估,以防止从轨迹发出者推断角色。此外,数据集跨越五大任务域,来源丰富,且提供人类编写的解释性理由,但该理由不作为评分依据。数据集规模适中(1,140条),适合作为标准测试集。其标注协议和评估方法已在配套论文中详述,保证了数据的高质量和研究可复现性。
使用方法
使用LongRCA Bench非常便捷,用户可通过HuggingFace的datasets库直接加载测试集。具体方法为调用`load_dataset("CLoud5-real/longrca-bench", split="test")`,即可获得包含所有字段的parquet格式数据。每一条记录提供了轨迹历史、责任角色、根因步骤和人类理由。在评测时,模型需独立预测责任角色和根因步骤,二者将分别与人工参考进行对比。该数据集适用于多智能体系统的失败诊断研究,可用于开发新的根因分析算法、评估智能体协作策略的鲁棒性,或作为基准来改进智能体的自我反思与错误纠正能力。
背景与挑战
背景概述
LongRCA Bench于2026年由Yunfei Zhang等多名研究者共同创建,旨在系统性地诊断长时程智能体任务失败中的责任角色与根因步骤。随着多智能体系统在软件工程、旅行规划等复杂领域中的广泛应用,其执行轨迹的失败分析成为提升系统可靠性的关键。该数据集汇集了来自SWE-bench Pro、Terminal Bench 2等五个任务领域的1,140条非注入式失败轨迹,并提供了专家标注的责任角色、根因步骤及溯源理由。其发布为智能体失败分析研究提供了标准化的评估基准,推动了该领域从粗粒度错误分类向细粒度因果追溯的范式转变,对多智能体系统的可解释性与鲁棒性研究具有重要影响力。
当前挑战
该领域核心挑战在于长时程任务轨迹的复杂性:轨迹步骤众多(中位145步,最长728步),根因可能隐含在上下文交互中,且责任角色与步骤发射者无直接对应,增加了诊断难度。构建过程中,研究者面临多源异构轨迹的整合难题,需跨领域统一标注协议,确保责任角色与根因步骤的独立评估。此外,专家标注的可靠性要求严格的质量控制,以平衡主观性并避免自动推断偏差。这些挑战不仅考验数据集的完整性与代表性,也对其在真实场景中的泛化能力提出了高要求。
常用场景
经典使用场景
LongRCA Bench作为首个专为长时程智能体故障诊断设计的基准数据集,其经典使用场景聚焦于多智能体系统的失败根因分析。该数据集汇集了来自软件修复、终端任务、旅行规划、服务导向工具使用及网页交互五大任务域的1,140条真实失败轨迹,每条轨迹均包含人工标注的责任角色、关键根因步骤及详细解释。研究者可利用此数据集评估智能体在复杂长程任务中的故障定位能力,通过给定完整的轨迹历史,要求模型识别出导致失败的具体步骤及承担责任的智能体角色,进而检验其理解多智能体协作动态和错误传播机制的能力。
解决学术问题
该数据集解决了长时程多智能体系统中故障归因的学术难题,突破了以往研究仅关注单一智能体或短轨迹的局限。它提供了细粒度的角色级和步骤级标注,使研究者能够系统探究错误如何在多个智能体之间传递和累积,以及何种协作模式更容易引发关键失败。这为构建可解释、可诊断的智能体系统奠定了数据基础,推动了从结果导向的评估向过程导向的诊断转变,对提升智能体的鲁棒性和可信赖性具有重要理论意义。
衍生相关工作
基于LongRCA Bench,后续研究可衍生出多个方向:一是开发专门的根因分析模型,利用轨迹历史预测责任角色和错误步骤,形成新的序列标注任务;二是研究多智能体协作策略的对比分析方法,通过挖掘不同工作流(如固定角色团队、规划-批评-执行)下的失败模式,提出更优的协作架构;三是构建故障修复推荐系统,结合根因定位生成修复建议,推动自主智能体的自我纠错能力发展;四是建立跨域迁移学习基准,评估诊断模型在不同任务领域间的泛化性能,为通用智能体诊断提供参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务