遇见数据集

whowhen_pro

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

Who&When Pro 是一个用于评估大型语言模型(LLM)智能体系统失败归因能力的基准测试数据集。每个样本包含一个智能体轨迹(单智能体或多智能体),并在已知步骤中注入一个真实的错误。标签记录了错误的责任方、发生时间以及错误类型。评估时,模型需要根据轨迹恢复所有三个信息。数据集规模在10,000到100,000个样本之间,语言为英语。数据分为四个子集:text(文本工具使用轨迹)、image(图表/搜索相关轨迹)、image_gui(GUI智能体轨迹,包含完整截图观察)、video(视频智能体轨迹)。每个样本的行结构包括:id(唯一标识)、framework(使用的智能体框架)、benchmark(来源基准)、task(原始任务,含查询、参考答案、输入)、trajectory(完整智能体执行过程)、ground_truth(标签:智能体、步骤和错误模式)、extras(框架特定元数据)。其中task、trajectory、ground_truth和extras为JSON字符串,需解析后使用。image和image_gui轨迹的图片嵌入在行中;video轨迹引用video_assets/目录下的帧文件。错误分类包含6大类共17种模式:感知(视觉误识别、空间定位)、推理(幻觉、推理错误、数值错误、任务误解)、规划(无效规划、目标漂移)、行动(工具参数错误、输出格式错误、过早终止、重复循环)、验证(上下文丢失、不充分验证)、协调(委派错误、通信失败、过度依赖其他智能体)。该数据集配套有评估工具(位于GitHub),包含所有框架的渲染器和评分流水线。引用信息来自一篇arXiv论文。

Who&When Pro is a benchmark dataset for evaluating the failure attribution capabilities of large language model (LLM) agent systems. Each sample contains an agent trajectory (single-agent or multi-agent) with a real error injected at a known step. The label records the responsible party, time of occurrence, and error type. During evaluation, the model needs to recover all three pieces of information from the trajectory. The dataset size ranges from 10,000 to 100,000 samples, and the language is English. The data is divided into four subsets: text (text-based tool usage trajectories), image (chart/search-related trajectories), image_gui (GUI agent trajectories with full screenshot observations), and video (video agent trajectories). Each samples row structure includes: id (unique identifier), framework (agent framework used), benchmark (source benchmark), task (original task with query, reference answer, input), trajectory (complete agent execution process), ground_truth (labels: agent, step, and error pattern), and extras (framework-specific metadata). Among them, task, trajectory, ground_truth, and extras are JSON strings that need to be parsed before use. Images in image and image_gui trajectories are embedded in the rows; video trajectories reference frame files in the video_assets/ directory. Error classification includes 6 major categories with 17 patterns: Perception (visual misrecognition, spatial positioning), Reasoning (hallucination, reasoning error, numerical error, task misunderstanding), Planning (invalid planning, goal drift), Action (tool parameter error, output format error, premature termination, repetitive loop), Verification (context loss, insufficient verification), Coordination (delegation error, communication failure, over-reliance on other agents). The dataset is accompanied by evaluation tools (on GitHub) including renderers and scoring pipelines for all frameworks. Citation information comes from an arXiv paper.

创建时间:
2026-08-08
原始信息汇总

Who&When Pro 数据集概述

基本信息

  • 数据集名称: Who&When Pro
  • 许可证: CC-BY-4.0
  • 语言: 英语 (en)
  • 数据集规模: 10K < n < 100K
  • 数据集类型: LLM智能体系统失败归因基准测试

数据集简介

Who&When Pro 是一个用于 LLM 智能体系统的失败归因基准测试数据集。每条轨迹记录包含单个或多个智能体的执行路径,其中在已知步骤中注入了一个真实的错误。标签记录了谁犯的错误、何时发生的、以及错误类型。被评估模型需要根据给定轨迹恢复这三个信息。

数据组成

数据划分 (Splits)

  • text: 工具使用类智能体轨迹
  • image: 图表/搜索类智能体轨迹
  • video: 视频智能体轨迹
  • image_gui: GUI智能体轨迹,包含完整的截图观测,涵盖框架包括 coact (OSWorld, 多智能体)、openai_cua (OSWorld)、agentoccamgemini (WebVoyager)

行结构 (Row Schema)

每条记录包含以下列:

列名 含义
id 唯一轨迹标识
framework 轨迹所属的智能体框架
benchmark 来源基准测试
task 原始任务:查询、参考答案、输入
trajectory 完整的智能体执行过程
ground_truth 标签:智能体、步骤、错误模式
extras 框架特定元数据

错误分类体系

包含 6 大类共 17 种错误模式:

  • 感知类 (Perception): 视觉误识别、空间定位错误
  • 推理类 (Reasoning): 幻觉、推理错误、数值错误、任务理解错误
  • 规划类 (Planning): 规划无效、目标漂移
  • 行动类 (Action): 工具参数错误、输出格式错误、过早终止、重复循环
  • 验证类 (Verification): 上下文丢失、验证不足
  • 协调类 (Coordination): 委派错误、沟通失败、过度依赖其他智能体

评估与使用

  • 数据集的评估工具包及评分流程位于 GitHub 仓库:whowhenpro/whowhen_pro
  • 相关学术引用信息详见论文《Who&When Pro: Can LLMs Really Attribute Failures in AI Agents?》(arXiv preprint arXiv:2607.09996)
搜集汇总
数据集介绍
whowhen_pro 数据集图片
构建方式
Who&When Pro 是一个针对大语言模型智能体系统失败归因的基准测试,精心构建了包含文本、图像、图像GUI和视频四种模态的智能体轨迹数据集。每条轨迹均源自单智能体或多智能体框架的真实运行记录,并在已知步骤中注入一个现实错误。数据集中每条数据都详细记录了任务信息、完整轨迹以及标注了错误主体、发生步骤和错误类型的真值标签。同时,数据集还提供了框架元数据,并经JSON格式封装,便于解析。
特点
该数据集具备高度的多样性和精细化标注,其错误分类体系涵盖感知、推理、规划、行动、验证与协调六大类,细分为17种错误模式,全面刻画了智能体可能的失误。尤为特别的是,图像GUI轨迹包含了完整的截图观察,视频轨迹则引用了帧文件,体现了多模态特性。此外,数据集规模介于10K至100K之间,覆盖多种智能体框架,为评估模型在不同情境下的失败归因能力提供了坚实基础。
使用方法
使用Who&When Pro时,研究者需从数据集中加载相应模态的JSONL文件,每条数据中的任务、轨迹、真值等字段需经json.loads解析。评估过程中,模型需要根据给定的轨迹,准确判断错误发生的智能体、步骤及错误类型。官方提供了配套的评估工具,包含各框架的渲染器和评分流程,可便捷地在GitHub上获取。该基准旨在推动对智能体系统失败机制的深入理解,提升错误归因的准确性。
背景与挑战
背景概述
Who&When Pro基准于2026年由Liu Jiale、Xi Huajun等研究者提出,旨在应对大型语言模型(LLM)代理系统在复杂任务中故障归因的挑战。随着LLM代理从单代理工具调用演进至多代理协作与多模态交互(如图像、视频、GUI操作),其故障溯源成为保障系统可靠性的关键。该基准通过注入17种错误模式于六类范畴(感知、推理、规划、行动、验证、协调),构建了覆盖文本、图像、视频及GUI代理的轨迹数据集,要求模型精确恢复错误的执行代理、发生步骤与错误类型,从而系统评估代理的自我诊断能力。此基准填补了代理系统故障归因评估的空白,为构建可解释、可修复的下一代代理提供了标准化测试平台。
当前挑战
Who&When Pro面临的核心挑战是多维故障归因的复杂性,即必须同时识别错误的执行者、发生时刻与类型,这远超传统单点错误检测。其数据构建需应对多代理轨迹中错误由协作失调与非直接因果引发的模糊性,且需在17种错误模式间保持均衡性与真实性。此外,评估需统一各类框架(如coact、openai_cua)的异构轨迹格式,并处理视觉与GUI上下文中的空间定位(如截图元素错位)与时间依赖错误(如重复循环),对模型的长程推理与跨模态理解提出严苛要求。该基准还需解决错误注入的自然性,避免人为痕迹导致模型利用伪特征,从而确保归因能力的真实反映。
常用场景
经典使用场景
在智能体系统日益复杂的当下,故障归因成为保障系统可靠性的关键环节。Who&When Pro数据集专为评估大语言模型智能体的故障归因能力而设计,其核心使用场景是作为基准测试平台,要求模型从给定的智能体轨迹中精准识别错误发生的责任主体、时间节点及错误类型。该数据集覆盖单智能体与多智能体框架,涵盖文本、图像、视频及GUI操作等多种模态,为研究者提供统一、标准的评估环境,以衡量模型在复杂动态场景下的诊断精度。
衍生相关工作
Who&When Pro的发布催生了系列后续研究。其完备的标注体系与评估工具链,激励了故障可解释性分析、归因模型改进以及跨模态智能体诊断等方向的新探索。研究者可基于其轨迹数据训练专门的故障检测器,或利用其评估框架对比不同架构的归因性能。此外,该数据集的错误分类法也为构建更细粒度的智能体行为分析模型提供了参考,促进了智能体自我反思机制与自动化错误修复策略的发展。
数据集最近研究
最新研究方向
Who&When Pro基准测试的推出标志着大语言模型智能体系统失效归因研究迈入新阶段,其创新性地将错误溯源细化为‘主体-步骤-类型’三元组,覆盖文本、图像、视频及GUI交互等多模态环境,并系统定义了感知、推理、规划、行动、验证与协调六大维度的17种错误模式。该数据集聚焦于多智能体协同与复杂工具调用场景下的故障诊断,为评估模型在真实动态任务中的自我监控与纠错能力提供了标准化框架。当前研究热点集中于利用该基准提升智能体的可解释性与鲁棒性,其发布有望推动更可靠、透明的自主系统设计,对智能体安全部署及人机协作具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务