遇见数据集

agent-trajectory-sentinel

收藏
Hugging Face2026-08-07 更新2026-08-08 收录
官方服务:

资源简介:

AgentTrajectorySentinel是一个用于agent故障检测的数据集,包含2823个agent执行轨迹(episodes),覆盖25个不同的语料库(corpora)。每个轨迹由步骤级遥测数据组成,包括文本、动作、延迟、令牌对数概率等。数据集旨在用于拟合和评估单类监测器,实现实时故障检测。数据集中包含770个使用真实工具(如arXiv、Wikipedia、SQL、Python)的轨迹,其余使用确定性模拟工具。轨迹由多种模型生成,包括qwen2.5:7b(1890个)、llama3.1:8b(433个)、qwen2.5:3b(357个)和gemini-2.5-flash(143个)。数据生成分为注入式(在已知步骤注入故障)和有机式(自然发生的故障,后通过脚本标记)。故障类别包括goal_drift、looping、tool_cascade、context_corruption、grounding_loss、rate_limit、timeout、malformed_json、wrong_document等。数据集字段包括主键uid、episode_id、corpus、n_steps、steps(JSON格式的轨迹)、metadata(JSON格式的元数据)、model、failure_class、tau(故障发生步骤)、T(步骤数)、has_logprobs等。许可方面,源代码和格式采用MIT许可,但模型输出受各自模型许可约束(如Llama 3.1 Community License、Gemini API条款)。数据集主要用于评估监测器,不适用于训练agent。

AgentTrajectorySentinel is a dataset for agent failure detection, containing 2,823 agent execution trajectories (episodes) covering 25 different corpora. Each trajectory consists of step-level telemetry data, including text, actions, latency, token log probabilities, etc. The dataset is designed for fitting and evaluating one-class monitors to achieve real-time failure detection. It includes 770 trajectories using real tools (e.g., arXiv, Wikipedia, SQL, Python) and the rest using deterministic simulated tools. Trajectories are generated by multiple models: qwen2.5:7b (1,890), llama3.1:8b (433), qwen2.5:3b (357), and gemini-2.5-flash (143). Data generation is divided into injected (faults injected at known steps) and organic (naturally occurring faults later labeled by scripts). Failure categories include goal_drift, looping, tool_cascade, context_corruption, grounding_loss, rate_limit, timeout, malformed_json, wrong_document, etc. Dataset fields include primary key uid, episode_id, corpus, n_steps, steps (trajectory in JSON), metadata (metadata in JSON), model, failure_class, tau (step of failure occurrence), T (number of steps), has_logprobs, etc. License: source code and format under MIT, but model outputs are subject to their respective model licenses (e.g., Llama 3.1 Community License, Gemini API terms). The dataset is primarily used for evaluating monitors, not for training agents.

创建时间:
2026-08-01
原始信息汇总

AgentTrajectorySentinel 数据集详情

数据集概览

  • 名称:AgentTrajectorySentinel agent-failure traces
  • 规模:1K < n < 10K 条记录
  • 任务类型:时间序列预测(time-series-forecasting)
  • 许可证:混合许可(mixed-see-licensing),详见 LICENSING.md

核心内容

该数据集包含 2,823 条 agent episodes,分布在 25 个 corpora 中,每条 episode 记录了 agent 在完成任务过程中的逐步轨迹(step-level telemetry),用于拟合和评估单类监控器(one-class monitors)以进行实时失败检测。

数据构成

按模型划分的 episodes 数量

模型 episodes 数量
qwen2.5:7b 1,890
llama3.1:8b 433
qwen2.5:3b 357
gemini-2.5-flash 143

数据特点

  • 770 条 episodes 使用真实工具(arXiv、Wikipedia、web fetch、SQL、Python),其余使用确定性 mock-tool 套件
  • 数据分为两种采集模式:
    • 注入式(Injected):在已知步骤 tau 处由工具层注入故障,故障类别包括 goal_drift、looping、tool_cascade、context_corruption、grounding_loss 等
    • 有机式(Organic):无注入,事后通过脚本根据可计算的真实结果客观标注(healthy、arithmetic_error、hallucinated、incomplete、other)

数据字段说明

字段 含义
uid 主键,格式为 corpus/episode_id
episode_id 在 corpus 内的 ID,跨 corpus 不唯一
corpus 所属 corpus 名称
n_steps 步骤数,同 T
steps JSON 字符串,轨迹内容
metadata JSON 字符串,除 typed columns 外的所有 manifest 字段
model 产生该轨迹的 agent 模型
failure_class 健康时为 null,否则为注入的故障类别
tau 故障发生的起始步骤(0-indexed),健康时为 null
T 步骤总数
has_logprobs u(不确定性)通道是否填充
steps 轨迹:每步的文本、动作、耗时、工具事件等

数据加载方式

python import json from datasets import load_dataset

ds = load_dataset("sunnydubey1111/agent-trajectory-sentinel", split="train") row = ds[0] steps = json.loads(row["steps"]) # 轨迹 meta = json.loads(row["metadata"]) # corpus 特定字段

steps 和 metadata 以 JSON 字符串形式存储,而非嵌套列,因为各 corpus 记录的字段不一致。数据文件的权威布局为 traces/<corpus>/,每个 episode 一个 JSONL 文件,附带 manifest.json。

关键统计与说明

  • 采集设置:本地模型通过 Ollama 服务,demo 和 serving-arm corpus 使用 temperature 0.2,failure-provoking organic arms 使用 0.9;Gemini corpora 使用 gemini-2.5-flash 免费层级,缺少 response_logprobs
  • 拒绝记录:未被接受门控通过的 episodes 会记录在对应 corpus 的 rejected.json 中,12 个 corpus 记录有拒绝数据,总拒绝率 24.9%(范围 1.2% 至 55.4%)
  • 数据完整性:每个已提交文件均通过 BASELINE_MANIFEST.json 进行哈希校验

许可与使用限制

  • MIT license 覆盖项目自行编写的代码、trace 格式、结果表格和数据卡
  • qwen2.5 系列(2,247 episodes):Apache-2.0,无附加分发条件
  • llama3.1:8b(433 episodes):Llama 3.1 Community License,使用需遵守 许可证可接受使用政策
  • gemini-2.5-flash(共 330 episodes,其中 143 条在数据集中):受 Google Gemini API 条款约束,禁止用于开发与 Gemini API 或 Google AI Studio 竞争的服务
  • 外部基准 corpora(AFTraj-2K、ATBench)未在此分发;Cassette 重放的工具结果中,Open-Meteo 数据为 CC BY 4.0,Wikipedia 摘要为 CC BY-SA 4.0

预期用途与局限

  • 用于评估监控器(monitors),不用于训练 agent
  • 任务多样性有限:仅包含 mock booking 任务和 real-tool research 任务
  • 注入式故障的 onset 与有机故障的 onset 存在差异
  • 无个人数据,任务为合成或基于公开来源(arXiv、Wikipedia、公开仓库)

相关资源

  • 论文:https://arxiv.org/abs/2608.02464
  • 代码与评估框架:https://github.com/sunnydubey1111/agent-trajectory-sentinel
  • 方法演示视频:https://youtu.be/a05n_000klE?t=0
搜集汇总
数据集介绍
agent-trajectory-sentinel 数据集图片
构建方式
该数据集精心构建了2,823个智能体执行轨迹,跨越25个语料库,覆盖多种模型与工具环境。其构建方式分为注入式与有机式两类:注入式通过在已知步骤精确注入故障,确保地面truth的准确性;有机式则无干预地记录模型自然产生的失败,并通过脚本客观标注。每个轨迹均以JSONL格式存储,包含逐步遥测数据,如文本、动作、延迟及令牌对数概率,且保留拒绝记录以透明化数据筛选过程。
使用方法
使用者可通过Hugging Face的datasets库轻松加载数据,其中steps与metadata字段以JSON字符串形式存储,以灵活应对各语料库的异构字段。建议依据uid键进行跨语料库的数据关联,并参考数据卡中各语料库的用途说明(如健康基线、故障注入、模型对比等)进行子集选择。该数据集专为训练与评估实时单类监控器设计,而非训练智能体本身,使用时需注意其任务多样性的局限及许可证条款,特别是对于Gemini生成的轨迹应遵守特定使用限制。
背景与挑战
背景概述
AgentTrajectorySentinel数据集由sunnydubey1111等研究人员于近期创建,旨在解决大语言模型(LLM)代理在复杂任务执行中出现的故障检测问题。该数据集包含2,823条代理执行轨迹,跨越25个语料库,涵盖多种模型(如Qwen、Llama、Gemini)和真实工具调用,为开发实时故障监控系统提供了基准。其核心研究问题在于如何通过步骤级遥测数据(如延迟、token对数概率、工具调用结构)实现异常检测,从而提升代理系统的可靠性与可观测性。该数据集已发表于arXiv(2608.02464),并配套开源评估框架,对LLM代理的运维监控领域具有重要影响力,推动了从反应式错误处理向主动故障预测的范式转变。
当前挑战
该数据集面临的挑战包括:首先,任务多样性有限,仅涵盖模拟预订和真实研究两类任务,限制了检测模型在不同场景下的泛化能力;其次,注入式故障(如意图漂移、循环、上下文损坏)与自然发生的故障在分布上存在差异,增加了模型在真实部署中的适用难度;构建过程中,不同语料库的数据格式不一致(如字段差异、JSON字符串存储),迫使设计灵活的存储方案,且部分模型(如Gemini)因API限制无法获取logprobs,仅能使用有限通道;此外,数据收集的拒绝率不均(从1.2%到55.4%),表明数据质量控制的复杂性,以及模型输出版权和许可条件(如Llama和Gemini)对数据再分发的影响,均构成关键挑战。
常用场景
经典使用场景
该数据集为大规模语言模型代理系统提供了一套结构化的智能体轨迹与逐步遥测数据,其经典用途在于训练与评估一类异常检测模型,专门用于实时失败监测。研究者可借助其25个语料库中的2,823条完整轨迹,覆盖多种代理架构与模型规模,精准刻画正常与异常行为的时序特征。尤其强调的是,注入与有机两种采集机制相结合,既提供了精确的故障起始点标注,又包含了自然发生的失败样例,这使得数据集成为构建鲁棒性监测器的理想基准。
解决学术问题
该数据集针对大语言模型代理在复杂任务执行中高发且难以预测的失败问题,提供了系统化的解决方案。它为学术研究提供了可复现的实验平台,解决了此前缺乏细粒度、带标签的代理失败轨迹的困境。通过区分注入故障与有机故障,数据集支持研究者在精确控制条件下探究模型失效机制,同时利用自然发生的错误评估检测方法的实际效用。其多语料库、多模型、多温度采样的设计,有效支持了关于监测器可迁移性、温度敏感性及故障检测通用性的深入探索,显著推进了代理观测性领域的实证研究。
实际应用
在实际应用层面,该数据集直接服务于智能体生产部署中的实时监控与故障干预系统。基于其轨迹数据训练的监测模型,可嵌入代理执行流水线,通过分析步骤级遥测信号(如熵值、工具调用结构、嵌入漂移)即时识别目标漂移、循环执行、工具级联失败等异常状态,并触发自动修复机制。数据集涵盖本地模型与云端API模型的不同部署场景,不仅兼容资源受限的边缘环境,也适配大规模云原生代理服务。其无个人信息且基于合成或公共源的任务设计,降低了实际部署中的隐私合规风险,为运维团队提供了安全可靠的智能体可观测性基础。
数据集最近研究
最新研究方向
AgentTrajectorySentinel作为大规模多语料库智能体轨迹监测数据集,其前沿研究方向聚焦于利用逐步级遥测数据训练单类异常检测器,以实现对LLM智能体运行故障的实时识别与干预。该数据集集成了2823条轨迹,覆盖注入式与有机式故障,支持跨模型、跨任务场景的泛化性研究,推动了智能体可观测性与鲁棒性评估的标准化。结合当前智能体应用广泛部署的趋势,该工作为构建自主监控与自愈机制提供了关键基准,对提升AI系统的可靠性与可信度具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务