ATBench
收藏资源简介:
ATBench 是一个用于评估智能体在现实、长期交互中的安全性的轨迹级基准数据集。该数据集包含 500 条标注的执行轨迹(250 条安全轨迹和 250 条不安全轨迹),涉及多轮交互(平均 8.97 轮)和 1,575 种独特工具。数据集提供了基于分类体系的细粒度安全标注,支持超越简单安全/不安全二元标签的精确风险归因和诊断。 数据集采用统一的三维安全分类体系,从风险来源(Risk Source)、行为失效模式(Failure Mode)和现实世界危害(Real-World Harm)三个正交维度组织风险。当前版本包含 8 个风险来源类别、14 个失效模式类别和 10 个现实世界危害类别。 每个样本代表一个完整的智能体执行轨迹,包含以下字段:tool_use(交互过程中可用的工具列表)、content(多轮对话和智能体执行轨迹)、conv_id(唯一轨迹标识符)、label(二元安全标签,0 表示安全,1 表示不安全)以及风险分类标签(risk_source、failure_mode、real_world_harm)。 该数据集适用于智能体安全性评估、风险诊断等研究场景,采用 Apache 2.0 许可协议发布。
ATBench is a trajectory-level benchmark dataset for evaluating the safety of AI Agents in real-world and long-term interactions. This dataset contains 500 annotated execution trajectories (250 safe trajectories and 250 unsafe trajectories), involving multi-turn interactions (averaging 8.97 turns) and 1,575 unique tools. The dataset provides fine-grained safety annotations based on a taxonomy, enabling precise risk attribution and diagnosis beyond simple binary safe/unsafe labels. The dataset adopts a unified three-dimensional safety taxonomy, which organizes risks from three orthogonal dimensions: Risk Source, Failure Mode, and Real-World Harm. The current version includes 8 risk source categories, 14 failure mode categories, and 10 real-world harm categories. Each sample represents a complete agent execution trajectory, containing the following fields: tool_use (list of tools available during interaction), content (multi-turn conversations and agent execution trajectories), conv_id (unique trajectory identifier), label (binary safety label, where 0 indicates safe and 1 indicates unsafe), and risk classification tags (risk_source, failure_mode, real_world_harm). This dataset is applicable to research scenarios such as agent safety evaluation and risk diagnosis, and is released under the Apache 2.0 license.
ATBench数据集概述
数据集简介
ATBench是一个用于评估智能体在现实、长程交互中安全性的轨迹级基准。它包含500条带标注的执行轨迹(250条安全/250条不安全),涉及多轮交互(平均8.97轮)和1,575个独特工具。该基准提供基于分类体系的细粒度安全标注,支持超越二元安全/不安全标签的精确风险归因和诊断。
数据集规模与构成
- 总轨迹数:500
- 安全轨迹数:250
- 不安全轨迹数:250
- 交互类型:使用工具的多轮智能体执行
标注信息
每个样本对应一条完整的智能体执行轨迹。
每条轨迹均标注有轨迹级二元安全标签(label),其中0表示安全轨迹,1表示不安全轨迹。
若在任意时间点观察到任何不安全行为,则该轨迹被标注为不安全。
否则标注为安全,包括智能体正确识别并缓解风险(例如拒绝恶意请求)的情况。
安全分类体系
ATBench采用一个统一的、三维的智能体系统安全分类体系。该体系沿三个正交轴组织风险:
- 风险来源:风险在智能体循环中的起源位置,例如用户输入、环境观察、外部工具或API,或智能体的内部推理。
- 故障模式:不安全行为如何实现,包括有缺陷的规划、不安全的工具使用、指令优先级混淆或不安全内容生成。
- 现实世界危害:不安全行为造成的现实世界影响,例如隐私泄露、财务损失、人身伤害、安全损害或更广泛的社会或心理危害。
类别覆盖范围
在当前版本中,分类体系包含:
- 8个风险来源类别
- 14个故障模式类别
- 10个现实世界危害类别
注意:所有样本均提供细粒度的分类标签以保持模式一致性,但它们仅用于不安全轨迹。
数据结构
每个数据集样本代表一条完整的智能体执行轨迹,包含以下字段:
tool_use:交互期间智能体可用的工具列表content:多轮对话和智能体执行轨迹conv_id:每条轨迹的唯一标识符label:二元安全标签(0 = 安全,1 = 不安全)risk_source:风险来源类别failure_mode:故障模式类别real_world_harm:现实世界危害类别
许可信息
本数据集根据Apache 2.0许可证发布。
引用
如果在研究中使用ATBench,请引用: bibtex @article{, title={AgentGuard: Trajectory-Level Risk Assessment for Autonomous Agents}, author={Anonymous}, year={2025} }




