ATBench
收藏资源简介:
ATBench是由上海人工智能实验室构建的细粒度AI智能体安全基准数据集,包含2157个工具和4486轮交互数据。该数据集通过三维风险分类体系(风险来源、失败模式、现实危害)系统化标注智能体轨迹中的安全隐患,数据来源于模拟环境中的多轮工具调用和用户交互。数据集采用合成生成与人工标注相结合的方式构建,旨在解决复杂交互场景下智能体行为安全评估与风险溯源问题,为AI安全护栏系统提供标准化测试平台。
ATBench is a fine-grained AI Agent safety benchmark dataset developed by Shanghai AI Laboratory. It includes 2157 tools and 4486 rounds of interactive data. This dataset systematically annotates security hazards within agent trajectories via a three-dimensional risk classification framework encompassing risk sources, failure modes, and real-world harms. The data is collected from multi-round tool invocations and user interactions in simulated environments. Constructed by combining synthetic generation and manual annotation, ATBench is designed to tackle the challenges of AI agent behavior safety evaluation and risk traceability in complex interaction scenarios, and serve as a standardized test platform for AI safety guardrail systems.
AgentDoG 数据集概述
数据集基本信息
- 数据集名称:ATBench (Agent Trajectory Safety and Security Benchmark)
- 发布平台:Hugging Face Datasets
- 下载地址:https://huggingface.co/datasets/AI45Research/ATBench
- 关联项目:AgentDoG(一个用于自主代理的风险感知评估与防护框架)
数据集规模与构成
- 轨迹数量:500 条轨迹(250 条安全 / 250 条不安全)
- 交互轮次:平均每条轨迹约 8.97 轮,总计约 4486 次轮次交互
- 工具库:
- 轨迹中出现的独特工具:1575 个
- 独立的未见工具库:包含 2292 个工具定义(与训练工具无重叠)
标注信息
- 二元标签:每条轨迹标注为
safe(安全)或unsafe(不安全) - 细粒度标签:对于被标注为
unsafe的轨迹,额外提供以下三维标签:- 风险来源:威胁在代理循环中的起源位置(例如,用户输入、环境观察、外部工具/API、代理内部推理)
- 失效模式:不安全行为的具体表现形式(例如,有缺陷的规划、不安全的工具使用、指令优先级混淆、不安全内容生成)
- 现实世界危害:造成的现实影响(例如,隐私泄露、财务损失、人身伤害、安全漏洞、社会/心理危害)
数据集目的与应用
- 核心目的:用于轨迹级别的安全评估和细粒度风险诊断。
- 应用场景:
- 作为评估自主代理安全性的基准。
- 用于训练和评估如 AgentDoG 这样的轨迹级风险分类器或防护模块。
关联模型与资源
- 技术报告:https://arxiv.org/pdf/2601.18491
- 预训练模型:基于多个基础模型(Qwen3-4B-Instruct-2507, Qwen2.5-7B-Instruct, Llama3.1-8B-Instruct)微调的 AgentDoG 系列模型,用于轨迹安全评估与风险诊断。
- 模型下载:可通过 Hugging Face 或 ModelScope 平台搜索以
AgentDoG-开名的检查点获取。

- 1AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security上海人工智能实验室 · 2026年



