遇见数据集

AI45Research/2026_summer_camp_teseset

收藏
Hugging Face2026-07-03 更新2026-07-22 收录
官方服务:

资源简介:

本仓库提供AgentDoG-Lite:基于AgentDoG 1.5的轻量级Agent安全诊断挑战的测试数据,用于评估参赛方案在Agent轨迹级安全判断任务上的表现。与传统只判断单轮输入或最终回复是否安全的评测不同,本测试集关注完整Agent执行轨迹中的安全风险。每条样本包含一段多轮Agent轨迹,可能涉及用户请求、工具描述、工具调用、工具返回、环境反馈和最终回复。参赛系统需要根据完整轨迹判断Agent是否执行了不安全行为或不安全决策模式。本测试集主要用于评测参赛者基于Qwen3.5-0.8B构建的安全判断系统,适用于单人赛的training-free harness方法和团队赛的基于Qwen3.5-0.8B微调后的模型。核心输出为二分类安全判断,包括safe或unsafe。本数据集不应用于训练或微调模型、few-shot示例选择、prompt搜索或测试集调参、生成真实攻击流程或执行危险命令,以及作为真实部署环境中的唯一安全判断依据。

This repository provides AgentDoG-Lite: test data for the lightweight Agent security diagnosis challenge based on AgentDoG 1.5, which is used to evaluate the performance of participating solutions on the Agent trajectory-level security judgment task. Unlike traditional evaluations that only judge whether single-round inputs or final responses are safe, this test set focuses on security risks in the complete execution trajectory of Agents. Each sample contains a multi-round Agent trajectory, which may involve user requests, tool descriptions, tool calls, tool returns, environmental feedback, and final responses. Participating systems are required to judge whether the Agent has executed unsafe behaviors or unsafe decision-making patterns based on the complete trajectory. This test set is mainly used to evaluate the security judgment systems built by participants based on Qwen3.5-0.8B, and is applicable to the training-free harness method for individual competitions and the fine-tuned models based on Qwen3.5-0.8B for team competitions. The core output is binary classification security judgment, including safe or unsafe. This dataset must not be used for model training or fine-tuning, few-shot example selection, prompt search or test set tuning, generating real attack processes or executing dangerous commands, or serving as the sole security judgment basis in real deployment environments.

提供机构:
AI45Research
搜集汇总
数据集介绍
AI45Research/2026_summer_camp_teseset 数据集图片
构建方式
本数据集源自AgentDoG 1.5的轻量级版本,专注于Agent轨迹级安全判断任务。与传统仅关注单轮输入或最终回复安全性的评测不同,该数据集精心构建了包含多轮Agent轨迹的样本,每条样本涵盖用户请求、工具描述、工具调用、工具返回、环境反馈及最终回复等完整环节。参赛系统需基于整条轨迹判断Agent是否执行了不安全行为或决策模式,以此评估其在真实复杂场景下的安全风险识别能力。
特点
数据集的核心特点在于其轨迹级的安全评估视角,突破了传统单轮或回复级评测的局限,能够更全面地捕捉多轮交互中累积或隐含的安全威胁。每个样本均嵌入丰富的上下文信息,如工具交互与环境反馈,使得安全判断需考虑行为链条的连贯性。此外,数据集明确限定为测试用途,禁止用于训练、微调或调参,确保评估结果的公正性与可比性。
使用方法
使用本数据集时,参赛者需基于Qwen3.5-0.8B构建安全判断系统,对于单人赛采用training-free harness方法,团队赛则对模型进行微调。系统需对每条样本输出二分类判断,格式为{"judgment": "safe"}或{"judgment": "unsafe"}。数据集仅供评测,不得用于模型训练、few-shot示例选择或prompt搜索,亦不可作为实际部署中的唯一安全依据,以避免误用风险。
背景与挑战
背景概述
随着大语言模型(LLM)在自主智能体系统中的广泛应用,Agent面临的安全风险日益凸显。传统安全评测方法往往局限于单轮输入或最终回复层面,难以捕捉多轮交互中逐渐演化的安全威胁。在此背景下,2026年夏季训练营赛事团队推出了AgentDoG-Lite测试集,旨在推动Agent轨迹级安全判断技术的发展。该数据集由赛事组织者基于AgentDoG 1.5版本精炼而成,聚焦于多轮Agent执行轨迹中的不安全行为与决策模式,为参赛者提供了标准化的评估基准。作为赛事核心评测数据,该测试集要求参与者基于Qwen3.5-0.8B模型构建安全判断系统,分为training-free方法和微调方法两种赛道,对Agent安全领域的研究范式产生了深远影响。
当前挑战
AgentDoG-Lite测试集所面临的挑战首先体现在领域问题层面:传统安全评测无法有效识别多轮执行轨迹中隐藏的安全风险,例如工具误调用、环境反馈操控或决策链中的非预期模式。该数据集要求系统在不依赖单轮语义异常检测的前提下,对复杂时序行为进行准确的安全判定,这对模型的上下文理解与推理能力提出了极高要求。此外,构建过程中亦存在显著挑战,包括确保轨迹样本覆盖多样的攻击向量与正常操作边界、避免数据泄露导致评测失效,以及严格控制数据集不得用于训练或调参,以维护评测的公平性与真实性。这些挑战共同定义了当前Agent安全评测的前沿方向。
常用场景
经典使用场景
该数据集的核心应用场景聚焦于Agent轨迹级安全诊断,要求系统对完整的多轮Agent执行轨迹进行二分类安全判断。与传统仅分析单轮输入或最终回复是否安全的评测范式不同,本测试集涵盖用户请求、工具调用与返回、环境反馈及最终回复等多元信息,旨在检验模型能否从错综复杂的交互过程中精准识别不安全行为或决策模式。这一场景对理解跨步骤的恶意意图、隐蔽攻击及逻辑漏洞提出了更高要求,推动了安全评测从“点式”向“轨迹式”的范式跃迁。
实际应用
在实际部署中,该数据集可用于评估基于小模型(如Qwen3.5-0.8B)构建的轻量级安全判断系统,适用于资源受限或低延迟场景下的Agent安全防护。例如,可为智能助手、自动化工具链或机器人工作流配备实时轨迹安全监控模块,在无需大规模计算投入的条件下实现入侵检测与违规行为预警。此外,它亦可用作安全审计框架的基准测试,辅助开发者在Agent上线前排查潜在风险,降低误判与漏报率,从而在金融、医疗等高风险领域保障人机协作的安全稳定性。
衍生相关工作
该数据集衍生了多种经典工作方向:一是training-free harness方法,即设计无需额外训练的轻量级安全判断管线,通过规则、对比或记忆机制直接评估轨迹安全性;二是基于小模型微调的安全诊断系统,探索如何利用Qwen3.5-0.8B等紧凑架构在有限计算下捕捉复杂威胁模式;三是发展轨迹级安全检测理论,提出跨步骤风险累积、意图推理与行为建模等新范式。这些工作不仅丰富了Agent安全评测的工具箱,也为未来通用智能体系统的可信设计提供了坚实起点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务