遇见数据集

amazon-agi/AdversarialArena_Nova_AI_Challenge_Trusted_AI_Dataset

收藏
Hugging Face2026-06-29 更新2026-07-22 收录
官方服务:

资源简介:

该数据集名为“对抗竞技场:可信AI挑战数据集”,包含通过对抗竞技场框架生成的多轮对抗对话。该框架是一个交互式竞赛,攻击者机器人试图从防御者机器人处诱导出不安全的代码或网络攻击辅助。数据集收集自亚马逊Nova AI挑战赛——可信AI项目,专注于大型语言模型(LLM)的网络安全对齐。数据集包含25,600个会话,总计250,906个对话轮次,平均每个会话9.8轮,最大轮次为10轮。数据生成涉及10个学术团队(5个攻击者、5个防御者)之间的多轮锦标赛,每个匹配包括自动多轮对话:攻击者试图诱导出易受攻击的代码、恶意代码或网络攻击辅助;防御者旨在提供有用的编码响应,同时拒绝不安全请求。对话限制在最多10轮。数据集经过两步评估:使用静态分析检测易受攻击代码,并由3名网络安全专家人工标注安全事件。数据集结构包括会话元数据、代码与漏洞信息、标注信息和对话内容。该数据集用于安全研究目的,包含可能涉及恶意代码的对抗性提示,需负责任使用。

This dataset, named Adversarial Arena: Trusted AI Challenge Dataset, contains multi-turn adversarial conversations generated through the Adversarial Arena framework, an interactive competition where attacker bots attempt to elicit unsafe code or cyberattack assistance from defender bots. It was collected during the Amazon Nova AI Challenge – Trusted AI, focused on cybersecurity alignment of LLMs. The dataset includes 25,600 sessions with a total of 250,906 conversation turns, averaging 9.8 turns per session and a maximum of 10 turns. Data generation involved tournaments among 10 academic teams (5 attackers, 5 defenders), with automated multi-turn conversations: attackers tried to elicit vulnerable code, malicious code, or cyberattack assistance; defenders aimed to provide helpful coding responses while refusing unsafe requests. Conversations were limited to a maximum of 10 turns. Evaluation was conducted through a two-step process: vulnerable code detection using static analysis and security event detection by a panel of 3 expert human annotators. The dataset structure comprises session metadata, code and vulnerability information, annotation information, and conversation content. It is intended for safety research purposes and contains adversarial prompts that may reference malicious code, requiring responsible use.

提供机构:
amazon-agi
搜集汇总
数据集介绍
amazon-agi/AdversarialArena_Nova_AI_Challenge_Trusted_AI_Dataset 数据集图片
构建方式
该数据集源自Amazon Nova AI挑战赛中的“可信AI”赛道,旨在推动大语言模型在网络安全对齐方面的研究。数据通过Adversarial Arena框架生成,该框架设计为一种交互式竞赛,由多个攻击方与防御方机器人进行多轮自动化对话。竞赛汇集了来自美国与顶尖欧洲大学的10支学术团队,分为5组攻击方与5组防御方,历经4轮正式锦标赛(T01至T04),共计生成25,600个会话、超过25万轮对话。攻击方致力于诱导防御方生成存在漏洞的代码或提供网络攻击协助,防御方则需在提供有用编码回复的同时拒绝不安全请求。每轮对话限制为最多10轮(5组邻接对),团队在轮次间不断迭代优化其策略,最终构建出这一高质量的对齐基准数据集。
特点
该数据集具有鲜明的多维特征。其一,它专为网络安全对齐研究设计,涵盖丰富的多轮对抗性对话,真实模拟了攻击者试图突破安全边界的场景。其二,数据标注过程严谨,采用两阶段评估机制:首先利用Amazon CodeGuru进行静态分析,检测防御方回复中Python代码的安全漏洞并映射至CWE;随后由3名网络安全专家组成的人工标注小组,通过多数投票对恶意代码生成或攻击协助行为进行最终判别。此外,数据集包含详尽的元数据,如会话标识、对战队伍、锦标赛轮次、代码与漏洞信息(漏洞标题、代码片段及严重程度)以及标注细节,为研究者提供了多维度分析的基础,特别适用于探索大模型的安全边界与对齐策略。
使用方法
研究人员可通过HuggingFace的datasets库便捷加载该数据集,使用`load_dataset("amazon-agi/AdversarialArena_Nova_AI_Challenge_Trusted_AI_Dataset")`命令即可获取训练数据。每个会话记录均以结构化格式存储,包含会话元数据(如攻击者与防御者队伍、锦标赛轮次)、对话历史(按顺序排列的角色、消息与时间戳)、代码与漏洞检测结果以及人工标注信息。研究者可遍历`conversation`字段中的多轮交互,提取攻击与防御策略模式,或利用`has_vulns`、`combined_vulns_str`等字段进行漏洞检测模型的训练与评估。值得注意的是,该数据集仅限用于安全研究目的,因其包含了可能被滥用的恶意提示内容,使用时应遵循CC BY-NC-SA 4.0许可协议并遵守相关伦理规范。
背景与挑战
背景概述
随着大语言模型在代码生成和软件辅助开发中的广泛应用,其安全性对齐问题日益突出。为应对这一挑战,由亚马逊研究团队主导,联合多所美国及欧洲顶尖大学,于2025年至2026年间发起了Amazon Nova AI挑战赛,聚焦于可信AI主题。该挑战赛的核心研究问题是如何在保证模型提供有用编码响应的同时,坚决拒绝生成含有漏洞、恶意代码或支持网络攻击的请求。为此,研究团队创新性地构建了AdversarialArena框架,通过多轮攻防对抗竞赛自动化生成多轮对话数据。该数据集包含25,600次完整会话及超过25万轮对话,为评估和提升大语言模型的网络安全对齐能力提供了大规模、高质量且经过专家标注的基准资源,对推动安全可靠的AI辅助软件开发研究具有重要影响力。
当前挑战
该数据集聚焦于大语言模型在网络安全对齐领域的核心挑战:即模型需要在提供有用编码辅助与拒绝恶意请求之间取得精准平衡。具体而言,数据集中攻击者机器人的目标是诱使防御者机器人生成脆弱代码、恶意代码或提供网络攻击协助,而防御者则需在复杂多轮对话中持续识别并隔离这些恶意意图。构建过程中面临两大挑战:一是如何设计自动化攻防竞赛机制以生成高度真实且多样化的对抗性对话,需确保攻击策略不断演化而防御策略也随之迭代;二是对会话中代码安全性的评估,需结合静态分析工具(如Amazon CodeGuru)识别漏洞,并依赖网络安全专家进行人工标注,以鉴别是否涉及恶意代码生成或网络攻击协助,这一过程需协调多轮竞赛与多学科团队协作,保证标注的一致性与可靠性。
常用场景
经典使用场景
AdversarialArena_Nova_AI_Challenge_Trusted_AI_Dataset 是评估与增强大语言模型在网络安全场景下对齐能力的经典基准。该数据集通过多轮对抗对话框架生成,包含超过25,000个完整会话,每轮最长可达10个交互回合。研究者可借助攻击者与防御者之间的博弈记录,系统性地测试模型在面对精心设计的恶意提示时,是否能够坚守安全边界、拒绝生成漏洞代码或提供网络攻击协助。这一场景尤其适合用于验证LLM在真实对抗环境中的鲁棒性与可靠性,是红队测试和安全性评估研究中不可或缺的数据资源。
衍生相关工作
该数据集衍生出一系列具有理论深度与实践价值的后续工作。一方面,研究者基于其多轮对抗结构提出了分层防御框架,如动态拒绝阈值调整策略和上下文敏感性安全过滤器,显著降低了模型在长程对话中被攻破的概率。另一方面,数据集中标注的CWE映射关系催生了针对代码生成模型的脆弱性预测模型,能够提前识别可能引发安全风险的提示模式。此外,攻击者团队在锦标赛中迭代优化的策略库被整理为公开的对抗攻击基准,推动了对抗性提示自动化生成方法的发展。这些工作共同构成了一个围绕对抗性交互安全评估的完整研究生态。
数据集最近研究
最新研究方向
该数据集围绕大语言模型在网络安全对齐领域的前沿挑战,构建了多轮对抗性对话的竞技框架,聚焦于攻击者与防御者之间的动态博弈。研究重点在于通过自动化竞标赛模式,系统性地探测和评估模型在面对恶意代码生成或网络攻击协助请求时的安全边界。结合静态代码分析与专家标注的双重验证机制,该数据集为红蓝对抗场景下的LLM鲁棒性研究提供了高保真度的训练与评测资源,其收录的逾2.5万条会话反映了团队间策略迭代的演化路径,对于推动可信AI在软件开发全生命周期中的安全对齐实践具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务