遇见数据集

llm-redteam-corpus-taxonomy

收藏
github2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

一个用于LLM红队研究和评估的活体聚合语料库+跨框架分类法,公开来源、许可证清晰、季度更新。它收集了12个公开的LLM红队/安全数据集,统一为单一模式,包括去重、PII掩码和来源跟踪,并提供核心(允许商业使用)和扩展(非商业)许可证版本。

This is a living aggregated corpus and cross-framework taxonomy designed for LLM red teaming research and evaluation. It is publicly sourced, has clear licensing terms, and undergoes quarterly updates. It collects 12 publicly available LLM red teaming/security datasets, unifies them into a single standard schema, and includes deduplication, PII masking, and source tracking capabilities. Two license versions are provided: the Core version (permitting commercial use) and the Extended version (for non-commercial use only).

创建时间:
2026-07-02
原始信息汇总

数据集概述:llm-redteam-corpus-taxonomy

这是一个动态聚合的语料库与跨框架分类体系,专为LLM红队研究和安全评估设计。数据来源公开,许可证清晰,按季度更新。

核心内容

  • 语料库(第一阶段):整合了12个公开的LLM红队/安全数据集,统一为单一规范格式(Schema),并进行了去重、PII掩码和溯源记录。
    • 数据集按许可证分为两个子集:
      • core(核心):采用宽松许可证(如MIT, Apache-2.0, CC-BY-4.0),可用于商业用途。
      • extended(扩展):采用非商业许可证(如CC-BY-NC-4.0, CC-BY-NC-SA-4.0),仅限研究/非商业用途。
  • 跨框架分类体系(第二阶段,预计2026年第四季度):将提供OWASP LLM Top 10 / MITRE ATLAS / NIST AI RMF / EU AI Act / ISO 42001 / KISA AI / CSA AI Safety这7个框架与语料库提示的双向映射。
  • 动态更新:按季度发布(版本号格式:vYYYY.QX),并附带更新日志。

数据集版本与规模

版本 描述 数据行数 许可证
-full 完整版(12个来源去重合并) 64,458 CC-BY-NC-SA-4.0
-core 商业许可子集 44,681 CC-BY-4.0
-extended 非商业许可子集 26,748 CC-BY-NC-SA-4.0
  • 数据行数测量于2026-07-03(已完成PII掩码和去重)。
  • 完整版是12个来源去重合并后的结果。核心版是所有采用商业友好许可证的子集。
  • 语料库中约83% 的数据来自Anthropic HH-RLHF数据集的红队部分(第一轮人工对话)。

数据来源与归属

数据集整合了12个公开来源,其许可证和状态如下:

  • ✅ core(核心来源,9个)
    1. AdvBench (llm-attacks) | MIT
    2. HarmBench (centerforaisafety) | MIT
    3. JailbreakBench | MIT
    4. TDC 2023 Red-Teaming | MIT
    5. ForbiddenQuestionSet (verazuo/TrustAIRLab) | MIT
    6. Do-Not-Answer (LibrAI) | Apache-2.0
    7. HarmfulQA (declare-lab) | Apache-2.0
    8. AART (walledai) | CC-BY-4.0
    9. Anthropic HH-RLHF (red-team split) | MIT
  • ✅ extended(扩展来源,3个): 10. BeaverTails (PKU-Alignment) | CC-BY-NC-4.0 11. ALERT (Babelscape) | CC-BY-NC-SA-4.0 12. LMSYS Toxic-Chat | CC-BY-NC-4.0
  • ⊘ 排除(Excluded)
    • StrongREJECT:因混合了无许可证的问题而被排除。
    • WMDP-cyber:因涉及双重用途(dual-use)而被排除。
    • Anthropic Persuasion:因不属于攻击提示(attack prompts)而被排除。
  • ⏸ 待定(Pending)
    • MaliciousInstruct:许可证待验证。
    • Korean UnSmile:许可证待验证。

数据格式与使用

发展路线图

  • 第一阶段(2026年第三季度):发布语料库核心版和扩展版、Hugging Face发布、arXiv预印本、Zenodo DOI、持续集成驱动的季度更新。
  • 第二阶段(2026年第四季度):发布7个框架的分类JSON文件及双向交叉映射(约300+项)、Papers with Code入口。
  • 第三阶段(2026年第四季度末):发布集成版本v1.0,语料提示将自动标注交叉映射的分类ID,并提供交互式Hugging Face Space演示。

道德、双重用途与隐私声明

  • 用途:该数据集仅用于防御性红队研究和安全评估
  • 许可:用户必须遵守每个上游来源的许可证。
  • 数据来源:所有对抗性提示均来自已公开的学术和行业来源。
  • 隐私:对部分提示中的真实电话号码和街道地址进行了(如 [PHONE][ADDRESS])掩码处理。
搜集汇总
数据集介绍
llm-redteam-corpus-taxonomy 数据集图片
构建方式
在大型语言模型(LLM)安全评估领域,红队测试数据集的分散与格式不一是阻碍研究进展的显著痛点。为此,本数据集系统性地聚合了12个公开的LLM红队与安全评测数据集,通过统一的标准架构进行融合。构建过程中,实施了去重处理与个人身份信息(PII)掩码操作,并完整保留了每条提示的来源与许可证信息,最终形成了一份经许可证分类的核心(core)与扩展(extended)子集,为研究人员提供了便捷的一站式数据资源。
使用方法
使用本数据集极为便捷,通过Hugging Face的`datasets`库,开发者仅需一行代码即可加载全部或指定子集。例如,`load_dataset("rubyglask/llm-redteam-corpus-taxonomy-full")`即可获取完整的64,458条记录。数据以Parquet、JSONL压缩及DuckDB三种格式提供,满足不同场景需求。用户可根据`source_id`或`license_tier`等字段进行灵活过滤,快速选取如HarmBench来源或商业友好的核心数据子集,用于模型安全性评估与红队测试工作流。
背景与挑战
背景概述
随着大型语言模型(LLM)的广泛应用,其安全性问题日益凸显,红队测试(red-teaming)作为评估模型对抗性攻击能力的关键手段,亟需高质量、统一格式的数据集支撑。为此,Ruby Glask 团队于2026年启动了 llm-redteam-corpus-taxonomy 项目,旨在构建一个汇聚多源、许可证清晰且持续更新的对抗性语料库。该数据集整合了12个公开的LLM红队与安全评估数据集,涵盖HarmBench、Anthropic HH-RLHF等知名来源,通过统一架构、去重和隐私处理,形成了规模达64,458条提示语料的核心与扩展子集。其创新性的跨框架分类法(涵盖OWASP、MITRE ATLAS等)为安全研究提供了系统化工具,推动了领域内对抗性测试与防御评估的标准化进程。
当前挑战
该数据集面临的主要挑战包括:领域层面,现有红队数据分散于不同协议与格式,研究者需手动拼接来源,且缺乏统一的分类框架,导致基准测试难以对齐与复现;构建过程中,许可证验证与合规性成为关键障碍——部分来源(如StrongREJECT)虽含MIT协议但捆绑了无许可证问题,WMDP因涉及双重用途知识被排除,而MaliciousInstruct与Korean UnSmile的许可证仍在等待验证,最终仅12个来源成功纳入。此外,数据隐私保护需平衡透明度与安全,实时电话与地址被掩码处理,少量具名人物提及仍需社区协助移除,确保研究伦理与法律边界清晰。
常用场景
经典使用场景
在大型语言模型安全评估领域,llm-redteam-corpus-taxonomy数据集被广泛视为标准化红队测试语料库的基石。研究者利用该数据集统一了来自12个公开资源的红队攻击提示,包括AdvBench、HarmBench、Anthropic HH-RLHF等经典基准测试,通过去重、PII脱敏和许可证追踪,构建了结构一致的评测集合。经典使用场景包括将统一格式的提示注入目标语言模型,检测模型对有害请求的遵从程度,或基于taxonomy_hints字段进行多维度攻击分类分析,为安全防御策略的迭代提供可复现的评估基础。
解决学术问题
该数据集着力解决了大语言模型安全研究中长期存在的语料碎片化与基准不可比性问题。过往研究者常需手动拼凑多个来源的红队测试数据,不同数据集之间的格式、许可证和去重标准迥异,严重阻碍了实验复现与跨方法比较。llm-redteam-corpus-taxonomy通过构建统一的规范化模式,并附带完整的溯源与许可证元信息,使得学术社区能够在同一基准上公平对比不同防御与攻击策略,显著提升了安全评估的科学性和透明度。
实际应用
在实际产业应用中,该数据集为企业安全团队提供了一套合规友好、即刻可用的红队测试框架。通过许可证分层的core与extended子集,商业机构可放心使用CC-BY-4.0授权的44,681条提示进行产品上线前的安全审计,无需担忧许可证纠纷。结合Hugging Face的单行加载接口和DuckDB分析能力,团队能快速集成到持续集成流水线中,自动检测模型回复中残留的有害内容,从而在部署前识别并修补安全漏洞,降低合规风险。
数据集最近研究
最新研究方向
随着大型语言模型在现实场景中的广泛应用,其安全性与鲁棒性已成为学界与工业界共同关注的焦点。该数据集通过整合12个公开的红队评估与安全测试语料库,构建了统一的规范框架,并实现了跨框架分类体系的映射,为防御性红队研究提供了标准化基准。前沿研究正从单点攻击检测转向多维度、跨框架的安全评估体系,该数据集通过去重、PII掩码、许可证分类等处理,推动了安全评估的可重复性与合规性,其季度更新的动态机制也为追踪新兴威胁模式提供了持续的数据支持。这一工作在OWASP LLM Top 10、MITRE ATLAS等主流框架间建立的双向映射,为构建统一的安全评估语言和自动化评估工具奠定了基础,对促进负责任的AI发展具有重要方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务