遇见数据集

Multimodal_Redteaming

收藏
Hugging Face2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

Multimodal Redteaming是一个高质量的多语言红队测试数据集,旨在评估大型语言模型(LLM)对抗对抗性提示的鲁棒性和安全性。该数据集包含英语、法语、德语、意大利语和西班牙语五种语言的对话,涵盖纯文本和图像支持的提示,用于模拟现实攻击场景下AI系统对对抗性、有害或违反政策请求的响应。数据集由4,500个样本组成,采用JSON格式,每个样本都经过领域专家专业策划和评审,以确保标注一致性和质量。数据集中包含详细的元数据,如攻击类别、攻击策略、语言、使用案例以及多个模型响应的安全标签。数据集覆盖了10种主要的攻击类别(包括犯罪、武器和爆炸物、有害材料、违禁材料、网络攻击、自残和自杀、欺诈和诈骗、暴力、仇恨、偏见)和10种攻击策略(如逐步升级、直接提示、假设测试、讲故事/角色扮演、冒充或角色、角色分离、使用晦涩科学、使用非正式语言、语言混合、错误前提)。五种语言分布均衡,各约占20%。该数据集适用于红队测试、安全基准测试、漏洞分析、对齐研究以及LLM评估等任务。

Multimodal Redteaming is a high-quality multilingual red teaming dataset designed to evaluate the robustness and safety of large language models (LLMs) against adversarial prompts. It includes dialogues in five languages: English, French, German, Italian, and Spanish, covering text-only and image-supported prompts to simulate real-world attack scenarios where AI systems respond to adversarial, harmful, or policy-violating requests. The dataset consists of 4,500 samples in JSON format, each professionally curated and reviewed by domain experts to ensure annotation consistency and quality. It contains detailed metadata such as attack categories, attack strategies, languages, use cases, and safety labels for multiple model responses. The dataset covers 10 main attack categories (including crime, weapons and explosives, hazardous materials, prohibited materials, cyberattacks, self-harm and suicide, fraud and scams, violence, hate, bias) and 10 attack strategies (e.g., escalation, direct prompting, hypothetical testing, storytelling/role-playing, impersonation or role, role separation, using obscure science, using informal language, language mixing, false premises). The five languages are evenly distributed, each accounting for approximately 20%. This dataset is suitable for tasks such as red teaming, safety benchmarking, vulnerability analysis, alignment research, and LLM evaluation.

创建时间:
2026-06-09
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Multimodal Redteaming
  • 语言:英语、法语、德语、意大利语、西班牙语(多语言)
  • 数据规模:1,000 < 样本数 < 10,000(实际共4,500个样本)
  • 格式:JSON
  • 许可证:其他(需联系商业许可)

数据组成

  • 媒体类型:纯文本 与 图像辅助
  • 用例:文本理解、图像理解
  • 任务类别:文本生成、问答

数据特征

每条样本包含以下字段:

  • use_case:用例
  • attack_category:攻击类别
  • attack_strategy:攻击策略
  • language:语言
  • prompt_1prompt_5:5条文本提示
  • prompt_1_mediaprompt_5_media:对应的图像媒体

数据分布

攻击类别分布(前10类)

类别 占比 数量
犯罪 16.6% 751
武器与爆炸物 13.6% 614
有害物质 12.2% 554
违禁材料 10.8% 488
网络攻击 9.9% 449
自残与自杀 9.2% 416
欺诈与诈骗 8.5% 384
暴力 6.7% 303
仇恨 6.0% 270
偏见 3.6% 165

攻击策略分布

策略 占比 数量
逐步升级 31.3% 2,387
直接提示 27.1% 2,066
假设性测试 14.7% 1,125
故事/角色扮演 7.2% 548
冒充或角色 6.0% 458
角色分离 3.4% 257
使用晦涩科学 1.9% 148
使用非正式语言 1.9% 145
语言混合 1.7% 128
错误前提 1.6% 124

语言分布

语言 占比 数量
西班牙语 20.2% 914
意大利语 20.0% 907
法语 20.0% 904
德语 19.9% 903
英语 19.9% 902

目的与应用

  • 用于评估大语言模型(LLM)在面对对抗性提示时的鲁棒性和安全性
  • 支持红色团队测试、安全基准测试、漏洞分析、对齐研究和LLM评估
  • 由领域专家人工审核和标注,保证数据质量

其他

  • 本仓库为公开预览版,商业完整版包含更多样本、攻击类别和元数据层
  • 数据为原始创作,非基于其他数据集
搜集汇总
数据集介绍
Multimodal_Redteaming 数据集图片
构建方式
该数据集由专家精心构建,涵盖了多语种(英语、法语、德语、意大利语、西班牙语)的红队测试对话,每条样本均包含文本与图像两种模态的提示词。数据集中每条样本都附有详细的元数据,包括攻击类别、攻击策略、语言及用例标签,确保了标注的一致性与高质量。样本通过专业的人工审核流程进行筛选与验证,确保了数据集的可靠性与实用性。
使用方法
该数据集适用于红队测试、安全性基准测试、脆弱性分析及对齐研究。用户可将JSON格式的样本直接用于模型评估,通过文本与图像提示的联合输入,测试模型对有害或违规请求的响应。数据集的多语言特性支持跨语言安全性评估,而丰富的攻击类别与策略标签则便于进行细粒度的安全性能分析,助力人工智能安全领域的研究与实践。
背景与挑战
背景概述
随着大语言模型(LLMs)在多种语言和模态场景中的广泛应用,其安全性评估成为人工智能对齐研究领域的核心议题。Multimodal_Redteaming数据集由专业团队创建,专注于多语言与多模态场景下的红队测试,旨在系统性地评估模型对对抗性提示的鲁棒性。该数据集覆盖英语、法语、德语、意大利语和西班牙语五种语言,包含纯文本与图像支持的对话样本,共计4500条精心标注的数据。研究围绕犯罪、武器、有害材料等十类攻击类别及逐步升级、直接提示等十种攻击策略展开,为AI安全基准测试、漏洞分析与对齐研究提供了高质量的多语言评估资源,显著推动了跨语言安全对齐的标准化进程。
当前挑战
该数据集所解决的领域挑战在于,大语言模型在面对多语言、多模态攻击时,易生成违反政策或有害内容,尤其在伪装成合理情景的逐步升级攻击中表现脆弱。现有安全机制多针对单一语言或纯文本场景,难以有效防御跨语言混淆、图像诱导等复合攻击。构建过程中,挑战体现在需确保五语言攻击提示的语义等价性与文化适配性,避免因翻译失真导致评测偏差;同时,图像与文本的协同攻击设计需由领域专家手工创作,以模拟真实威胁,这要求团队兼具语言学、安全与AI多学科知识,显著增加了数据标注与一致性校验的复杂度。
常用场景
经典使用场景
Multimodal_Redteaming数据集的核心应用在于对多模态大语言模型进行对抗性鲁棒性评估。研究者通过向模型输入涵盖犯罪、暴力、仇恨言论等十大攻击类别的文本或图文混合提示,系统性地测试模型在面临恶意诱导、角色伪装、渐进式升级等策略时的安全防线。每个样本均经领域专家审核标注,确保攻击意图的精准性与评估结果的可信度,为模型安全基准测试提供了标准化工具。
解决学术问题
该数据集精准回应了大语言模型中对抗性安全性与多语言泛化能力的双重挑战。学术领域长期受困于模型在多语言环境下对越狱攻击的脆弱性评估手段匮乏,以及单模态数据难以暴露图文交错场景的隐蔽漏洞。Multimodal_Redteaming通过覆盖英、法、德、意、西五语的统一标注框架,首次系统性地解构了攻击类别与策略的关联性,为研究模型对齐失效的深层机理提供了跨语言、跨模态的实证基础。
实际应用
在实际部署中,该数据集成为AI安全治理的关键压力测试工具。企业可将其嵌入内容审核系统的上线前验证流程,模拟用户以渐进式诱导、虚构场景等手段突破政策边界的真实攻击链。此外,数据集在多语言客服等产品场景中可定位模型对种族偏见、自伤暗示等高危请求的响应盲区,辅助安全团队制定差异化的防御策略,显著降低合规风险。
数据集最近研究
最新研究方向
当前,多模态大语言模型的安全性与鲁棒性已成为人工智能对齐研究的前沿热点。Multimodal_Redteaming数据集通过构建涵盖犯罪、武器、仇恨言论等高危主题的多语言(英、法、德、意、西)对抗性提示,并创新性地融合文本与图像双模态输入,为评估模型在面对逐步升级、角色扮演等复杂攻击策略时的防御能力提供了标准化基准。该数据集源自专家精标,紧扣AI安全漏洞分析与红队测试需求,其发布加速了多模态模型在欺诈防护、有害内容过滤等现实场景中的脆弱性检测进程,对推动可信赖人工智能的合规发展具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务