遇见数据集

PahaII/vllm_safety_evaluation

收藏
Hugging Face2023-11-28 更新2024-03-04 收录
官方服务:

资源简介:

--- license: apache-2.0 --- # How Many Unicorns Are In This Image? A Safety Evaluation Benchmark For Vision LLMs (Dataset) Paper: https://arxiv.org/abs/2311.16101 Code: https://github.com/UCSC-VLAA/vllm-safety-benchmark The full dataset should looks like this: ``` . ├── ./safety_evaluation_benchmark_datasets// ├── gpt4v_challenging_set # Contains the challenging test data for GPT4V ├── attack_images ├── sketchy_images ├── oodcv_images ├── misleading-attack.json ├── sketchy-vqa-challenging.json └── oodcv-vqa-counterfactual.json ├── redteaming-mislead # Contains the test data for redteaming tasks ├── redteaming_attack ├── gaussian_noise ├── mixattack_eps32 ├── mixattack_eps64 ├── sinattack_eps64_dog ├── sinattack_eps64_coconut ├── sinattack_eps64_spaceship └── annotation.json └── jailbreak_llm # adversarial suffixes for jailbreaking VLLM through LLM └── ood # Contains the test data for OOD scenarios ├── sketchy-vqa ├── sketchy-vqa.json ├── sketchy-challenging.json └── oodcv-vqa ├── oodcv-vqa.json └── oodcv-counterfactual.json ```

许可证:Apache 2.0 # 《图像中有多少独角兽?:面向视觉大语言模型的安全评估基准数据集》 论文:https://arxiv.org/abs/2311.16101 代码:https://github.com/UCSC-VLAA/vllm-safety-benchmark 完整数据集的目录结构如下: . ├── ./safety_evaluation_benchmark_datasets// ├── gpt4v_challenging_set # 包含面向GPT4V的挑战性测试数据集 ├── attack_images ├── sketchy_images ├── oodcv_images ├── misleading-attack.json ├── sketchy-vqa-challenging.json └── oodcv-vqa-counterfactual.json ├── redteaming-mislead # 包含红队任务测试数据集 ├── redteaming_attack ├── gaussian_noise ├── mixattack_eps32 ├── mixattack_eps64 ├── sinattack_eps64_dog ├── sinattack_eps64_coconut ├── sinattack_eps64_spaceship └── annotation.json └── jailbreak_llm # 借助大语言模型生成对抗后缀,以实现对视觉大语言模型(Vision LLM)的越狱攻击 └── ood # 包含分布外场景测试数据集 ├── sketchy-vqa ├── sketchy-vqa.json └── sketchy-challenging.json └── oodcv-vqa ├── oodcv-vqa.json └── oodcv-counterfactual.json

提供机构:
PahaII
原始信息汇总

How Many Unicorns Are In This Image? A Safety Evaluation Benchmark For Vision LLMs (数据集)

数据集结构

数据集包含以下几个主要部分:

1. gpt4v_challenging_set

  • 描述:包含针对GPT4V的挑战性测试数据。
  • 内容
    • attack_images:攻击图像
    • sketchy_images:草图图像
    • oodcv_images:OODCV图像
    • misleading-attack.json:误导性攻击数据
    • sketchy-vqa-challenging.json:草图VQA挑战数据
    • oodcv-vqa-counterfactual.json:OODCV VQA反事实数据

2. redteaming-mislead

  • 描述:包含红队任务的测试数据。
  • 内容
    • redteaming_attack:红队攻击数据
      • gaussian_noise:高斯噪声
      • mixattack_eps32:混合攻击eps32
      • mixattack_eps64:混合攻击eps64
      • sinattack_eps64_dog:正弦攻击eps64狗
      • sinattack_eps64_coconut:正弦攻击eps64椰子
      • sinattack_eps64_spaceship:正弦攻击eps64宇宙飞船
      • annotation.json:标注数据
    • jailbreak_llm:通过LLM破解VLLM的对抗后缀

3. ood

  • 描述:包含OOD场景的测试数据。
  • 内容
    • sketchy-vqa:草图VQA数据
      • sketchy-vqa.json:草图VQA数据
      • sketchy-challenging.json:草图挑战数据
    • oodcv-vqa:OODCV VQA数据
      • oodcv-vqa.json:OODCV VQA数据
      • oodcv-counterfactual.json:OODCV反事实数据
搜集汇总
数据集介绍
PahaII/vllm_safety_evaluation 数据集图片
构建方式
在视觉大模型安全评估领域,构建高质量且具有挑战性的基准数据集至关重要。PahaII/vllm_safety_evaluation数据集源自论文《How Many Unicorns Are In This Image? A Safety Evaluation Benchmark For Vision LLMs》,其构建方式系统而严谨。数据集包含三个核心子集:gpt4v_challenging_set专门针对GPT4V设计,内含攻击图像、草图图像及分布外图像,并配以误导性攻击、草图视觉问答和反事实问答等挑战性任务;redteaming-mislead子集聚焦红队测试,包含通过高斯噪声、混合攻击、正弦攻击等手法生成的对抗样本,以及用于通过语言模型越狱视觉大模型的对抗后缀;ood子集则涵盖草图视觉问答和分布外视觉问答场景,每个场景均包含标准与反事实两种测试类型。这种多层次、多攻击面的构建方式,全面覆盖了视觉大模型面临的安全威胁。
特点
该数据集的核心特点在于其针对视觉大模型安全评估的全面性与挑战性。首先,它融合了多种攻击范式,包括图像层面的对抗攻击(如混合攻击、正弦攻击)和语言层面的越狱攻击,能够系统评估模型在恶意输入下的鲁棒性。其次,数据集特别设计了分布外和反事实场景,例如草图与抽象图像,测试模型超越训练分布的逻辑推理与常识理解能力。此外,通过为GPT4V设立专门的高难度子集,该基准能够揭示顶级模型在复杂对抗环境下的脆弱性。这些特点使其成为视觉大模型安全研究中不可或缺的评估工具。
使用方法
使用该数据集进行安全评估时,研究者可依据任务需求灵活选择子集。对于基础鲁棒性测试,可直接加载ood子集中的标准视觉问答数据,评估模型在分布偏移下的表现。若需深入检测对抗防御能力,应选用redteaming-mislead子集,其中包含多种噪声与攻击强度的图像,并配合LLM生成的越狱后缀,模拟真实攻击场景。针对高级模型如GPT4V的专项评估,则需使用gpt4v_challenging_set,结合误导性攻击与反事实问答进行压力测试。数据集的JSON格式注释文件提供了任务标注,用户可通过HuggingFace Datasets库直接加载,或下载原始文件夹后按目录结构解析。评估时建议同时计算准确率与安全违规率,以全面衡量模型性能。
背景与挑战
背景概述
随着多模态大语言模型(Vision LLMs)的快速发展,其在视觉理解与语言生成融合领域展现出卓越能力,然而安全性评估的缺失成为制约其实际部署的关键瓶颈。PahaII/vllm_safety_evaluation数据集由加州大学圣克鲁兹分校(UCSC)视觉语言与智能代理实验室(VLAA)于2023年11月创建,旨在系统性地评估视觉大语言模型在对抗性攻击、分布外场景及误导性输入下的安全鲁棒性。该数据集围绕三大核心研究问题展开:模型能否抵御精心设计的视觉扰动?能否识别概念混淆的抽象图像?能否应对跨域分布偏移?通过构建包含GPT-4V挑战集、红队误导任务及分布外测试的综合性基准,该数据集为多模态安全研究提供了首个标准化评估框架,推动了视觉语言模型可信赖性研究的范式转变。
当前挑战
该数据集所解决的领域挑战主要涵盖三方面:一是视觉大语言模型对恶意攻击的脆弱性,包括对抗性扰动(如混合攻击、正弦噪声)和越狱提示,这些攻击能轻易绕过模型的安全护栏;二是模型在分布外场景下的泛化失效,例如手绘草图、域外图像等非自然分布输入常导致幻觉与错误推理;三是语义误导问题,如反事实视觉问答和抽象概念关联,暴露了模型对隐含意图的误解。在构建过程中,研究者面临数据标注的伦理困境——如何在不生成有害内容的前提下构造逼真的攻击样本,以及跨模态语义对齐的难度——需要确保视觉扰动与文本提示的因果一致性,同时平衡挑战性与现实性以避免过度拟合特定攻击模式。
常用场景
经典使用场景
PahaII/vllm_safety_evaluation 数据集专为评估视觉大语言模型(VLLMs)在安全与鲁棒性方面的表现而设计。其经典使用场景涵盖对抗性攻击测试、分布外泛化评估以及误导性样本检测。通过精心构造的挑战性图像与问答对,研究者可系统性地检验模型在面对恶意扰动、草图化表示或反事实视觉输入时的行为边界,从而揭示现有VLLMs在安全对齐与视觉推理中的脆弱性。
解决学术问题
该数据集有效解决了视觉语言模型安全评估缺乏标准化基准的学术难题。它填补了从纯文本到多模态安全研究过渡的关键空白,使研究者能够量化模型在对抗性视觉输入、分布偏移及逻辑误导下的失效模式。其意义在于推动了VLLMs安全对齐理论的构建,并为后续可解释性分析与鲁棒性增强提供了可复现的评估框架。
衍生相关工作
该数据集衍生出多项经典工作,包括基于对抗性补丁的视觉越狱攻击方法、跨模态分布外检测算法,以及面向VLLMs的防御性微调策略。相关研究不仅深化了对多模态模型认知边界的理解,还催生了诸如安全奖励模型与视觉对抗训练等创新范式,为构建可信赖的视觉AI系统奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务