遇见数据集

CSU-JPG/VVA-Bench

收藏
Hugging Face2026-06-25 更新2026-07-22 收录
官方服务:

资源简介:

VVA-Bench是一个诊断性基准,用于评估图像到视频生成模型在隐式视觉提示攻击下的安全性。与仅依赖显式不安全文本提示不同,该基准研究在视觉输入中嵌入有害时间意图的情况,例如箭头、表情符号、姿势标记、草图、相机控制提示或前后帧对。发布的标注文件包含452个不安全攻击样本。每个样本将一个弱或未充分指定的文本提示与一个或多个图像输入以及描述视觉攻击格式和目标风险类别的元数据配对。数据集涵盖两种主要攻击形式:双帧时间攻击和单图像视觉提示攻击,其中视觉提示子集进一步分为五种代表性机制。数据集用于安全研究、模型评估、红队测试和防御开发,可能包含敏感或令人不安的概念,应仅在受控研究环境中使用。

VVA-Bench is a diagnostic benchmark for evaluating the safety of image-to-video (I2V) generation models under implicit visual prompt attacks. Instead of relying only on explicit unsafe text prompts, the benchmark studies cases where harmful temporal intent is embedded in visual inputs, such as arrows, emojis, pose marks, sketches, camera-control cues, or before/after frame pairs. The released annotation file contains 452 unsafe attack samples. Each sample pairs one weak or underspecified text prompt with one or more image inputs and metadata describing the visual attack format and target risk category. The dataset covers two major attack forms: two-frame temporal attacks and single-image visual-prompt attacks, with the visual-prompt subset further divided into five representative mechanisms. It is intended for safety research, model evaluation, red-teaming, and defense development, and may contain sensitive or disturbing concepts, so it should be used only in controlled research settings.

提供机构:
CSU-JPG
搜集汇总
数据集介绍
CSU-JPG/VVA-Bench 数据集图片
构建方式
VVA-Bench是一个用于评估图像到视频生成模型在隐式视觉提示攻击下安全性的诊断基准。该数据集通过精心构造452个不安全攻击样本,每个样本将弱化或模糊的文本提示与一个或多个图像输入配对。攻击格式涵盖两帧时序攻击和单图像视觉提示攻击两大类型,其中视觉提示子集进一步细分为运动控制、表情符号指令、姿态控制、草稿实例化和相机控制五种代表性机制。数据集由人工标注的元数据文件构成,包含样本ID、文本提示、图像路径、源图像路径、攻击格式标签和风险类别标签等字段。源图像均来自AIGC生成,确保数据的一致性和可控性。
使用方法
使用VVA-Bench时,研究人员应加载annotation.json文件获取样本元数据,将text_prompt与对应的攻击图像(image_path)一同输入待评估的图像到视频生成模型。评估协议采用攻击成功率(ASR)和危害性评分(HS)等指标,通过多模态大语言模型作为评判器,结合人类专家标注校准,对生成视频进行规模化评分。建议仅在受控研究环境中使用该数据集,不得用于生成或传播有害媒体。评估结果应以聚合形式报告,对边界案例和高危害性输出需由训练有素的评估人员进行人工审核。
背景与挑战
背景概述
随着图像到视频(I2V)生成技术的飞速发展,模型的安全性评估成为亟待解决的关键议题。VVA-Bench作为一项诊断性基准测试,由Yining Sun、Haoyu Kang等研究者在2026年提出,旨在系统评估I2V模型在面对隐式视觉提示攻击时的鲁棒性。该数据集聚焦于攻击者通过视觉输入(如箭头、表情符号、姿态标记、草图、相机控制线索或前后帧对)嵌入有害时间意图的场景,而非依赖显式不安全的文本提示。VVA-Bench包含452个精心标注的攻击样本,涵盖七种攻击格式,为视频生成安全领域提供了首个系统化评测工具。该基准的发布推动了I2V模型安全防御与红队测试的发展,对学术研究与工业应用均产生了深远影响。
当前挑战
VVA-Bench所应对的核心挑战在于,现有安全机制往往难以检测和防御嵌入视觉模态中的隐式不安全意图。具体而言,传统的基于文本的安全过滤器无法识别以箭头、表情符号等视觉符号编码的有害指令,导致模型在高危场景下生成违规内容。在数据集构建过程中,研究者面临多项技术难点:其一,需要设计多样化且具有代表性的隐式视觉攻击格式,涵盖运动控制、姿态诱导、草稿实例化等多种类型;其二,确保每个攻击样本的文本提示弱化至难以单独触发检测,同时视觉输入又能清晰传递不安全意图;其三,构建多层次的评估协议,包括攻击成功率、多维度危害评分等指标,并依赖多模态大模型与人类专家的联合标注机制来保障评测的可靠性与可重复性。
常用场景
经典使用场景
VVA-Bench数据集专为评估图像到视频(I2V)生成模型在隐式视觉提示攻击下的安全性而设计。其核心使用场景在于系统性地测试模型能否抵御通过箭头、表情符号、姿态标记、草图、相机控制线索或前后帧对等视觉输入嵌入的有害时间意图。研究者可将弱文本提示与构造的视觉攻击图像配对,输入I2V模型,并依据攻击成功率与有害性评分等指标量化模型的安全脆弱性,从而诊断模型在视觉驱动范式下的防御短板。
解决学术问题
该数据集填补了当前视频生成安全研究中仅关注显式文本提示攻击的空白,开创性地解决了隐式视觉提示攻击的量化评估难题。它揭示了即使文本提示看似无害,视觉输入仍可能诱发模型生成违反政策的有害视频内容,从而推动学术界重新审视多模态生成模型的安全边界。VVA-Bench为构建更鲁棒的安全检测机制和防御策略提供了关键基准,其多维度有害性评分体系提升了评估的精细化程度,对模型部署前的安全审计具有深远意义。
实际应用
在实际应用中,VVA-Bench可被内容安全团队用于红队测试,提前发现I2V生成服务中潜藏的视觉攻击风险。通过集成该基准的评估协议,平台能够自动筛选出对视觉提示敏感的模型版本,辅助优化内容审核管线的敏感行为识别能力。此外,该数据集支持安全研究机构开发基于视觉输入的对抗防御模块,例如设计能够检测并阻断含隐式不良意图的输入图像预处理过滤器,从而降低生成有害视频的传播可能性。
数据集最近研究
最新研究方向
VVA-Bench的构建标志着图像到视频生成安全评估领域从显式文本检测向隐式视觉提示攻击防御的前沿演进。该基准聚焦于箭头、表情符号、姿态标记等视觉载体中嵌入的有害时间意图,系统揭示了现有模型在面临弱文本与强视觉联合攻击时的脆弱性。通过覆盖双帧时序攻击与六类视觉提示机制,VVA-Bench为红队测试和防御策略开发提供了多维度的诊断工具,其提出的攻击成功率与有害性评分体系为视频生成安全设立了可量化的评估标准。这一研究回应了多模态内容安全博弈中视觉通道被恶意利用的迫切关切,推动了从被动过滤向主动防御的技术范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务