遇见数据集

CSU-JPG/IESBench

收藏
Hugging Face2026-06-24 更新2026-04-05 收录
官方服务:

资源简介:

IESBench是一个视觉中心的基准测试数据集,用于评估大型图像编辑模型的安全性。该数据集包含1054个视觉提示图像,这些图像通过视觉输入(如标记、箭头和视觉-文本提示)来推断用户意图,以模拟潜在的攻击场景。数据集覆盖了15个安全策略、116个属性和9个动作,旨在全面测试模型在面临恶意视觉编辑时的安全性和鲁棒性。每个数据点包括问题(意图描述)、图像路径、属性(可编辑目标)、动作(编辑操作)、类别(安全策略)、重写文本提示(LLM生成的文本提示)和图像ID等字段,以支持标准化评估和研究。

IESBench is a vision-centric benchmark dataset for evaluating the safety of large image editing models. It contains 1,054 visually-prompted images that infer user intent through visual inputs such as marks, arrows, and visual-text prompts, simulating potential attack scenarios. The dataset spans 15 safety policies, 116 attributes, and 9 actions, designed to comprehensively test the security and robustness of models against malicious visual editing. Each data point includes fields such as question (intent description), image-path, attributes (editable targets), action (edit operations), category (safety policies), rewrite (LLM-generated text prompt), and image_id, facilitating standardized evaluation and research.

提供机构:
CSU-JPG
搜集汇总
数据集介绍
CSU-JPG/IESBench 数据集图片
构建方式
IESBench的构建过程以视觉中心为核心理念,旨在系统性地评估大型图像编辑模型的安全性能。研究团队精心设计了1054张视觉提示图像,这些图像通过标记、箭头以及视觉‑文本混合提示等方式,将恶意编辑指令直接编码于视觉模态之中。数据集覆盖15项安全策略、116个可编辑属性及9种编辑动作,每一张图像均附带对应的文本意图、编辑目标、操作类型及安全策略类别等结构化标注信息。通过这种多维度的精细构建,IESBench能够全面模拟真实世界中可能出现的视觉对抗攻击场景。
特点
该数据集的最大特色在于其视觉导向的攻击范式,突破了传统文本提示驱动的安全评测边界。每一张样本都天然地将恶意编辑意图嵌入视觉元素之中,使得攻击表面从文本迁移至图像模态。由此,IESBench不仅提供了丰富的攻击图像与文本注释,还引入了多重评估指标,包括攻击成功率、危害程度评分、编辑有效性以及高风险比率,从多个维度衡量模型的抗攻击能力。这种多层次、多策略的评测体系,为揭示现有图像编辑系统的安全脆弱性提供了坚实的数据基础。
使用方法
使用IESBench时,研究者可将视觉提示图像输入目标图像编辑模型,观察模型是否执行潜藏的恶意编辑指令。数据集中的标准化JSON格式记录为模型的测试、对比和防御策略开发提供了便利,每一条数据皆包含图像路径、编辑目标、操作类型及安全策略类别。此外,数据集还提供了LLM重写后的文本提示,可用于模拟某些模型的提示重写机制。通过统一加载接口和预设的评估指标——攻击成功率、危害程度、编辑有效性与高风险比率——用户能够便捷地复现排行榜实验,并衡量不同防御方法在视觉攻击下的有效性。
背景与挑战
背景概述
随着大规模图像编辑模型的迅猛发展,其指令范式正从传统的文本驱动向视觉提示转变,用户的编辑意图可通过标记、箭头乃至视觉-文本混合信号直接传达。这一演进虽极大拓展了模型的可交互性与适用场景,却也引入了尚未被充分审视的安全隐患——攻击面本身正向视觉维度迁移。在此背景下,由中南大学等机构的研究团队于2026年构建的IESBench(Image Editing Safety Benchmark)应运而生,旨在系统性评估与揭示视觉中心化图像编辑模型存在的安全脆弱性。该基准测试包含1054张视觉提示图像,覆盖15种安全策略、116种属性与9种操作,为统一评测提供了标准化平台。相关工作已被国际顶级会议ICML 2026接收并选为口头报告,彰显了其在AI安全领域的重要影响力。
当前挑战
IESBench所应对的核心挑战在于,现有图像编辑模型的安全性评估多聚焦于文本层面,忽略了视觉提示作为新型攻击媒介所引发的独特风险。具体而言,攻击者可将恶意指令嵌入视觉元素中,规避传统文本过滤机制,从而以极高的成功率(如实验显示多个开源模型攻击成功率达100%)实现越狱操作,生成包含暴力、欺诈等高危内容的图像。此外,数据集构建本身亦面临挑战:需在保证视觉提示自然性与恶意性的平衡,并确保样本覆盖多样化的安全政策与编辑动作,同时在标注过程中规避内容滥用的伦理风险。这些挑战使得IESBench成为推动图像编辑模型安全防御研究、衡量模型鲁棒性的关键利器。
常用场景
经典使用场景
IESBench作为首个视觉中心的大规模图像编辑安全基准,其经典使用场景在于评估和测试大型图像编辑模型面对视觉提示型越狱攻击时的鲁棒性。该数据集精心构建了1054张视觉提示图像,覆盖15项安全策略、116个属性与9种编辑动作,通过模拟恶意指令隐藏在视觉输入中的攻击方式,为研究者提供了标准化的测试平台,用以系统衡量模型在编辑过程中抵御有害内容生成的能力。
衍生相关工作
IESBench的提出催生了多项具有影响力的相关研究。其核心贡献之一——视觉中心越狱攻击方法(VJA),启发了后续针对多模态模型安全边界的探索工作。同时,论文中提出的无训练防御策略——多模态内省推理,为开发轻量级安全防护模块提供了新思路。基于该基准的排行榜也成为评估和比较不同模型安全性能的权威参考,进一步推动了诸如在线版本模型Qwen-Image-Edit-Safe等安全增强型编辑系统的研发迭代。
数据集最近研究
最新研究方向
IESBench作为首个以视觉为中心的大规模图像编辑安全基准,聚焦于揭示大型图像编辑模型在面对视觉提示(如标记、箭头、视觉-文本混合指令)时存在的深层安全裂隙。该数据集涵盖1054幅视觉提示图像,横跨15项安全策略、116种属性和9类操作,系统性地评估了主流模型在攻击成功率、危害性分数、编辑有效性与高风险比率等维度的表现。前沿研究围绕视觉中心越狱攻击展开,通过将恶意指令隐匿于视觉模态中,显著提升了攻击的隐蔽性与成功率,暴露出现有防御机制的脆弱性。与之呼应,内省推理防御策略以低开销、免训练的方式,通过多模态自省推理增强模型鲁棒性,为图像编辑安全领域提供了新的评估范式与防护思路,其成果已被ICML 2026接收。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务