遇见数据集

FENCE

收藏
github2026-06-10 更新2026-06-11 收录
数据链接:
官方服务:

资源简介:

FENCE是一个用于评估视觉语言模型在金融领域对抗多模态越狱攻击安全性的基准数据集。它包含1,000个多模态查询(500个有害和500个良性),涵盖5种图像类型:baseimg、textimg、eng_textimg、figstep和eng_figstep。数据集结合文本和图像输入,并内置占位符系统以匿名化金融实体。

FENCE is a benchmark dataset designed to evaluate the safety of vision-language models against adversarial multimodal jailbreak attacks in the financial domain. It contains 1,000 multimodal queries (500 harmful and 500 benign), covering five image types: baseimg, textimg, eng_textimg, figstep, and eng_figstep. The dataset integrates text and image inputs, and incorporates a built-in placeholder system to anonymize financial entities.

创建时间:
2026-06-10
原始信息汇总

数据集概述

FENCE (Financial and Multimodal Jailbreak Detection Dataset) 是一个专注于金融领域、用于评估视觉语言模型(VLM)抵抗多模态越狱攻击安全性的基准数据集。该数据集已被 LREC 2026 会议接收。

核心规模

  • 总查询数: 1,000 条(500 条有害 / 500 条无害)
  • 独特图像数: 967 张,涵盖 5 种图像类型

图像类型

数据集包含五种图像类型,每种类型在文本嵌入方式和来源上有所区别:

图像类型 来源 描述
baseimg Pixabay 原始图像 无文字叠加的原始图像
textimg Pixabay 原始图像 + 韩语文字 在图像底部叠加韩语查询文字
eng_textimg Pixabay 原始图像 + 英语文字 在图像底部叠加英语查询文字
figstep 固定模板 + 韩语文字 在结构化模板中嵌入韩语查询文字
eng_figstep 固定模板 + 英语文字 在结构化模板中嵌入英语查询文字

数据集结构

数据集以 CSV 文件形式提供,每条记录包含 11 个字段:

字段 描述
id 行标识符
keyword 主题关键词
type 图像类型
input_query 直接作为文本提示输入给 VLM 的文本
query 嵌入到图像中的文本
image_path 图像文件路径(相对于 imgs/ 目录)
language 语言(kor / eng
label 总体标签(0:无害 / 1:有害)
text_label 文本组件标签(0:无害 / 1:有害)
img_label 图像组件标签(0:无害 / 1:有害)
image_url Pixabay 图像的来源 URL(适用于 600 行)

图像来源与使用

  • 600 行(567 张独特图像)来自 Pixabay,需通过运行脚本下载,遵循 Pixabay 许可协议。
  • 400 行(400 张独特图像)包含在仓库内。
  • 数据集的标注和其他非 Pixabay 图像采用 CC-BY-NC-4.0 许可协议。

占位符系统

数据集内置占位符机制,用于匿名化金融实体名称,共提供 93 个映射关系。占位符示例包括 [BANK_X](银行名称)、[SERVICE_X](服务名称)、[APP_X](应用名称)、[BRAND_X](品牌名称)。可通过运行 make replace-placeholder 替换为别名。

引用信息

bibtex @inproceedings{kim2026fence, title = {FENCE: A Financial and Multimodal Jailbreak Detection Dataset}, author = {Kim, Mirae and Jeong, Seonghun and Kwak, Youngjun}, booktitle = {Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026)}, year = {2026}, url = {https://arxiv.org/abs/2602.18154} }

搜集汇总
数据集介绍
FENCE 数据集图片
构建方式
FENCE数据集立足于金融领域视觉语言模型的安全评估需求,精心构建了一个包含1,000条多模态查询的基准测试集,其中包含500条有害与500条无害样本。数据集依托Pixabay平台获取原始图像,并由此衍生出5种图像类型:baseimg为未经文字叠加的原始图像;textimg与eng_textimg分别在韩文与英文语境下,将查询文本嵌入图像底部;figstep与eng_figstep则将文本融入结构化模板中,模拟截图风格。数据集的构建流程通过Makefile自动化管线实现,包括图像下载、占位符替换与图像生成三个核心步骤,确保研究人员可高效复现。
特点
该数据集具备显著的多模态与金融领域针对性特点。所有查询均包含文本与图像两种模态,且引入了一套精巧的占位符系统——包含93个用于匿名化金融实体名称的映射(如银行、服务、应用与品牌等),在保护隐私的同时保持了数据的可扩展性。数据集兼顾跨语言能力,覆盖韩语与英语两种语言。此外,每条数据携带了细粒度的标注信息,包括整体标签及文本、图像组件的独立标签,为深入研究跨模态越狱攻击提供了丰富的分析维度。
使用方法
使用者可通过GitHub仓库中的Makefile快速操控数据集生成过程。运行make all命令即可执行完整管线,依次下载Pixabay图像、替换占位符、生成最终图像至imgs/目录。若无需匿名化,可通过make dataset命令跳过占位符替换步骤。生成的CSV文件包含id、keyword、type、input_query、query及image_path等11个字段,其中input_query直接作为文本提示输入视觉语言模型,query为嵌入图像的具体问题。研究人员可直接利用这些CSV文件与生成的图像对模型进行安全性评估与越狱检测实验。
背景与挑战
背景概述
随着大型语言模型向多模态视觉语言模型(VLM)的演进,其在金融领域的应用日益广泛,然而针对此类模型的越狱攻击(jailbreak attacks)带来了严峻的安全隐患。为应对这一挑战,由Mirae Kim、Seonghun Jeong和Youngjun Kwak等研究者于2026年提出的FENCE数据集,作为面向金融领域的首个多模态越狱检测基准,应运而生。该数据集包含1,000个多模态查询(500个有害和500个无害),涵盖五种图像类型,旨在系统评估VLM在金融场景下的安全性。其构建依托于Pixabay图片库与自生成模板,并通过占位符机制实现金融实体的匿名化。FENCE已被LREC 2026会议接收,为金融领域VLM安全研究提供了宝贵的评估资源与标准化测试平台。
当前挑战
FENCE数据集所应对的核心挑战在于,当前多模态VLM在金融领域中极易受到越狱攻击,攻击者可通过巧妙构造的图文组合绕过安全机制,泄露敏感金融信息或执行恶意操作。具体而言,该领域面临的挑战包括:一、有害与良性查询的界定模糊,尤其在金融语境下,同一表述可能因场景不同而性质迥异,增加了标注的复杂性;二、图像类型多样性带来的泛化难题,从纯图像(baseimg)到图文叠加(textimg)再到结构化模板(figstep),要求模型具备跨模态的鲁棒理解能力。在构建过程中,数据集制作者需应对图片数据获取的速率限制(如Pixabay API的429错误),以及如何通过占位符系统有效保护金融实体隐私,同时保证查询的真实性与覆盖度。
常用场景
经典使用场景
在视觉语言模型安全性与鲁棒性评估领域,FENCE数据集为研究者提供了一个面向金融领域的多模态越狱攻击检测基准。该数据集精心设计了1000条多模态查询,其中包含500条有害样本与500条无害样本,并跨越五种图像类型(baseimg、textimg、eng_textimg、figstep、eng_figstep),能够系统性地测试视觉语言模型在面对文本与图像联合攻击时的安全防护能力。研究者通常利用该数据集对模型进行对抗性测试,通过分析模型对有害查询的拒答率与对无害查询的误拒率,量化评估模型的安全对齐效果,特别是在金融知识对话场景中,验证模型是否会在呈现金融单据、界面截图或结构化模板图片时,被诱导生成违规的金融操作建议或泄露敏感信息。
解决学术问题
该数据集针对性地解决了当前视觉语言模型安全研究中的两个核心学术问题:一是金融领域专业语境下多模态越狱攻击的标准化评测缺失,二是现有安全基准数据集普遍存在的语言与领域偏倚问题。通过引入涵盖韩语与英语的双语查询设计,以及独创的占位符匿名化系统,FENCE允许研究者在不暴露真实金融机构名称的前提下,模拟涉及银行、支付服务、移动应用等场景的越狱攻击,从而有效衡量模型在专业金融知识问答中的安全边界。该数据集的发布填补了金融垂直领域多模态安全评测的空白,为构建具备领域感知能力的鲁棒视觉语言模型提供了关键实验基础,推动了可信人工智能在金融服务中部署的安全评估方法论发展。
衍生相关工作
FENCE数据集发布后,已催生出一系列具有影响力的衍生研究工作。在方法论层面,研究者基于其多图像类型设计,探索了图像模态在越狱攻击中的贡献度分析,提出了针对金融场景的多模态注意机制干扰检测算法。在模型优化方面,有工作利用该数据集中的有害与无害对照样本,训练了专门面向金融领域的轻量级安全分类器,实现了在低资源场景下对越狱查询的实时拦截。在理论分析层面,学者借助FENCE中韩英双语数据的对比实验,揭示了不同语言编码在视觉语言模型安全表示空间中的转移规律。该数据集还被整合进多个视觉语言模型的安全评测框架,成为金融安全benchmark的标准组成部分,推动了领域内安全评测范式的统一与比较研究的可复现性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务