遇见数据集

sea-vl-conflict

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

SEA-VL Conflict是一个专门设计用于评估视觉语言模型在图像与文本信息冲突场景下表现的多模态数据集。该数据集基于SEACrowd/sea-vl_crowdsourcing源数据集构建,后者包含了东南亚文化相关图像的英文描述。通过人工修改,为每张图像创建一对描述:一个真实反映图像内容的原始描述,以及一个通过翻转原始描述中特定对象或属性(如菜肴成分、地标位置、颜色、数量等)而生成的冲突描述,从而人为制造图像与文本之间的不一致性。每个数据样本包含图像、原始描述、冲突描述、一个针对被更改元素的提问、图像中真实存在的答案、冲突描述所声称的答案,以及一个合理干扰选项。此外,还包含序列号、冲突类型和语言等元数据。数据集规模较大,提供22种语言配置,每种语言包含100个训练样本,总计超过2200个样本。数据格式统一,属于multilingual-vlm-conflict评估套件的一部分,适用于视觉问答和图像-文本到文本等任务,旨在测试和提升模型在复杂、矛盾多模态信息下的推理与决策能力。数据集遵循CC-BY-SA-4.0许可协议。

SEA-VL Conflict is a multimodal dataset specifically designed to evaluate the performance of vision-language models in scenarios where image and text information conflict. It is built upon the SEACrowd/sea-vl_crowdsourcing source dataset, which contains English descriptions of images related to Southeast Asian culture. The core of this dataset involves manual modifications to create a pair of descriptions for each image: an original caption that accurately reflects the image content, and a conflicting caption generated by flipping a specific object or attribute (e.g., dish ingredients, landmark location, color, quantity, etc.) in the original caption, thereby artificially creating inconsistencies between the image and text. Each data sample includes the image, original caption, conflicting caption, a question targeting the altered element, the true answer from the image (image_bias), the answer claimed by the conflicting caption (text_bias), and a plausible distractor option that differs from both. Additionally, metadata such as serial number, conflict type, and language are included. The dataset is large-scale, offering 22 language configurations including Arabic, Chinese, German, French, Japanese, Russian, and Vietnamese, with 100 training samples per language, totaling over 2,200 samples. The data format is unified and is part of the multilingual-vlm-conflict evaluation suite. It is suitable for tasks such as visual question answering (VQA) and image-text-to-text, aiming to test and enhance model reasoning and decision-making capabilities in complex, potentially contradictory multimodal information. The dataset follows the CC-BY-SA-4.0 license.

创建时间:
2026-06-29
原始信息汇总

数据集名称

SEA-VL Conflict

数据集描述

这是一个图像-文本冲突数据集,基于SEACrowd/sea-vl_crowdsourcing(东南亚文化相关图像的英文描述)构建。每个样本手动创建冲突:在原始描述中,将一个对象或属性(例如菜肴成分、地标位置、颜色、数量等)替换为一个不同但看似合理的值。

任务类别

  • 视觉问答 (visual-question-answering)
  • 图像到文本 (image-text-to-text)

语言

英语 (en)

标签

  • vlm
  • image-text-conflict
  • southeast-asia
  • multimodal

许可协议

CC-BY-SA-4.0

数据集规模

样本总数 < 1000 (n<1K),具体为每个语言配置包含100个训练样本。

配置与子集

数据集包含以下语言配置,每个配置均为训练集:

  • 阿拉伯语 (ar)
  • 捷克语 (cs)
  • 德语 (de)
  • 希腊语 (el)
  • 西班牙语 (es)
  • 波斯语 (fa)
  • 法语 (fr)
  • 希伯来语 (he)
  • 印地语 (hi)
  • 印度尼西亚语 (id)
  • 意大利语 (it)
  • 日语 (ja)
  • 韩语 (ko)
  • 荷兰语 (nl)
  • 波兰语 (pl)
  • 葡萄牙语 (pt)
  • 罗马尼亚语 (ro)
  • 俄语 (ru)
  • 土耳其语 (tr)
  • 乌克兰语 (uk)
  • 越南语 (vi)
  • 中文 (zh)
  • 默认配置 (default)

数据特征

每条样本包含以下字段:

  • image (图像): 真实图像
  • original_caption (字符串): 与图像一致的原始描述
  • conflicting_caption (字符串): 修改了单个对象或属性的冲突描述
  • question (字符串): 询问被修改的对象或属性
  • image_bias (字符串): 图像中的真实值
  • text_bias (字符串): 冲突描述中声称的修改值
  • distractor (字符串): 与两个偏差值不同的合理第三方选项
  • serial_no (整数): 来源标识符
  • conflict_type (字符串): 冲突类型
  • language (字符串): 描述语言(英语)

数据拆分

每个语言配置仅包含一个训练集 (train),示例数为100。

数据集大小(每配置示例)

配置 训练集大小 (字节) 下载大小 (字节) 训练样本数
ar 54,872,740 54,864,037 100
cs 54,860,461 54,861,413 100
de 54,862,787 54,860,952 100
el 54,884,550 54,868,239 100
es 54,862,445 54,860,945 100
fa 54,874,404 54,863,271 100
fr 54,863,270 54,861,443 100
he 54,868,670 54,861,109 100
hi 54,896,710 54,868,961 100
id 54,860,805 54,859,057 100
it 54,862,146 54,860,763 100
ja 54,867,863 54,861,346 100
ko 54,864,280 54,860,772 100
nl 54,860,995 54,859,756 100
pl 54,861,173 54,862,251 100
pt 54,861,975 54,861,105 100
ro 54,862,525 54,860,946 100
ru 54,879,728 54,867,217 100
tr 54,861,512 54,860,347 100
uk 54,879,254 54,867,159 100
vi 54,866,559 54,861,298 100
zh 54,857,529 54,858,324 100
default 数据未单独列出 数据未单独列出 100

来源

源数据集:SEACrowd/sea-vl_crowdsourcing (https://huggingface.co/datasets/SEACrowd/sea-vl_crowdsourcing)

生成方法

从源数据集中确定性重采样(种子42),每个描述修改一个对象或属性以创建冲突。question 字段精确询问被修改的元素。

所属系列

属于多语言视觉语言模型冲突数据集套件 (multilingual-vlm-conflict),与 rpg-conflict 共享相同模式。

搜集汇总
数据集介绍
sea-vl-conflict 数据集图片
构建方式
在视觉与语言智能的交叉领域,多模态模型的鲁棒性评估已成为研究焦点,尤其当图像与文本信息出现矛盾时。SEA-VL Conflict数据集应运而生,其构建基于SEACrowd/sea-vl_crowdsourcing中蕴含东南亚文化元素的英文图像描述。具体而言,研究者采用手工标注的方式,针对每一条原始忠实描述,将其中某一客观实体或属性——例如菜肴的配料、地标的方位、色彩或数量——替换为另一个虽具合理性但截然不同的值,从而精准制造出图像与文本间的冲突。每个样本均包含忠实描述与冲突描述,并围绕被修改的元素设计问题,同时提供图像侧的真实值、文本侧的被篡改值以及一个语义相近的干扰项。
使用方法
使用SEA-VL Conflict数据集时,研究者可借助Hugging Face Datasets库直接加载。数据集提供多种语言配置,可通过指定config_name参数(如'ar'、'zh'等)获取对应语言版本,或使用'default'配置获取英文原版。每一样本为标准字典格式,包含image、original_caption、conflicting_caption、question、image_bias、text_bias、distractor等字段。典型的评估流程是:向多模态模型输入图像与冲突文本,令其回答关于已变更属性的问题,通过对比模型输出与image_bias及text_bias的吻合程度,判断模型是否存在视觉或文本偏置。该过程无需额外微调,直接用于零样本评估。
背景与挑战
背景概述
SEA-VL Conflict数据集由SEACrowd团队构建,旨在评估视觉语言模型(VLM)在东南亚多文化场景下的图文冲突检测能力。该数据集从SEACrowd/sea-vl_crowdsourcing中精选100张富含地域文化特征的图像,通过人工修改每条英文描述中的单一实体(如食材、地标、颜色或数量等),生成与原图相悖的冲突文本,并配套设计提问聚焦于该变动要素。作为multilingual-vlm-conflict套件的一部分,它填补了跨文化图像-文本不一致性评估的空白,推动模型在资源稀缺领域推理鲁棒性的研究。
当前挑战
数据集的构建与使用面临多重挑战。领域层面,主流VLM常忽视区域性文化细节,而易将东南亚图像中的特征(如传统服饰、地方菜肴)误判为常识性错误,亟需此类冲突样本来暴露模型的文化盲区。构建过程中,人工设计冲突需确保修改后的文本在语义上仍具合理性、且提问与干扰项保持属性空间的一致性,这要求注释者对东南亚文化有深入理解;同时,每语言配置仅有100条样本的规模,对多语言泛化能力形成了严峻考验。
常用场景
经典使用场景
在视觉-语言模型(VLM)的研究版图中,图像-文本冲突检测已成为评估模型鲁棒性与对齐能力的关键试金石。SEA-VL Conflict数据集专为此场景而生,它精心构建了东南亚文化语境下的100例冲突样本:每张图像都配有忠实原文描述与一处捏造冲突的文本,冲突类型涵盖目标物替换、属性篡改、数量错置等。研究者利用该数据集可系统性地检验VLM是否能在细微语义扰动下保持视觉锚定,典型任务包括冲突识别、偏差感知与可信问答。这一精细化的冲突设计,使其成为多模态推理中细粒度一致性评测的权威基准。
解决学术问题
长久以来,主流VLM评估基准多聚焦于跨模态匹配或常识问答,却鲜有工具能揭示模型在面对图像与文本间局部语义崩裂时的脆弱性。SEA-VL Conflict直指这一学术盲区,它通过人工精修冲突构造,将研究焦点从宏观对齐转向微观冲突韧性。该数据集解决了如何量化VLM对单点信息反事实摄动的判别能力这一核心问题,并首次在东南亚地域专属的文化图像上搭建了冲突检测范式的验证框架。其发表推动了学界对多模态模型幻觉与事实一致性边界的深入认知,促使研究者重新审视视觉-语言对齐的本质局限。
实际应用
在面向部署的多模态AI系统中,SEA-VL Conflict所承载的冲突检测能力具有至关重要的实践价值。例如,当自动化图像描述工具被用于新闻配图辅助生成时,模型因未能识别描述中替换了地标名称或人数而传播的错误信息,可能引发严重的信任危机。本数据集可直接用于构建视觉内容审核与事实核验的对抗测试管线,帮助开发者在区域文化敏感的电商、社交与教育场景中,提前暴露并缓释模型因图像-文本冲突导致的幻觉风险。其在工程落地层面的意义,在于提供了一种低成本、高覆盖的鲁棒性失效探测手段。
数据集最近研究
最新研究方向
在视觉语言模型(VLM)领域,图像-文本冲突检测已成为评估模型鲁棒性与多模态对齐能力的前沿热点。与传统的视觉问答数据集不同,SEA-VL Conflict精心设计了包含单一对象或属性篡改的冲突图文对,并引入东南亚高语境文化图像,旨在检验模型在真实世界中面对细微但关键信息错配时的判别力。该数据集通过显式标注图像偏向、文本偏向与干扰项,为探究模型如何克服模态间隐性偏误、提升事实一致性提供了高精度测试基准。其多语言扩展(涵盖22种语言)以及冲突类型的系统分类,进一步推动了VLM在跨文化与复杂语义环境下的透明性与可靠性研究,为防范信息误导与虚假内容检测等热点应用奠定了评估基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务