遇见数据集

coco-counterfactual-conflict

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

COCO-Counterfactual Conflict是一个专门设计用于评估视觉语言模型在图像-文本冲突场景下表现的基准数据集。它基于Intel/COCO-Counterfactuals构建,通过构造图像与描述文本之间的语义冲突来测试模型对多模态信息的理解和推理能力。每个数据样本包括一个真实图像、一个与该图像内容一致的真实描述(original_caption),以及一个通过修改真实描述中某个关键名词或属性而生成的冲突描述(conflicting_caption)。修改是“最小”的,仅改变一个元素,从而创建图像内容与文本描述之间的明确矛盾。数据集的核心是围绕这个被修改的元素构建的问答对:一个直接针对该元素的提问(question),图像中实际存在的真实值(image_bias),冲突描述中声称的错误值(text_bias),以及一个语义相关但不同于前两者的干扰选项(distractor)。此外,每个样本还包含序列号、冲突类型和语言信息。数据集规模为100个样本,通过确定性采样(种子为42)从源数据集中提取。它提供了包括阿拉伯语、中文、德语、法语、日语、俄语等在内的多种语言配置版本,每个语言版本均包含100个样本。数据格式为多模态,包含图像和多个文本字段。该数据集属于“multilingual-vlm-conflict”基准套件的一部分,适用于视觉问答、反事实推理、模型鲁棒性评估以及多模态冲突检测等研究任务。数据集遵循CC-BY-4.0许可协议。

COCO-Counterfactual Conflict is a benchmark dataset specifically designed to evaluate the performance of vision-language models (VLMs) in image-text conflict scenarios. It is built upon Intel/COCO-Counterfactuals, and tests models' multimodal understanding and reasoning capabilities by constructing semantic conflicts between images and their descriptive texts. Each data sample includes a real image, a ground-truth caption (original_caption) that matches the image content, and a conflicting caption generated by modifying a single key noun or attribute in the ground-truth caption. This modification is minimal, altering only one element to create explicit contradictions between the image content and the textual description. The core of the dataset consists of question-answer pairs centered on this modified element: a direct question targeting the element (question), the ground truth value actually present in the image (image_bias), the erroneous value claimed in the conflicting caption (text_bias), and a distractor option that is semantically related but distinct from the first two. Additionally, each sample contains a serial number, conflict type, and language information. The dataset contains 100 samples, extracted from the source dataset via deterministic sampling with a random seed of 42. It offers multilingual configuration versions including Arabic, Chinese, German, French, Japanese, Russian, etc., with 100 samples per language version. The data is multimodal, comprising images and multiple text fields. This dataset is part of the "multilingual-vlm-conflict" benchmark suite, and is suitable for research tasks including visual question answering, counterfactual reasoning, model robustness evaluation, and multimodal conflict detection. The dataset is released under the CC-BY-4.0 license.

创建时间:
2026-06-29
原始信息汇总

数据集概述:COCO-Counterfactual Conflict

该数据集是一个图像-文本冲突数据集,基于 Intel/COCO-Counterfactuals 构建,专门用于评估视觉语言模型(VLM)在多语言环境下的鲁棒性。

核心信息

  • 任务类别: 视觉问答 (visual-question-answering) 和 图像文本转文本 (image-text-to-text)
  • 语言: 英语 (en)
  • 许可协议: CC-BY-4.0
  • 数据规模: 小于 1000 条样本 (n<1K)

数据来源与构建

  • 源数据集: Intel/COCO-Counterfactuals
  • 构建方法: 从源数据集中每个最小对比对(即仅改变一个名词主体的两个标题)中,保留与源图像匹配的“真实”标题(original_caption),并将另一条标题作为冲突标题(conflicting_caption)。自动提取被交换的名词,并人工编写问题和干扰项。

数据内容与结构

每个样本包含图像与一组冲突的文本描述,核心是创造图像与文本之间的冲突。

字段 描述
image 真实图像
original_caption 与图像一致的标题
conflicting_caption 更改了原始标题中一个对象或属性的冲突标题
question 针对被更改的对象或属性提出的问题
image_bias 图像中真实的值
text_bias 冲突标题中声称的更改后的值
distractor 一个合理的第三个选项,与两个bias不同
serial_no 源数据集标识符
conflict_type 冲突类别
language 标题语言(英语)

配置与数据划分

数据集提供多种语言配置(config),每个配置均为独立的训练集(train),包含 100 个样本。

  • 可用配置: ar, cs, de, default, el, es, fa, fr, he, hi, id, it, ja, ko, nl, pl, pt, ro, ru, tr, uk, vi, zh
  • 默认配置: default,对应语言为英语。
  • 数据划分: 每个配置仅有 train 分割,均为确定性地从源数据集重采样得到(种子 = 42)。

规模与大小

  • 样本数: 每配置 100 条,共 23 个配置,总计 2300 条样本。
  • 数据集大小: 每个配置的数据集大小约为 6.2 MB(下载大小约为 6.2 MB)。
搜集汇总
数据集介绍
coco-counterfactual-conflict 数据集图片
构建方式
在多模态理解的前沿,视觉语言模型常因图文冲突而陷入推理困境,而coco-counterfactual-conflict数据集正是为此类挑战而生。该数据集基于Intel/COCO-Counterfactuals精心构建,选取其中每个最小对比对(minimal pair)中与图像匹配的真实图像及描述作为原始内容,同时将反事实描述作为冲突文本。自动提取被替换的名词,分别作为图像真实锚点与文本偏置,再由人工为每个示例撰写关于所变更元素的问题及其干扰项。
特点
数据集的核心亮点在于精细化的冲突设计。每个样本仅变更一个核心名词或属性,构成精准的图像-文本冲突,并围绕该变更点设计针对性问题。它明确标注了图像真实值、文本偏置值以及语义相近的干扰项,同时记录冲突类型,为探究视觉语言模型对细微语义变化的敏感性提供了高度可控的测试环境。
使用方法
该数据集专为视觉问答与图文冲突检测任务而设计。用户可通过加载不同语言配置(如'ar'、'zh'等)获取对应样本。每个样本包含图像、真实描述、冲突描述及问题,适合用于评估视觉语言模型在反事实情境下的推理鲁棒性,或作为训练数据增强模型对图文冲突的识别与应对能力。
背景与挑战
背景概述
在视觉语言模型(VLM)迅猛发展的当下,模型对于图文一致性理解的能力愈发受到关注。然而,现有模型在面对精心构造的图文冲突场景时往往暴露出脆弱性,这促使研究者设计专门的诊断数据集。coco-counterfactual-conflict数据集正是基于这一研究需求而诞生,由Intel研究团队于近年构建,核心研究问题聚焦于VLM能否准确识别出图像描述中的单一实体或属性被反事实替换后产生的冲突。该数据集从COCO-Counterfactuals中精选100个高质量样本,每个样本包含真实图像、忠实描述与冲突描述,并配以针对性问题和三个候选答案(图像真相、文本谎言、干扰项),为评估VLM的跨模态推理能力提供了精细化的测试基准。其在多语言VLM冲突测试套件中占据重要位置,对推动模型鲁棒性研究具有标杆意义。
当前挑战
该数据集所应对的领域挑战在于,当前视觉语言模型虽在常规图文匹配任务上表现优异,却极易被单一实体替换的局部冲突所欺骗,暴露出模型对语义精细化对齐能力的欠缺。围绕反事实冲突的构造本身亦构成构建挑战:如何确保冲突描述仅改变一个关键名词而保持其余部分语义通畅,如何自动提取冲突中所涉及的正反实体(image_bias与text_bias)并设计出语义相关且不引入额外偏误的干扰项,均需精细的自动化流程与人工审核相结合。此外,数据规模虽小但要求样本的冲突类型覆盖足够广泛(如物体替换、属性变换等),同时需为每张图像跨语言适配一致性描述以支持多语言评测,这些都对数据构建的质量控制与语言资源投入提出了严苛要求。
常用场景
经典使用场景
在视觉语言模型(VLM)的稳健性评估领域,COCO-Counterfactual Conflict数据集被广泛用于探查模型对图文冲突的敏感度。该数据集精心构建了图像与文本在单一对象或属性上的反事实冲突对,配合针对性提问,能够精确衡量模型在面临模态矛盾时的判断能力,成为检验VLM决策鲁棒性的标杆性测试工具。
实际应用
实际部署中,该数据集可用于筛选和优化高风险的视觉问答系统。例如在自动驾驶场景下,模型若仅凭路牌文字而非实际路况做出判断,极易引发安全隐患。利用COCO-Counterfactual Conflict的冲突样本进行压力测试,能有效甄别并改进此类偏差,提升多模态交互系统的可靠性与可解释性。
衍生相关工作
围绕该数据集,已涌现一系列探讨模态偏好与冲突消解的研究工作。典型如引用该数据集的论文利用其构建了多语言冲突基准套件(multilingual-vlm-conflict),拓展了跨语言场景下的评估维度。相关工作聚焦于探究VLM在图文矛盾时的决策偏向,并尝试通过对抗训练或注意力机制调整来缓解模态误导问题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务