遇见数据集

worldcuisines-conflict

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

WorldCuisines Conflict是一个多语言图像-文本冲突数据集,旨在评估视觉语言模型在面临图像内容与文本描述不一致时的推理能力。该数据集基于worldcuisines/vqa数据集(任务1,英文提示)构建,遵循CC-BY-SA-4.0许可证。每个数据样本包含一张真实图像、一个忠实描述图像内容的原始文本描述、一个经过修改的冲突文本描述(通过精确改变原始描述中的一个对象或属性来人为制造语义冲突),以及一个关于被修改元素的提问。数据字段包括:图像、原始描述、冲突描述、问题、图像中存在的真实值、冲突描述所断言的值、一个与两者都不同的合理干扰项,以及序列号、冲突类型和语言标识。数据集规模为每种语言配置包含100个训练样本,总计样本数少于1,000,支持包括阿拉伯语、中文、德语、法语、日语、俄语、西班牙语等在内的24种语言配置。它属于multilingual-vlm-conflict系列,适用于视觉问答、图像-文本到文本生成等任务,尤其关注模型在食物相关多模态场景中处理信息冲突的鲁棒性评估。

WorldCuisines Conflict is a multilingual image-text conflict dataset developed to evaluate the reasoning abilities of vision-language models (VLMs) when encountering inconsistencies between image content and textual descriptions. This dataset is built upon the worldcuisines/vqa dataset (Task 1, English prompts) and is released under the CC-BY-SA-4.0 license. Each data sample includes a real-world image, an original textual description that accurately depicts the image content, a modified conflicting textual description that artificially introduces semantic conflicts by precisely altering one object or attribute in the original description, and a query regarding the modified element. The data fields consist of: image, original description, conflicting description, query, ground truth value present in the image, value asserted by the conflicting description, a plausible distractor that differs from both aforementioned values, serial number, conflict type, and language identifier. The dataset contains 100 training samples per language configuration, with a total sample count of less than 1,000, and supports 24 language configurations including Arabic, Chinese, German, French, Japanese, Russian, Spanish, and others. It falls under the multilingual-vlm-conflict series, and is suitable for tasks such as visual question answering and image-text to text generation, with a particular focus on evaluating model robustness when handling information conflicts in food-related multimodal scenarios.

创建时间:
2026-06-29
原始信息汇总

数据集概述:WorldCuisines Conflict

基本信息

  • 数据集名称: WorldCuisines Conflict
  • 许可协议: CC-BY-SA-4.0
  • 任务类别: 视觉问答 (visual-question-answering)、图像到文本 (image-text-to-text)
  • 语言: 英语 (en)
  • 标签: vlm, image-text-conflict, food, multimodal
  • 数据规模: n<1K(少于1000个样本)

数据集来源与构建

  • 来源: 基于 worldcuisines/vqa 数据集(任务1,英文提示)构建。
  • 构建方法: 从源数据集中确定性地重新采样(种子=42),生成100个样本。
  • 冲突机制: 每对样本包含一张图像、一个真实的原始描述(original_caption)和一个冲突描述(conflicting_caption)。冲突描述更改了原始描述中的一个对象或属性,从而制造图像-文本冲突。
  • 资格归属: 该衍生数据集属于 multilingual-vlm-conflict 系列,与 rpg-conflict 具有相同的模式。

数据特征

每个样本包含以下字段:

字段 (Feature) 类型 (dtype) 描述
image image 图像(真实图像)
original_caption string 忠实于图像的描述
conflicting_caption string 更改一个对象/属性后的冲突描述
question string 关于被更改对象/属性的问题
image_bias string 真实值(在图像中正确体现)
text_bias string 冲突描述所声称的更改后的值
distractor string 一个合理的第三个选项,与 image_bias 和 text_bias 均不同
serial_no int64 来源标识符
conflict_type string 冲突类型
language string 描述语言(英语)
  • 核心逻辑: image_bias 是真实的菜品名称(即原始 VQA 的答案),text_bias 是一个错误的选项(由冲突描述断言),distractor 是另一个错误的选项。

数据切分与大小

  • 切分: 只有一个训练集 (train),每个语言配置包含100个样本。
  • 样本量: 每个子配置均为100个样本(共23个子配置,含 default)。
  • 数据大小示例:
    • 阿拉伯语 (ar): 约 35.82 MB
    • 捷克语 (cs): 约 35.82 MB
    • 德语 (de): 约 35.82 MB
    • ...(其他语言类似,略)...
    • 中文 (zh): 约 35.82 MB
  • 所有配置的总样本数: 100 (每个配置) * 23 (个配置) = 2300 个样本(仅训练集)。

子配置 (Configs)

数据集包含23个子配置,对应于不同的语言或默认配置:

  • ar (阿拉伯语)
  • cs (捷克语)
  • de (德语)
  • default (默认)
  • el (希腊语)
  • es (西班牙语)
  • fa (波斯语)
  • fr (法语)
  • he (希伯来语)
  • hi (印地语)
  • id (印度尼西亚语)
  • it (意大利语)
  • ja (日语)
  • ko (韩语)
  • nl (荷兰语)
  • pl (波兰语)
  • pt (葡萄牙语)
  • ro (罗马尼亚语)
  • ru (俄语)
  • tr (土耳其语)
  • uk (乌克兰语)
  • vi (越南语)
  • zh (中文)

许可与协议

  • 来源许可: 原始数据集 worldcuisines/vqa 采用 CC-BY-SA-4.0 许可。
  • 衍生许可: 此衍生数据集同样采用 CC-BY-SA-4.0 许可。
搜集汇总
数据集介绍
worldcuisines-conflict 数据集图片
构建方式
在跨文化与多模态理解领域,WorldCuisines-Conflict数据集通过精巧的对抗性构建策略诞生。它以世界美食图像为核心,从worldcuisines/vqa数据集中,基于固定随机种子(seed=42)确定性重采样100个样例。每个样本将原始图像与忠实描述(original_caption)配对,并通过对原文中恰好一个对象或属性进行修改,生成冲突性描述(conflicting_caption),从而在视觉与文本信息间植入矛盾。冲突围绕VQA问题中涉及的元素展开,如真实的菜品名称(image_bias)与文本错误断言的其他选项(text_bias)形成对照,另有一个保持在同一语义空间但与两者均不同的干扰项(distractor)。
特点
该数据集的核心特色在于其精细化的冲突类型标注与多语言兼容性。每个样本均明确标记了冲突类别(conflict_type),并涵盖图像偏置(image_bias)、文本偏置(text_bias)及干扰项,为视觉语言模型(VLM)的鲁棒性评估提供了结构化测试基准。值得注意的是,它支持阿拉伯语、汉语等20余种语言配置,每个语言子集均包含100个样例,在保持相同图像与冲突逻辑的基础上实现本地化。作为multilingual-vlm-conflict系列的一员,该数据集的轻量级规模(总数少于1K)与确定性重采样特性,使其适合作为微调或分析模型跨语言、跨文化感知偏差的诊断工具。
使用方法
使用此数据集时,研究者可通过HuggingFace的datasets库直接加载,选择目标语言配置(如加载中文版:load_dataset('worldcuisines-conflict', 'zh', split='train'))。典型应用场景包括:评估多模态模型(如VLM)对图像与文本矛盾的处理能力,通过比较模型对conflicting_caption与original_caption的回应,量化其受文本偏置影响的程度。数据特征中包含的image_bias和text_bias可作为标准答案,用于计算模型在视觉-文本冲突下的准确率与混淆倾向。此外,由于干扰项(distractor)与偏置项在语义上相近但不等价,该设计适合深入分析模型的细粒度判别能力与偏差传播路径。
背景与挑战
背景概述
多模态大语言模型在图像与文本联合理解中取得了显著进展,但模型在面对图像与描述之间存在语义冲突时往往表现出脆弱性,这一现象被称为图像-文本冲突问题。WorldCuisines-Conflict数据集正是在此背景下诞生,由研究者基于WorldCuisines VQA数据集构建,旨在系统性地评估和提升视觉语言模型对图文不一致场景的感知与推理能力。该数据集聚焦于美食领域,通过精心设计的多语言冲突样本,揭示了当前模型在跨模态一致性校验方面的深层缺陷,为探索模型在对抗性环境中的行为提供了重要的基准资源,对推动多模态鲁棒性研究具有里程碑式的意义。
当前挑战
该数据集所解决的核心领域挑战在于,多模态模型在标准图文匹配任务中表现优异,然而当面对“图像中真实菜品”与“冲突描述中虚假属性”之间的对立时,模型往往盲目倾向于文本先验,暴露出缺乏底层视觉因果推理能力。具体挑战包括:一、构建过程中需要精准定位单一冲突点,确保原描述与冲突描述仅在特定属性上对立,同时保持语义自然度,这对数据标注的精细度要求极高;二、如何设计合理的干扰项与冲突类型,使其既能有效区分模型偏见又避免引入额外噪声;三、跨语言版本的一致冲突构造也增加了数据生产的管理难度。
常用场景
经典使用场景
世界美食冲突数据集(WorldCuisines Conflict)是视觉语言模型评估领域中一颗璀璨的明珠,专门用于检验多模态系统在面对图文信息矛盾时的鲁棒性与推理能力。该数据集精心构造了100个样本,每个样本包含一张真实的美食图像、一个忠实于图像的原始描述、以及一个仅改动单一对象或属性的矛盾描述。通过设计有针对性的问题,要求模型在图像偏差和文本偏差之间进行抉择,并识别出合理的干扰项。这一设计使得该数据集成为评估视觉问答(VQA)和图像文本推理任务中模型抗干扰性能的经典基准,尤其适合探究模型是否真正理解视觉内容而非简单依赖语言先验。
衍生相关工作
该数据集作为多语言视觉语言模型冲突评估套件(multilingual-vlm-conflict)的核心成员,与其姐妹数据集rpg-conflict共同构建了系统的图文冲突评估框架。后续研究者在此基础上拓展出针对不同冲突类型的专项评估集,如属性替换冲突、实体替换冲突等。该数据集启发了对抗性样本生成方法的研究,促使学界开发出能够主动构造图文矛盾的自动框架。更重要的是,它推动了若干提升模型冲突处理能力的技术工作,包括基于对比学习的模态对齐优化策略和利用反事实推理增强视觉接地能力的方法,这些工作共同形成了视觉语言模型鲁棒性研究的重要分支。
数据集最近研究
最新研究方向
面对视觉语言模型中日益凸显的模态偏差与鲁棒性挑战,worldcuisines-conflict数据集巧妙融合饮食文化意象与多语言视觉问答,构建了精巧的图像-文本冲突基准。该数据集的每个样本通过精准篡改单一实体或属性,生成与原图相悖的对抗性描述,并配以细粒度的问题、二元偏见候选项及语义相近的干扰项,系统性地评估模型在歧义与误导语境下的认知韧性。在跨语言、跨模态的前沿探索中,这一资源为检验大型视觉-语言系统在真实世界信息矛盾场景下的推理偏差与泛化能力提供了关键标尺,也直接服务于食品安全议题与跨文化饮食理解等更广泛的社会应用需求。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务