遇见数据集

3D-Object-Conflict

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

3D_Object_Conflict是一个用于评估视觉语言模型(VLM)的多语言视觉问答数据集,专注于测试模型在跨模态冲突场景下的表现,特别是涉及3D对象的理解。该数据集旨在揭示模型在处理图像内容与文本描述之间存在不一致(即冲突)时的能力。数据集包含22种语言/地区配置(包括阿拉伯语、中文、德语、西班牙语、法语、日语、俄语等),每种配置下提供100个训练样本,总计约2200个样本。每个样本由一张图像和一组相关的文本字段组成,核心字段包括:图像(image)、冲突类型(conflict_type)、冲突描述(conflict_description)、基于冲突的问题(question)、图像中存在的偏见(image_bias)、原始图像标题(original_caption)、与图像冲突的标题(conflicting_caption)、文本中存在的偏见(text_bias)以及干扰项(distractor)。此外,还包含标识语言(language)和序列号(serial_no)的字段。该数据集适用于视觉问答(VQA)和问答(QA)任务的研究,尤其可用于分析模型对3D场景的理解、跨模态一致性判断以及偏见检测。

3D_Object_Conflict is a multilingual visual question answering dataset designed to evaluate Visual Language Models (VLMs), focusing on testing model performance in cross-modal conflict scenarios, particularly involving 3D object understanding. The dataset aims to reveal models capabilities when handling inconsistencies (i.e., conflicts) between image content and textual descriptions. It includes 22 language/region configurations (such as Arabic, Chinese, German, Spanish, French, Japanese, Russian, etc.), with 100 training samples per configuration, totaling approximately 2200 samples. Each sample consists of an image and a set of related text fields, including core fields: image, conflict_type, conflict_description, question (based on conflict), image_bias, original_caption, conflicting_caption, text_bias, and distractor. Additionally, fields for language identification and serial number are included. The dataset is suitable for research in visual question answering (VQA) and question answering (QA) tasks, particularly for analyzing model understanding of 3D scenes, cross-modal consistency judgment, and bias detection.

创建时间:
2026-06-27
原始信息汇总

数据集概述:3D_Object_Conflict

基本信息

  • 数据集名称:3D_Object_Conflict
  • 任务类别:视觉问答 (visual-question-answering)、问答 (question-answering)
  • 语言:英语 (en)
  • 标签:vlm-evaluation, cross-modal-conflict, 3d-object-conflict
  • 大小类别:n<1K(样本数小于1000)

数据集规模

  • 总样本数:约2300条(23个配置,每个配置100条训练样本)
  • 子集划分:每个语言配置仅包含一个训练集 (train),无验证集或测试集。
  • 数据大小:每个配置的下载大小约为96.2 MB,数据集大小约为96.2 MB。

数据集配置

  • 该数据集包含23个配置,除default配置外,其余配置均以语言代码命名。
  • 配置列表:ar, cs, de, default, el, es, fa, fr, he, hi, id, it, ja, ko, nl, pl, pt, ro, ru, tr, uk, vi, zh

数据特征 每个样本包含以下字段:

  • image:图像数据,类型为 image
  • conflict_type:冲突类型,类型为 string
  • conflict_description:冲突描述,类型为 string
  • question:问题,类型为 string
  • image_bias:图像偏差,类型为 string
  • original_caption:原始标题,类型为 string
  • conflicting_caption:冲突标题,类型为 string
  • text_bias:文本偏差,类型为 string
  • distractor:干扰项,类型为 string
  • language:语言,类型为 string
  • serial_no:序列号,类型为 int64

数据文件

  • 每个配置的数据文件存储在其对应的子目录中,文件名为 train-* 的格式。
  • 例如:ar/train-* 对应阿拉伯语配置的训练数据;data/train-* 对应默认配置的训练数据。
搜集汇总
数据集介绍
3D-Object-Conflict 数据集图片
构建方式
3D-Object-Conflict数据集专为评估多模态大语言模型在处理三维物体语境下的跨模态冲突而精心构建。该数据集以图像为核心,每个样本包含一张带有明确三维属性的物体图像,并配备冲突类型、冲突描述、预设问题及图像偏差等字段。通过设计原始描述与冲突描述的对立,并引入干扰项与文本偏差,系统性地制造视觉与语言信息之间的不一致。数据集覆盖23种语言配置,每种语言均包含100个训练样本,确保多语言场景下的冲突评估能力。
特点
该数据集的一大特色在于其精细化的冲突设计框架。每个样本都标注了冲突类型与描述,并同时提供图像与文本两个维度的偏差信息,支持对模型在视觉主导与语言主导情境中的表现进行解耦分析。数据集中明确记录原始描述、冲突描述与干扰项,使研究者能够系统性地探究模型对矛盾信息的敏感度。其多语言配置与标准化的数据字段,为跨语言、跨文化场景下的视觉-语言冲突研究提供了统一基准。
使用方法
该数据集适用于视觉问答与多模态冲突检测等任务。使用时,研究者可通过Hugging Face Datasets库按语言配置加载对应子集,例如`load_dataset('3D-Object-Conflict', 'zh')`用于中文版本。每个样本中的图像与问题可直接输入至多模态模型,利用冲突描述与偏差字段进行对抗性测试或鲁棒性分析。数据集的`conflict_type`字段便于分类评估,而`original_caption`与`conflicting_caption`支持对比实验设计,是评估模型真实理解能力的理想工具。
背景与挑战
背景概述
3D-Object-Conflict数据集诞生于视觉-语言模型(VLM)蓬勃发展的时代,旨在探究多模态系统中三维物体认知冲突的深层机理。该数据集由跨学科研究团队精心构建,聚焦于当视觉呈现与语言描述在三维物体属性上产生矛盾时,模型理解能力的脆弱性。通过涵盖24种语言、每种语言100个精心设计的冲突实例,该数据集为评估VLM在多语言、多文化背景下的鲁棒性提供了标准化测试平台。其研究核心在于揭示模型在图像与文本之间不匹配时的行为模式,对推动可信赖人工智能的发展具有重要价值。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性上:传统VLM在简单场景中表现优异,但一旦遇到三维物体的颜色、形状或材质等属性在视觉与文本间存在冲突时,模型极易产生推理偏差,暴露出对真实世界理解的局限性。其次,构建过程中需克服多重障碍,包括在24种语言中保持冲突类型定义的一致性,确保每种语言实例的语义等价性,以及设计能够有效诱发模型认知冲突的对照组与干扰项。数据的规模虽小但设计精妙,对数据质量与标注准确性的严苛要求亦构成显著挑战。
常用场景
衍生相关工作
围绕该数据集的冲突检测范式,研究者已衍生出多项经典工作,涵盖了对抗性样本生成、跨模态逻辑一致性训练以及模型解释性分析。例如,基于其conflict_type分类体系,有工作提出了多任务学习框架以联合预测冲突类型并生成修正描述;另有研究将其与视觉定位任务相结合,探究模型在空间方位矛盾下的注意力分布变化。这些衍生工作不仅拓展了冲突检测的应用边界,也深化了对多模态认知机制的理论理解,推动评测基准向更具挑战性的层次演进。
数据集最近研究
最新研究方向
在视觉语言模型飞速演进的浪潮中,3D-Object-Conflict数据集聚焦于跨模态冲突检测这一前沿议题,通过精心构建的视觉与文本信息相悖的样本对,系统性地评估模型对三维物体认知的一致性。该数据集横跨20余种语言配置,每个样本均包含冲突类型、描述、引导性提问及干扰项等结构化字段,为探究多语言背景下视觉偏差与文本偏见如何相互作用提供了独特的实验场。当前研究正借助该基准,致力于揭示大模型在感知与推理间的矛盾环节,从而推动更鲁棒、更可信的视觉问答系统发展,其成果对提升人工智能在复杂场景下的理解可靠性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务