3D-Object-Conflict
收藏资源简介:
3D_Object_Conflict是一个用于评估视觉语言模型(VLM)的多语言视觉问答数据集,专注于测试模型在跨模态冲突场景下的表现,特别是涉及3D对象的理解。该数据集旨在揭示模型在处理图像内容与文本描述之间存在不一致(即冲突)时的能力。数据集包含22种语言/地区配置(包括阿拉伯语、中文、德语、西班牙语、法语、日语、俄语等),每种配置下提供100个训练样本,总计约2200个样本。每个样本由一张图像和一组相关的文本字段组成,核心字段包括:图像(image)、冲突类型(conflict_type)、冲突描述(conflict_description)、基于冲突的问题(question)、图像中存在的偏见(image_bias)、原始图像标题(original_caption)、与图像冲突的标题(conflicting_caption)、文本中存在的偏见(text_bias)以及干扰项(distractor)。此外,还包含标识语言(language)和序列号(serial_no)的字段。该数据集适用于视觉问答(VQA)和问答(QA)任务的研究,尤其可用于分析模型对3D场景的理解、跨模态一致性判断以及偏见检测。
3D_Object_Conflict is a multilingual visual question answering dataset designed to evaluate Visual Language Models (VLMs), focusing on testing model performance in cross-modal conflict scenarios, particularly involving 3D object understanding. The dataset aims to reveal models capabilities when handling inconsistencies (i.e., conflicts) between image content and textual descriptions. It includes 22 language/region configurations (such as Arabic, Chinese, German, Spanish, French, Japanese, Russian, etc.), with 100 training samples per configuration, totaling approximately 2200 samples. Each sample consists of an image and a set of related text fields, including core fields: image, conflict_type, conflict_description, question (based on conflict), image_bias, original_caption, conflicting_caption, text_bias, and distractor. Additionally, fields for language identification and serial number are included. The dataset is suitable for research in visual question answering (VQA) and question answering (QA) tasks, particularly for analyzing model understanding of 3D scenes, cross-modal consistency judgment, and bias detection.
数据集概述:3D_Object_Conflict
基本信息
- 数据集名称:3D_Object_Conflict
- 任务类别:视觉问答 (visual-question-answering)、问答 (question-answering)
- 语言:英语 (en)
- 标签:vlm-evaluation, cross-modal-conflict, 3d-object-conflict
- 大小类别:n<1K(样本数小于1000)
数据集规模
- 总样本数:约2300条(23个配置,每个配置100条训练样本)
- 子集划分:每个语言配置仅包含一个训练集 (train),无验证集或测试集。
- 数据大小:每个配置的下载大小约为96.2 MB,数据集大小约为96.2 MB。
数据集配置
- 该数据集包含23个配置,除
default配置外,其余配置均以语言代码命名。 - 配置列表:
ar,cs,de,default,el,es,fa,fr,he,hi,id,it,ja,ko,nl,pl,pt,ro,ru,tr,uk,vi,zh。
数据特征 每个样本包含以下字段:
- image:图像数据,类型为
image。 - conflict_type:冲突类型,类型为
string。 - conflict_description:冲突描述,类型为
string。 - question:问题,类型为
string。 - image_bias:图像偏差,类型为
string。 - original_caption:原始标题,类型为
string。 - conflicting_caption:冲突标题,类型为
string。 - text_bias:文本偏差,类型为
string。 - distractor:干扰项,类型为
string。 - language:语言,类型为
string。 - serial_no:序列号,类型为
int64。
数据文件
- 每个配置的数据文件存储在其对应的子目录中,文件名为
train-*的格式。 - 例如:
ar/train-*对应阿拉伯语配置的训练数据;data/train-*对应默认配置的训练数据。




