physics-conflict
收藏资源简介:
该数据集是一个多语言视觉语言理解数据集,专注于检测图像描述与文本描述之间的冲突或偏见场景。数据集包含24种语言配置(包括阿拉伯语、中文、德语、法语、日语等)以及一个默认配置,每种语言配置均包含100个训练样本,总计约2400个样本。每个样本包含以下核心字段:图像数据(image字段)、原始图像描述(original_caption)、针对图像提出的问题(question)、图像中可能存在的偏见描述(image_bias)、针对原始描述的开放域答案(open-ended_answer)、与原始描述相矛盾的冲突描述(conflicting_caption)、冲突类型标识(conflict_type)、文本中可能存在的偏见描述(text_bias)、针对冲突描述的开放域答案(conflicting_open-ended_answer)、以及可能作为干扰项的描述(distractor)。数据集结构统一,支持多模态(图像+文本)输入,适用于视觉语言模型中的偏见检测、多模态矛盾分析、视觉问答(VQA)、文本-图像一致性评估等任务。
This dataset is a multilingual visual-language understanding dataset focused on detecting conflicting or biased scenarios between image captions and textual descriptions. The dataset includes 24 language configurations (including Arabic, Chinese, German, French, Japanese, etc.) and a default configuration, with 100 training samples per language configuration, totaling approximately 2400 samples. Each sample contains the following core fields: image data (image field), original image caption (original_caption), question about the image (question), potential biased descriptions in the image (image_bias), open-ended answer for the original caption (open-ended_answer), conflicting caption that contradicts the original description (conflicting_caption), conflict type identifier (conflict_type), potential biased descriptions in the text (text_bias), open-ended answer for the conflicting caption (conflicting_open-ended_answer), and descriptions that may serve as distractor items (distractor). The dataset has a unified structure, supports multimodal (image + text) inputs, and is applicable to tasks such as bias detection in visual-language models, multimodal conflict analysis, visual question answering (VQA), and text-image consistency evaluation.
数据集概述:physics-conflict
该数据集是一个多语言视觉-语言冲突数据集,专注于物理场景中的图文矛盾检测。
数据集结构
- 配置:数据集包含 24 个语言配置,每个配置对应一种语言,分别是:
ar(阿拉伯语)、cs(捷克语)、de(德语)、default(默认/英语)、el(希腊语)、es(西班牙语)、fa(波斯语)、fr(法语)、he(希伯来语)、hi(印地语)、id(印尼语)、it(意大利语)、ja(日语)、ko(韩语)、nl(荷兰语)、pl(波兰语)、pt(葡萄牙语)、ro(罗马尼亚语)、ru(俄语)、tr(土耳其语)、uk(乌克兰语)、vi(越南语)、zh(中文)。 - 数据划分:每个配置仅包含一个
train(训练)划分。 - 样本数量:每个语言配置的
train划分均包含 100 个样本。 - 数据集大小:各配置的数据集大小在 5.3 MB 至 5.5 MB 之间;
default配置为 5,357,694.0 字节,下载大小为 2,218,966 字节;其余语言配置下载大小在 5.3 MB 左右。
数据特征
每条数据包含以下字段,数据类型包括 image(图像)和 string(字符串)以及 int64(整数):
| 字段名称 | 数据类型 | 说明 |
|---|---|---|
image |
image | 物理场景图像 |
serial_no |
int64 | 序列号 |
original_caption |
string | 原始描述文本 |
question |
string | 针对图像的问题 |
image_bias |
string | 图像偏差描述 |
open-ended_answer |
string | 开放式答案 |
conflicting_caption |
string | 冲突性描述文本 |
conflict_type(或 conflict type) |
string | 冲突类型 |
text_bias |
string | 文本偏差描述 |
conflicting_open-ended_answer |
string | 冲突性开放式答案 |
distractor |
string | 干扰项 |
language |
string | 语言标识 |
数据来源与用途
该数据集由 multilingual-vlm-conflict 组织提供,旨在用于评估和提升多语言视觉-语言模型在物理场景中识别图文冲突的能力。数据覆盖 23 种不同语言(以及一个默认的英语配置),为跨语言视觉推理和矛盾检测任务提供了基准数据。




