遇见数据集

physics-conflict

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

该数据集是一个多语言视觉语言理解数据集,专注于检测图像描述与文本描述之间的冲突或偏见场景。数据集包含24种语言配置(包括阿拉伯语、中文、德语、法语、日语等)以及一个默认配置,每种语言配置均包含100个训练样本,总计约2400个样本。每个样本包含以下核心字段:图像数据(image字段)、原始图像描述(original_caption)、针对图像提出的问题(question)、图像中可能存在的偏见描述(image_bias)、针对原始描述的开放域答案(open-ended_answer)、与原始描述相矛盾的冲突描述(conflicting_caption)、冲突类型标识(conflict_type)、文本中可能存在的偏见描述(text_bias)、针对冲突描述的开放域答案(conflicting_open-ended_answer)、以及可能作为干扰项的描述(distractor)。数据集结构统一,支持多模态(图像+文本)输入,适用于视觉语言模型中的偏见检测、多模态矛盾分析、视觉问答(VQA)、文本-图像一致性评估等任务。

This dataset is a multilingual visual-language understanding dataset focused on detecting conflicting or biased scenarios between image captions and textual descriptions. The dataset includes 24 language configurations (including Arabic, Chinese, German, French, Japanese, etc.) and a default configuration, with 100 training samples per language configuration, totaling approximately 2400 samples. Each sample contains the following core fields: image data (image field), original image caption (original_caption), question about the image (question), potential biased descriptions in the image (image_bias), open-ended answer for the original caption (open-ended_answer), conflicting caption that contradicts the original description (conflicting_caption), conflict type identifier (conflict_type), potential biased descriptions in the text (text_bias), open-ended answer for the conflicting caption (conflicting_open-ended_answer), and descriptions that may serve as distractor items (distractor). The dataset has a unified structure, supports multimodal (image + text) inputs, and is applicable to tasks such as bias detection in visual-language models, multimodal conflict analysis, visual question answering (VQA), and text-image consistency evaluation.

创建时间:
2026-06-27
原始信息汇总

数据集概述:physics-conflict

该数据集是一个多语言视觉-语言冲突数据集,专注于物理场景中的图文矛盾检测。

数据集结构

  • 配置:数据集包含 24 个语言配置,每个配置对应一种语言,分别是:ar(阿拉伯语)、cs(捷克语)、de(德语)、default(默认/英语)、el(希腊语)、es(西班牙语)、fa(波斯语)、fr(法语)、he(希伯来语)、hi(印地语)、id(印尼语)、it(意大利语)、ja(日语)、ko(韩语)、nl(荷兰语)、pl(波兰语)、pt(葡萄牙语)、ro(罗马尼亚语)、ru(俄语)、tr(土耳其语)、uk(乌克兰语)、vi(越南语)、zh(中文)。
  • 数据划分:每个配置仅包含一个 train(训练)划分。
  • 样本数量:每个语言配置的 train 划分均包含 100 个样本
  • 数据集大小:各配置的数据集大小在 5.3 MB 至 5.5 MB 之间;default 配置为 5,357,694.0 字节,下载大小为 2,218,966 字节;其余语言配置下载大小在 5.3 MB 左右。

数据特征

每条数据包含以下字段,数据类型包括 image(图像)和 string(字符串)以及 int64(整数):

字段名称 数据类型 说明
image image 物理场景图像
serial_no int64 序列号
original_caption string 原始描述文本
question string 针对图像的问题
image_bias string 图像偏差描述
open-ended_answer string 开放式答案
conflicting_caption string 冲突性描述文本
conflict_type(或 conflict type string 冲突类型
text_bias string 文本偏差描述
conflicting_open-ended_answer string 冲突性开放式答案
distractor string 干扰项
language string 语言标识

数据来源与用途

该数据集由 multilingual-vlm-conflict 组织提供,旨在用于评估和提升多语言视觉-语言模型在物理场景中识别图文冲突的能力。数据覆盖 23 种不同语言(以及一个默认的英语配置),为跨语言视觉推理和矛盾检测任务提供了基准数据。

搜集汇总
数据集介绍
physics-conflict 数据集图片
构建方式
在物理教学与评估领域,多模态大模型常因视觉与文本线索的差异而产生推理偏差。为系统性地探究这一现象,physics-conflict数据集应运而生。该数据集以物理场景图像为核心,为每张图像精心构建了一个原始描述与一个相冲突的描述,并配以针对物理概念的开放性问答。每个样本包含图像偏差、文本偏差、干扰项及冲突类型等结构化字段,通过在不同语言配置下各设100个样本,形成了涵盖23种语言的平行语料库,旨在跨语言评估模型在面对信息冲突时的鲁棒性。
特点
physics-conflict数据集的核心特色在于其精巧的冲突设计与多语言覆盖。每张图像对应的原始描述与冲突描述在物理事实上形成对立,且冲突类型被明确标注,为研究模型如何受图像偏差与文本偏差影响提供了精确的剖析工具。数据集中同时包含了原始答案与冲突答案,使得研究者能够量化比较模型在一致信息与矛盾信息下的表现差异。此外,23种语言的配置使其成为评估多语言环境下视觉-语言模型物理推理能力的重要基准。
使用方法
使用physics-conflict数据集时,可采用Hugging Face的datasets库通过指定config_name加载特定语言数据。每个样本的结构化字段便于研究者构建对比实验:利用original_caption与conflicting_caption的配对输入,观测模型生成的open-ended_answer与conflicting_open-ended_answer之间的变化。image_bias与text_bias字段可用于分析偏差来源,而distractor字段则支持干扰项影响的研究。该数据集特别适用于评估多模态大模型在物理常识推理中的一致性与鲁棒性,以及跨语言泛化能力的实证分析。
背景与挑战
背景概述
多模态大语言模型在理解复杂物理场景时,常因视觉与语言信息间的隐含冲突而产生推理错误。physics-conflict数据集应运而生,旨在系统性地评估与提升模型在存在物理冲突条件下的视觉问答能力。该数据集创建于近期,覆盖23种语言,每语言包含100个精心构造的样本,每个样本由图像、原始描述、冲突描述及开放式问题等构成,聚焦于识别和利用物理规则中的矛盾。其核心研究问题在于揭示当前模型在处理文本与图像语义不一致时的脆弱性,并为鲁棒的跨模态理解提供标准化测试基准,对推动多模态场景下的逻辑推理和常识校验研究具有重要价值。
当前挑战
该领域面临的首要挑战是多模态模型在视觉-语言冲突场景下的鲁棒性不足,模型易受误导性文本影响而忽视图像中蕴含的实际物理规则。具体而言,模型需要克服视觉与文本偏见,在矛盾信息中正确推理出符合物理定律的答案。在数据集构建过程中,挑战在于跨语言、跨文化背景下生成语义一致且物理上合理的冲突样本,确保每种语言的冲突类型(如运动、重力、浮力等)覆盖均衡,同时保证图像与矛盾文本对自然逼真,避免人工痕迹干扰模型评测的真实性。
常用场景
经典使用场景
在物理学科普与教育领域,physics-conflict数据集为评估与提升多模态模型在物理知识上的鲁棒性提供了关键基准。它通过精心设计的图文冲突样本(如令水在特定条件下不结冰),专门用于测试视觉语言模型在面对与基本物理定律相悖的图片和描述时的推理能力。该数据集涵盖22种语言,每种语言包含100条训练数据,每条数据都包括原始图像、问题、正确答案以及具有视觉或文本误导的答案,为跨语言与跨模态的冲突检测与科学常识修正研究奠定了标准化评测平台。
衍生相关工作
基于physics-conflict数据集,学界已衍生了多项富有影响力的研究工作。研究人员依托其多语言冲突样本,构建了跨文化的科学常识对抗攻击框架,用于系统性评估大模型对物理谬误的敏感性。另一类工作专注于设计去偏训练算法,利用数据集中提供的图像偏差和文本偏差字段训练模型在感知阶段即过滤违反物理规律的线索。此外,一些研究者将冲突样本融入提示学习策略中,引导模型在生成视觉描述或回答开放式物理问题时,主动校验输出与基本科学事实的一致性,显著提升了模型在科学问答和视频描述等下游任务中的可靠性。
数据集最近研究
最新研究方向
physics-conflict数据集聚焦于多模态大模型在物理常识推理中的认知冲突检测与鲁棒性评估,通过构建包含原始-矛盾图文对及跨语言干扰项的结构化样本,系统性地探究模型在物体属性、运动规律等基础物理知识上的理解偏差。该研究方向紧密关联大语言模型可信赖性与可解释性这一前沿热点,其采用的多语言(涵盖22种语言)冲突性问答与图文偏见标注方案,为揭示视觉-语言对齐中的物理认知短板及跨文化泛化瓶颈提供了关键基准,在推动物理世界常识的可靠表达与安全应用领域具有重要标杆意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务