遇见数据集

pendulum-conflict

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

Pendulum Conflict Dataset是一个手动整理的多模态冲突评估数据集,包含100个精心挑选的样本,源自akomand/counterfactual_pendulum数据集。该数据集专门设计用于在受控的视觉-文本冲突场景下,评估多模态大语言模型的性能。每个样本包括一个物理摆锤场景的图像,配有两段文本描述:一段真实描述图像内容,另一段包含一个错误属性的冲突描述。此外,每个样本还提供一个评估问题、三个候选答案选项(对应视觉真实答案、文本偏见答案和干扰项),以及冲突类型、序列号、语言、原始行ID等元数据。样本均匀分为四个冲突类别:摆锤角度(angle)、光照条件(light)、阴影长度(shadow_len)和阴影位置(shadow_pos),每类25个样本。在整理过程中,对原始数据集中的20个“弱”反事实实例进行了手动修正和强化,以确保视觉与文本信息之间存在明确且强烈的结构性对立。数据集主要以英语呈现,但也提供了阿拉伯语、中文、德语、法语等多种语言版本,每个语言版本包含100个训练样本,并具有相同的结构化字段。

The Pendulum Conflict Dataset is a manually curated multimodal conflict evaluation dataset containing 100 carefully selected samples, derived from the akomand/counterfactual_pendulum dataset. It is specifically designed to evaluate the performance of multimodal large language models in controlled visual-textual conflict scenarios. Each sample includes an image of a physical pendulum scene paired with two text descriptions: one is an original description that truthfully reflects the image content, and the other is a conflict description containing an incorrect attribute. Additionally, each sample provides an evaluation question targeting the conflict attribute, three candidate answer options (corresponding to the visual truth answer, text bias answer, and a distractor), along with metadata such as conflict type, sequence number, language, and original row ID. The samples are evenly divided into four conflict categories: pendulum angle (angle), lighting condition (light), shadow length (shadow_len), and shadow position (shadow_pos), with 25 samples per category. During curation, 20 weak counterfactual instances from the original dataset were manually corrected and strengthened to ensure clear and strong structural opposition between visual and textual information. The dataset is primarily presented in English but also includes configuration versions in multiple languages such as Arabic, Chinese, German, and French, each language version containing 100 training samples with the same structured fields.

创建时间:
2026-06-30
原始信息汇总

数据集概述:Pendulum Conflict Dataset

该数据集是从 akomand/counterfactual_pendulum 数据集中手动筛选出的一个子集,包含 100 个精心挑选的多模态冲突样本,专门用于评估多模态大语言模型(MLLMs)在受控视觉-文本冲突下的表现。

数据集规模与结构

  • 总样本数: 100 个
  • 冲突类别: 包含 4 种视觉属性冲突,每类 25 个,具体为:
    • angle(角度)
    • light(光照)
    • shadow_len(阴影长度)
    • shadow_pos(阴影位置)
  • 语言: 所有文本为英语。
  • 审核与修正: 其中 20 个样本已由作者团队人工审核并修正(is_patched 字段标记为真)。

数据字段说明

每条记录包含以下字段:

  • image: 视觉摆锤场景的图片。
  • file_name: 原始图片的文件名。
  • original_caption: 对图片真实情况的完整描述(4句话)。
  • conflicting_caption: 包含一个错误属性的矛盾描述(4句话)。
  • question: 针对冲突属性的评估问题。
  • image_bias: 符合视觉真实的正确答案选项。
  • text_bias: 符合矛盾文本的错误答案选项。
  • distractor: 既不符合图像也不符合文本的第三个干扰选项。
  • serial_no: 样本在该子集中的编号(1-100)。
  • conflict_type: 冲突的具体属性类型。
  • language: 文本的语言(均为英语)。
  • original_row_id: 样本在原始数据集中的行索引。
  • original_text_bias: 原始数据集中的文本错误选项(若已修补则记录)。
  • is_patched: 布尔值,指示该样本是否被手动修正过。

数据集配置与划分

数据集包含 23 种语言配置,每个配置均只有 train 这一个划分,每个划分包含 100 条样本。配置名称如下:

  • ar, cs, de, default, el, es, fa, fr, he, hi, id, it, ja, ko, nl, pl, pt, ro, ru, tr, uk, vi, zh

各配置的 train 划分大小(字节数)略有不同,范围在 181,417 至 282,866 字节之间。

数据审核与修正说明

在提取过程中,作者发现原始数据集中有 20 个冲突样本的冲突设计较弱(例如,仅是对真实视觉状态进行转述而非形成矛盾),并已对这 20 个样本进行了严格修正,以确保强烈的结构性对立。

搜集汇总
数据集介绍
pendulum-conflict 数据集图片
构建方式
在视觉-语言理解的前沿探索中,多模态大语言模型常因难以辨别文本与图像间的矛盾而暴露其脆弱性。为此,Pendulum-Conflict数据集应运而生。该数据集从akomand/counterfactual_pendulum中手工筛选100个样本构建而成,每个样本包含一幅单摆场景图像、一段四句真实描述及一段含有一处虚假属性的冲突描述。构建时还添加了评价问题、三个选项(图像偏置、文本偏置和干扰项)以及冲突类型标注。经过严格审计,20个初始样本中文本矛盾的“弱”案例被修正,确保每对描述形成明确的结构对立。
特点
该数据集以精巧的冲突设计见长,涵盖角度、光照、影子长度与影子位置四类物理属性冲突,每类25例,共计100个样本。每个实例不仅提供原始真实描述,还包含精心构造的冲突描述,并配有精准的二元选项来引导模型在图像真相与文本误导间抉择。数据集中还标记了冲突类型、语言信息及是否经过补丁修正的状态,使研究者能针对性地分析模型在处理结构可控、跨模态矛盾时的行为模式与偏差。
使用方法
使用该数据集时,研究者可通过HuggingFace的datasets库加载默认配置或特定语言的子集,如'zh'代表中文。加载后,每条记录包含image字段用于视觉输入,question字段作为问题提示,而conflicting_caption提供文本干扰。评估时可将question与原图喂入多模态模型,在image_bias、text_bias与distractor三个选项中判断模型的输出偏好,以此衡量模型是否过度依赖文本先验、忽视视觉事实。该设计特别适用于系统性检测和缓解模型的多模态一致性缺陷。
背景与挑战
背景概述
在视觉与文本信息日趋交融的多模态大语言模型(MLLMs)研究领域,如何准确评估模型对跨模态信息冲突的鲁棒性已成为亟待突破的关键课题。Pendulum Conflict数据集由研究者从akomand/counterfactual_pendulum源数据中精心筛选并手动校正而成,聚焦于钟摆场景下单一属性的视觉-文本矛盾,涵盖角度、光照、阴影长度和阴影位置四类冲突。该数据集旨在为MLLMs提供一个在精细控制条件下检验其抗干扰能力的基准,其在多模态理解与可信人工智能评估的交叉领域中具有独特的贡献价值。
当前挑战
该数据集所解决的领域核心挑战在于,当前MLLMs普遍存在对文本偏见的过度依赖而忽略视觉真实线索的倾向,这种模态同化现象严重制约了模型在多源信息冲突场景下的可靠性。从构建角度来看,挑战主要体现在两个方面:其一,原始数据中存在20例所谓的“弱对抗”样本,其冲突描述实质上是对视觉真实状态的同义改写而非真正的矛盾,需要研究者通过严格审计与人工修正来确保每对冲突描述之间存在结构性的语义对立;其二,需要精准界定冲突属性的边界,以避免因描述模糊而导致的评估歧义。
常用场景
经典使用场景
在视觉与语言理解交叉的璀璨星空中,Pendulum-Conflict 数据集犹如一枚精巧的试金石,专为评估多模态大语言模型(MLLMs)在面对精心设计的视觉-文本冲突时的鲁棒性而生。其经典应用场景在于构建一种受控的对抗性评估范式:每一条样本均包含一张真实的钟摆场景图像、一段与之矛盾的文字描述,以及一个直指冲突属性的核心问题。研究者可利用此基准,系统性地探查模型在图像事实与文本误导的博弈中,究竟是否能够坚守视觉真相,抑或轻易被文本偏见所裹挟。该数据集涵盖角度、光照、阴影长度与阴影位置四种冲突类型,为多模态推理能力的诊断提供了精细而严密的实验框架。
实际应用
在现实世界的智能系统中,传感器噪声、环境干扰或恶意篡改常导致视觉与文本信息不统一,例如自动驾驶汽车面对错误交通标志与真实路况的矛盾,或医疗影像辅助诊断中病历描述与实际影像的出入。Pendulum-Conflict 数据集为这类高风险场景提供了一个可复现的测试沙盒,帮助开发者在部署前量化模型在信息冲突条件下的失误率。此外,它可用于优化人机交互系统的回复生成策略,确保智能助手在面对用户误导性描述时,能够基于视觉证据进行纠正,而非盲从文本。这种'抗干扰'能力在新闻真实性核查、教育评估工具与内容审核平台中同样具有迫切的商业价值。
衍生相关工作
围绕 Pendulum-Conflict 衍生出的经典工作主要聚焦于多模态鲁棒性评测基准的构建与对抗性数据增强方法。受其启发,研究者相继开发了基于规则与基于语言模型的自动冲突样本生成器,如 CounterfactualGaussian 与 Visual Adversarial Pair (VAP) 框架,用以扩展数据集规模与冲突类型的多样性。此外,多项关于'视觉基础——语言修正'的双阶段训练范式被提出,通过在冲突样本上进行显式对比学习,显著提升模型在模态矛盾场景下的推理准确率。这些工作不仅验证了 Pendulum-Conflict 作为评估工具的普适性,更将其影响力延伸至幻觉抑制技术、因果推理注入等前沿领域,成为多模态可信赖性研究的重要基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务