遇见数据集

rpg-conflict

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

RPG Fantasy Battle Conflict Dataset是一个专门设计用于评估视觉语言模型在跨模态冲突场景下性能的数据集。该数据集源自rcannizzaro/rpg_fantasy_battle_counterfactual_v2数据集,经过精心筛选,包含100个完全隔离的冲突样本。每个样本呈现角色扮演游戏战斗截图与文本描述之间的不一致性,旨在测试模型处理图像与文本信息矛盾的能力。数据集包含单训练集,样本均匀分布在五个冲突类别:背景、玩家1类型、玩家1元素、玩家2类型、玩家2元素,每类20个样本。每个数据样本包含图像、准确描述图像的原始标题、包含单个幻觉属性的反事实冲突标题、评估特定冲突属性的中性问题、与图像匹配的真实答案、与幻觉文本匹配的错误答案、一个看似合理但错误的干扰选项、行ID、冲突类型和文本语言。数据集支持23种语言版本,包括阿拉伯语、中文、德语、西班牙语、法语、日语等,每种语言配置包含100个样本。该数据集适用于视觉问答任务、视觉语言模型评估以及跨模态冲突分析研究。

The RPG Fantasy Battle Conflict Dataset is specifically designed to evaluate the performance of visual language models in cross-modal conflict scenarios. Derived from the rcannizzaro/rpg_fantasy_battle_counterfactual_v2 dataset, it is carefully curated to include 100 fully isolated conflict samples. Each sample presents inconsistencies between role-playing game battle screenshots and text descriptions, aiming to test the models ability to handle contradictions between image and text information. The dataset consists of a single training set, with samples evenly distributed across five conflict categories: background, player1 type, player1 element, player2 type, and player2 element, each containing 20 samples. Each data sample includes an image, an original caption accurately describing the image, a counterfactual conflict caption with a single hallucination attribute, a neutral question evaluating the specific conflict attribute, a true answer matching the image, a false answer matching the hallucinated text, a plausible but incorrect distractor option, a row ID, conflict type, and text language. The dataset supports 23 language versions, including Arabic, Chinese, German, Spanish, French, Japanese, etc., with each language configuration containing 100 samples. It is suitable for visual question answering tasks, visual language model evaluation, and cross-modal conflict analysis research.

创建时间:
2026-06-28
原始信息汇总

数据集名称

RPG Fantasy Battle Conflict Dataset

核心任务

该数据集用于评估视觉语言模型(VLM)在跨模态冲突场景下的表现,即战斗截图与描述文本之间存在差异的情况。

数据集规模

  • 总样本数:100个
  • 分割:仅包含一个 train 分割

语言

  • 语言:英语(en

数据来源

该数据集源自 rcannizzaro/rpg_fantasy_battle_counterfactual_v2 数据集,并从中筛选出100个完美的冲突样本。

样本类别分布

100个样本均匀分布在5个类别中,以防止评估偏差:

  • background:20个样本
  • player_1_type:20个样本
  • player_1_element:20个样本
  • player_2_type:20个样本
  • player_2_element:20个样本

数据集模式(Configs)

该数据集包含22种语言配置,每种配置均包含相同的100个样本,但文本字段(如标题、问题)使用对应语言。具体配置包括:

  • ar(阿拉伯语)、cs(捷克语)、de(德语)、default(默认)、el(希腊语)、es(西班牙语)、fa(波斯语)、fr(法语)、he(希伯来语)、hi(印地语)、id(印尼语)、it(意大利语)、ja(日语)、ko(韩语)、nl(荷兰语)、pl(波兰语)、pt(葡萄牙语)、ro(罗马尼亚语)、ru(俄语)、tr(土耳其语)、uk(乌克兰语)、vi(越南语)、zh(中文)

数据字段(Schema)

字段名 类型 描述
image Image 基础战斗图像
original_caption string 准确描述图像的模板化标题
conflicting_caption string 包含单一虚构属性的反事实标题
question string 评估冲突属性的中立问题
image_bias string 与图像匹配的正确回答
text_bias string 与虚构文本匹配的错误回答
distractor string 合理的、但错误的第三个选项
serial_no int64 行ID
conflict_type string 冲突类别(如 background, player_1_type
language string 文本的语言(本数据集为英语)

任务类别

  • visual-question-answering(视觉问答)
  • question-answering(问答)
搜集汇总
数据集介绍
rpg-conflict 数据集图片
构建方式
在视觉-语言模型评估领域,跨模态冲突的构建是检验模型鲁棒性的关键途径。rpg-conflict数据集从rcannizzaro/rpg_fantasy_battle_counterfactual_v2原始数据集中精心筛选而来,聚焦于角色扮演游戏战斗场景的视觉问答任务。构建过程通过调用专用脚本,在原始2000图像的集合中检索那些基础描述与反事实描述之间仅存在单一属性差异的样本,最终提取出100个完美隔离的冲突样本,并按背景、玩家1类型、玩家1元素、玩家2类型、玩家2元素五个类别各均匀分配20个样本,以规避评估偏差。
特点
该数据集的核心特质在于其高度结构化的跨模态冲突设计。每个样本均包含一张战斗截图图像、一段忠实描述原始场景的真实描述文字、一段篡改单一属性的反事实描述文字,以及一个针对该冲突属性的中立问题。通过设置图像偏向(正确答案)、文本偏向(与篡改描述一致的错误答案)和干扰项(第三个看似合理但错误的选项),数据集巧妙构成了对视觉-语言模型在多模态信息矛盾情境下推理能力的精准测试。所有文本均采用英文且冲突类型明确标注,便于研究者分析模型在不同属性维度的表现差异。
使用方法
研究人员可通过Hugging Face数据集库加载rpg-conflict,利用其划分好的train分片进行模型评估。加载后,每个样本的image字段自动由file_name解析为PIL图像对象,配合original_caption、conflicting_caption与question组成多模态输入,而image_bias、text_bias与distractor则构成三选一的答案候选项。研究者可将模型在每项冲突任务上的预测结果与image_bias进行比对,从而量化模型在视觉与文本信息冲突时正确依赖视觉证据的能力。此外,通过按conflict_type分组统计,还可深入剖析模型对不同属性冲突的敏感程度。
背景与挑战
背景概述
视觉语言模型(VLM)在跨模态理解任务中虽已取得长足进步,但其对图像与文本间潜在冲突的鲁棒性仍是一个亟待深入探索的课题。RPG Conflict数据集正是在此背景下应运而生,旨在系统性地评估模型在面对视觉与语义信息相悖场景时的表现。该数据集由研究者基于rcannizzaro/rpg_fantasy_battle_counterfactual_v2数据集精心构建,通过筛选仅包含单一属性变更的反事实样本,创建了100个完美隔离的冲突实例。数据集覆盖5类属性冲突(背景、玩家类型、元素属性等),每类20个样本,确保评估指标的均衡无偏。每个样本均包含真实图像、真值标注、冲突标注以及中立提问,为交叉模态冲突的机理研究提供了结构化分析框架。
当前挑战
该数据集中所解决的领域挑战聚焦于视觉语言模型在面对图像与文本描述不一致时的判别能力。现有VLM常因过度依赖文本先验或视觉线索而导致跨模态误解,缺乏对冲突信息的有效整合与甄别。数据集构建过程中亦面临多重挑战:首先,从原始大规模反事实数据集中精确筛选出仅含一个属性差异的纯净样本需严格的匹配与验证算法;其次,为每种冲突属性生成均匀分布的样本并消除评估偏差,需精细设计模板化描述并人工核查语义准确性;最后,构造中立且不引导答案的提问以及干扰项,以保障评估模型的客观性与普适性。
常用场景
经典使用场景
在视觉语言模型(VLM)的鲁棒性与可信度评估研究中,rpg-conflict数据集被广泛用于测试模型在面对跨模态信息冲突时的行为表现。该数据集精心构造了100组角色扮演战斗场景样本,每一组均包含真实描述与包含单一属性篡改的反事实描述,并配以中立的问题、正确答案、误导答案以及干扰项。研究常利用该数据集检验VLM在背景、玩家角色类型、元素属性等五个关键维度上的推理能力,衡量模型在图文信息矛盾时是更信赖视觉证据还是文本暗示,从而揭示其潜在的模态偏好与决策脆弱性。这为探究多模态系统在复杂环境下的认知一致性提供了标准化的评测基准。
解决学术问题
该数据集针对性解决了多模态大模型中一个核心学术问题——跨模态冲突下的认知偏差与信息融合失效。现有VLM常在处理图文不一致时暴露出严重缺陷,或过度依赖文本先验而忽略图像事实,或无法有效权衡冲突信号。rpg-conflict通过精确控制单一属性冲突的变量,使研究者能够系统量化模型在背景、角色类型、元素属性等维度的模态偏好程度,进而揭示幻觉现象发生的根本机制。这一成果对理解多模态表征中的语义鲁棒性问题具有深远意义,推动了更可靠、更公平的视觉语言融合算法的设计与评估。
衍生相关工作
该数据集的构建思路催生了多项关于多模态冲突检测与消歧的经典研究工作。基于其精确控制冲突变量的设计哲学,后续研究者开发了构建跨模态对抗样本的高效方法,并通过引入注意力机制可视化与因果推断框架来追溯模型冲突处理的内部路径。同时,该数据集启发了新的训练策略,如基于对比学习的冲突感知预训练范式,以及动态模态权重调整方案,这些方法均在rpg-conflict及其衍生数据集得到验证。此外,其在多语言版本上的扩展也促进了跨语言视觉语言模型鲁棒性评测的发展,成为该领域不可替代的基准平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务