遇见数据集

QCRI/M2CQA

收藏
Hugging Face2026-06-12 更新2026-05-10 收录
官方服务:

资源简介:

M2CQA是一个多语言多模态基准数据集,用于评估视觉语言模型中的反事实幻觉。每个数据示例将一张图片与三个基于文化的陈述配对:其中一个陈述由图片视觉支持,而另外两个陈述是文化上合理但视觉不支持的反事实。任务是接受真实的基于图片的陈述并拒绝反事实陈述。该版本包含英语、现代标准阿拉伯语、黎凡特阿拉伯语和埃及阿拉伯语的陈述,共享同一组图片。数据集旨在评估多模态系统是否依赖视觉证据,而不是接受合理的文化先验。数据集结构包括JSON文件和图片文件,每个JSON分割包含9,122个唯一的图片ID,图片在语言分割间共享。数据字段包括id(图片文件名无扩展名)、split(语言分割名称)、country(图片关联的国家)、image(图片文件的相对路径)、image_filename(带扩展名的图片文件名)、source_shard(原始数据集生成管道的源parquet分片)、Q1/Q2/Q3(三个候选陈述)、A1/A2/A3(对应陈述的布尔标签,其中只有一个为true)。数据集创建过程涉及图像收集、手动筛选、去重、问题生成和翻译,并经过人工验证。数据集适用于多语言和多文化视觉语言模型评估、反事实幻觉测量、跨语言鲁棒性研究以及跨模态模型行为比较。

M2CQA is a multilingual and multimodal benchmark for evaluating counterfactual hallucination in vision-language models. Each example pairs an image with three culturally grounded statements. One statement is visually supported by the image, while two statements are culturally plausible but visually unsupported counterfactuals. The task is to accept the true image-grounded statement and reject the counterfactual statements. This release contains English, Modern Standard Arabic, Levantine Arabic, and Egyptian Arabic statements over a shared set of images. It is intended for evaluating whether multimodal systems rely on visual evidence rather than accepting plausible cultural priors. The dataset is organized as JSON files and image files, with each JSON split containing 9,122 unique image IDs, and the images are shared across language splits. Data fields include id (image filename without extension), split (language split name), country (country associated with the image), image (relative path to the image file), image_filename (image filename with extension), source_shard (source parquet shard from the original dataset generation pipeline), Q1/Q2/Q3 (three candidate statements), and A1/A2/A3 (boolean labels for the corresponding statements, with exactly one true). The dataset creation involves image collection, manual screening, deduplication, question generation, translation, and human verification. It is intended for evaluating multilingual and multicultural vision-language models, measuring counterfactual hallucination, studying robustness across languages, and comparing cross-modal model behavior.

提供机构:
QCRI
搜集汇总
数据集介绍
QCRI/M2CQA 数据集图片
构建方式
M2CQA数据集的构建始于从OASIS/EverdayMMQA视觉分类体系中提取的、具有国家特异性和文化感知的搜索查询。通过启用SafeSearch并筛选创作共用许可的图像,研究人员获取了候选图片,并经由人工筛选与精确及近似去重处理。随后,生成初始的、植根于文化背景的多选题,并筛除那些无需图像即可作答的样本。最终,将问题转化为三元真/假陈述组:一个陈述获得视觉证据的支持,另外两个则为符合文化常识但视觉上无依据的反事实陈述。英文样本被翻译或改编为现代标准阿拉伯语、黎凡特阿拉伯语及埃及阿拉伯语版本,并通过分层人工验证确保标签的准确性与图像的必要性。
使用方法
使用M2CQA时,推荐通过Hugging Face Datasets库加载各语言子集,例如使用`load_dataset("QCRI/M2CQA")`获取英语、现代标准阿拉伯语等分片。每个记录包含三个陈述(Q1、Q2、Q3)及其布尔标签(A1、A2、A3),模型需判断每个陈述的真伪。为加载对应图像,可利用`hf_hub_download`按记录中的`image`字段路径获取文件,并用PIL库打开。该数据集专为评估多语言视觉语言模型在跨文化场景下的反事实幻觉鲁棒性而设计,亦可用于研究文本或跨模态模型的表现差异。
背景与挑战
背景概述
M2CQA是一个由卡塔尔计算研究所(QCRI)的研究人员于2026年创建的多语言、多模态基准数据集,旨在评估视觉语言模型在文化语境下的反事实幻觉现象。该数据集的核心研究问题在于考察多模态系统是否真正依赖视觉证据而非文化先验知识进行推理,从而判断模型能否准确识别并拒绝那些文化上看似合理但缺乏视觉支撑的陈述。M2CQA的发布对多模态学习领域产生了深远影响,它不仅揭示了现有视觉语言模型在处理多文化、多语言场景时的脆弱性,还为构建更鲁棒、更具文化意识的AI系统提供了关键评估工具。数据集包含英语、现代标准阿拉伯语、黎凡特阿拉伯语和埃及阿拉伯语四种语言版本,覆盖多个国家的图像,为跨语言、跨文化的研究开辟了新维度。
当前挑战
M2CQA所解决的领域挑战是视觉语言模型中普遍存在的反事实幻觉问题,即模型在回答图像相关问题时倾向于依赖文化先验而非视觉证据,导致在非典型或误导性场景中产生错误推理。这种幻觉在多语言、多文化背景下尤为突出,因为不同文化群体对同一图像可能持有截然不同的先验假设。在数据集构建过程中,研究者面临多项挑战:首先,需要精心设计文化上合理但视觉上不成立的反事实陈述,确保它们足够逼真以迷惑模型;其次,必须通过严格的人工筛选和去重流程保证数据质量,包括移除无需图像即可回答的问题;最后,跨语言翻译和本地化适配需要保持文化敏感性和语义一致性,同时在不同阿拉伯语方言间维持等价难度,这对标注团队的跨文化专业知识提出了极高要求。
常用场景
经典使用场景
M2CQA数据集专为评估多语言、多模态视觉语言模型中的反事实幻觉现象而设计。经典使用场景聚焦于文化根基型视觉问答任务:每个样本提供一张图像与三条文化上合理的声明,其中仅一条声明与图像视觉内容相符,另两条则为似是而非的反事实陈述。模型需精准识别并接受与图像吻合的声明,同时拒绝文化上看似合理但缺乏视觉支撑的反事实选项。该数据集覆盖英语、现代标准阿拉伯语、黎凡特阿拉伯语和埃及阿拉伯语四种语言,共享同一图像池,旨在检验模型是否真正依赖视觉证据而非文化先验知识进行判断。
解决学术问题
M2CQA核心解决的是多模态模型中反事实幻觉这一关键学术问题。现有视觉语言模型常因过度依赖语料库中的文化偏误,在图像与常识相悖时产生看似合理但错误的回答。该数据集通过构建视觉支持与反事实的对立体系,系统揭示了模型在多语言、多文化场景下因忽视视觉证据而导致的推理失当。其学术意义在于首次从反事实角度量化文化先验知识对视觉推理的干扰,为构建真正具备多模态理解能力的普适模型提供了评估框架,推动了跨语言、跨文化视觉语言理解研究的前沿发展。
实际应用
在实际应用中,M2CQA可用于多模态问答系统的鲁棒性测试与文化适应性调优。例如,部署于中东地区的视觉客服机器人或智能导览系统,可通过该数据集检验其在识别地域性建筑、风俗场景时能否拒绝文化刻板印象干扰,提升应答准确性。该数据集的多元文化属性使其适用于全球化的图文内容审核系统,帮助检测模型是否因语言差异而引入虚假关联。此外,在教育与旅游领域的跨语言辅助应用中,M2CQA能助力开发避免文化误解的视觉理解工具,确保系统输出在不同语言版本间保持对视觉事实的忠实。
数据集最近研究
最新研究方向
M2CQA数据集聚焦于多语言视觉-语言模型中的反事实幻觉评估,通过构建文化内嵌的陈述三元组(一个视觉支撑、两个文化合理但视觉未支持的假象),检验模型是否真正依赖图像证据而非文化先验。其前沿方向涵盖多语言与跨文化鲁棒性、跨模态稳定性(图像与文本/语音输入的不一致性),以及方法论上融合了多级人工筛选与翻译适配,确保幻觉检测任务的文化敏感性与生态效度。核心影响在于揭示了当前前沿视觉-语言系统在多元文化场景下可能存在的系统性偏见,并为推动更可靠、更公平的多模态推理提供了关键基准与可复现的评估框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务