遇见数据集

AynVQA-ArabicNLP26

收藏
Hugging Face2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

Ayn-VQA-ArabicNLP26 是一个基于文化的阿拉伯多模态评估数据集,隶属于ArabicNLP 2026会议的ImageEval 2026共享任务。该数据集旨在测试模型从文化特定图像中读取信息的能力,包括处理阿拉伯语口语问题以及区分真实描述与幻觉描述。数据集包含两个主要任务:任务1a(口语视觉问答,Spoken VQA)要求模型根据图像和口语问题及选项音频选择正确答案;任务1b(幻觉检测,Hallucination detection)要求模型根据图像和三个语句判断每个语句是否为真实(基于图像)或幻觉(错误),其中仅有一个语句是真实的。每个任务提供英语和现代标准阿拉伯语(MSA)两个并行语言轨道,具有相同的图像和答案,问题互为翻译。数据覆盖18个阿拉伯国家,包括阿尔及利亚、巴林、埃及等。数据规模为5000个数据项,具体分割为训练集(3000项,带标签)、开发集(500项,带标签)、开发测试集(500项,无标签)和测试集(1000项,无标签)。每个数据项包括图像(JPEG格式)、音频(WAV格式,仅任务1a)和JSONL文件中的结构化数据。任务1a的数据字段包括ID、图像路径、音频路径和正确选项索引;任务1b包括ID、图像路径、三个语句列表和每个语句的真假标签列表。训练和开发集还包含国家、类别和子类别信息。音频部分,任务1a的训练、开发和开发测试集使用语音克隆(TTS)合成生成,测试集为人工录制。该数据集适用于多模态任务,如视觉问答和幻觉检测,特别关注阿拉伯文化和语言处理,可用于评估模型在跨模态和文化特定上下文中的性能。

Ayn-VQA-ArabicNLP26 is a culturally-based Arabic multimodal evaluation dataset, part of the ImageEval 2026 shared task at the ArabicNLP 2026 conference. The dataset aims to test models ability to read information from culturally specific images, including handling spoken Arabic questions and distinguishing real descriptions from hallucinated ones. It comprises two main tasks: Task 1a (Spoken VQA) requires selecting the correct answer based on an image and spoken question with audio options; Task 1b (Hallucination detection) requires judging whether each of three statements is real (based on the image) or hallucinated (incorrect), with only one statement being real. Each task offers parallel language tracks in English and Modern Standard Arabic (MSA), with identical images and answers, where questions are translations of each other. The data covers 18 Arab countries, including Algeria, Bahrain, Egypt, etc. The dataset size is 5000 items, split into a training set (3000 items, labeled), a development set (500 items, labeled), a development test set (500 items, unlabeled), and a test set (1000 items, unlabeled). Each item includes an image (JPEG format), audio (WAV format, only for Task 1a), and structured data in JSONL files. For Task 1a, data fields include ID, image path, audio path, and correct option index; for Task 1b, they include ID, image path, a list of three statements, and a list of true/false labels for each statement. The training and development sets also contain country, category, and subcategory information. For audio, Task 1as training, development, and development test sets use speech cloning (TTS) synthesis, while the test set is manually recorded. The dataset is suitable for multimodal tasks such as visual question answering and hallucination detection, with a focus on Arabic culture and language processing, and can be used to evaluate model performance in cross-modal and culturally specific contexts.

创建时间:
2026-06-01
原始信息汇总

数据集名称: Ayn-VQA-ArabicNLP26

简介: Ayn-VQA-ArabicNLP26 是一个面向阿拉伯文化的多模态评估数据集,隶属于 ArabicNLP 2026 的 ImageEval 2026 共享任务。该数据集用于测试模型能否理解特定文化背景下的图像,并区分合理描述与似是而非的幻觉描述。

语言与任务:

  • 涵盖英语(en)和现代标准阿拉伯语(MSA)两种语言轨道,独立评分。
  • 包含以下两个子任务:
    • 任务 1a:口语视觉问答(Spoken VQA)
      • 给定图像、口语问题及选项(音频形式),模型需从 3 个选项中选择正确的一个(索引 0、1 或 2)。
    • 任务 1b:幻觉检测(Hallucination Detection)
      • 给定图像和 3 个陈述,模型需判断每个陈述是“真”(基于图像)还是“假”(幻觉),且恰好有一个陈述是真实的。

数据子集与配置:

配置名称 任务 语言 Codabench 链接
task1a_en 口语 VQA 英语 Competition Link
task1a_msa 口语 VQA 现代标准阿拉伯语 Competition Link
task1b_en 幻觉检测 英语 Competition Link
task1b_msa 幻觉检测 现代标准阿拉伯语 Competition Link
  • 相同任务的英语和现代标准阿拉伯语轨道是并行的,使用相同图像、答案,且问题互为翻译。

地理覆盖: 数据涵盖 18 个阿拉伯国家:阿尔及利亚、巴林、埃及、伊拉克、约旦、科威特、黎巴嫩、利比亚、摩洛哥、阿曼、巴勒斯坦、卡塔尔、沙特阿拉伯、苏丹、叙利亚、突尼斯、阿联酋、也门。

数据格式与文件结构:

  • 图像:images/<id>.jpg,每个项目一个图像,跨任务和语言共享。
  • 音频(任务 1a):audio/<lang>/<id>.wav,包含口语问题和选项。
  • JSONL 文件:
    • task1a/<split>_<lang>.jsonl
    • task1b/<split>_<lang>.jsonl

字段说明:

  • 任务 1a:

    • id:项目 ID
    • image:图像文件路径(images/<id>.jpg
    • audio:音频文件路径(audio/<lang>/<id>.wav
    • label:正确选项索引(0–2)
  • 任务 1b:

    • id:项目 ID
    • image:图像文件路径(images/<id>.jpg
    • statements:3 个陈述的列表
    • labels:每个陈述的真值列表,其中一个为 true
  • 额外字段 countrycategorysubcategory 仅在 traindev 分割中提供。

数据分割:

分割 标签 项目数 用途
train 3000 训练与微调
dev 500 验证
devtest 500 赛前准备,提交至 Codabench
test 1000 最终竞赛

音频: 任务 1a 中 traindevdevtest 的音频由语音克隆(TTS)合成生成。最终测试集音频将由真人录制,预计存在录音条件差异。

评估指标:

  • 口语 VQA:
    • 准确率(排名指标)
    • 平衡准确率、宏平均 F1 得分(作为诊断报告)
  • 幻觉检测:
    • 组合准确率(排名指标,要求三个标签全部正确才算正确)
    • 幻觉率、条件幻觉率(CFHR-2/3)、Q+ 准确率、Q- 准确率等(作为诊断报告)

基线模型与参考得分:

  • 任务 1a 英语基线:Qwen2.5-Omni,准确率 0.6640
  • 任务 1a 现代标准阿拉伯语基线:Qwen2.5-Omni,准确率 0.3980
  • 任务 1b 英语基线:Qwen2.5-VL,组合准确率 0.6840
  • 任务 1b 现代标准阿拉伯语基线:Qwen2.5-VL,组合准确率 0.5080

许可证: Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License (CC BY-NC-SA 4.0)。

搜集汇总
数据集介绍
AynVQA-ArabicNLP26 数据集图片
构建方式
AynVQA-ArabicNLP26数据集由多模态与多语言研究团队精心构建,隶属于ImageEval 2026共享任务体系,旨在评估模型在阿拉伯文化语境下的视觉推理能力。数据集涵盖18个阿拉伯国家,每一条目均包含一张文化特异性图像,并围绕该图像设计了两种任务:一是基于口语提问与选项的视觉问答(Task 1a),二是真值陈述与幻觉陈述的鉴别(Task 1b)。训练集、验证集与开发测试集分别包含3000、500与500个样本,所有媒体文件(图像与音频)均通过统一的id字段与JSONL条目关联,确保资源引用的精确性与跨任务、跨语言的一致性。
特点
该数据集最显著的特点在于其深刻的文化嵌入性与多模态真实性挑战。图像内容精心选取自阿拉伯世界的日常生活场景,而非泛化的网络图片,从而考察模型对特定文化符号与习俗的理解。Task 1a中的语音问题采用合成语音生成,而最终测试集将切换为真人录音,模拟真实场景中的语音变异。Task 1b则设计为“三选一”真假陈述鉴别,且恰好仅有一个陈述基于图像真实描述,其余为看似合理实则虚假的幻觉,该设置精准捕捉了多模态模型在事实性与幻觉性之间的微妙边界。
使用方法
使用者可通过HuggingFace Datasets库按配置名称(如task1a_en、task1b_msa)加载对应的训练、验证与开发测试分片。模型需针对Task 1a输出0-2的选项索引,针对Task 1b为每条陈述输出True/False标签,且所有预测必须符合Codabench提交格式。官方提供了基于Qwen2.5-Omni与Qwen2.5-VL的参考基线Notebook,可在Colab免费GPU上复现。评测指标方面,Task 1a以准确率为主排名指标,Task 1b则以组合准确率为核心,辅以幻觉率等诊断指标,全面衡量模型的事实判别能力。
背景与挑战
背景概述
AynVQA-ArabicNLP26 数据集诞生于 2026 年阿拉伯自然语言处理会议 (ArabicNLP 2026) 的 ImageEval 共享任务框架下,由国际研究团队共同构建,旨在填补阿拉伯语多模态理解领域评估资源的空白。该数据集聚焦于两个核心研究问题:基于口语阿拉伯语的视觉问答(Spoken VQA)以及多模态场景下的幻觉检测(Hallucination Detection),其独特之处在于强调文化特异性,覆盖 18 个阿拉伯国家的真实图像与语境。通过融合语音、视觉与文本三种模态,AynVQA 不仅为阿拉伯语多模态模型提供了标准化的评估基准,更推动了低资源语言在文化适应性和跨模态对齐研究方面的发展,对促进多语言人工智能系统的公平性与鲁棒性具有重要意义。
当前挑战
AynVQA 数据集所解决的领域问题核心在于多模态模型在阿拉伯语文化场景下的两大挑战:其一,口语语音与视觉内容间的跨模态匹配难题——模型需从阿拉伯语口语问题中精准解析语义,并关联至富含文化细节的图像;其二,幻觉检测任务的复杂性——模型需区分图像中真实存在的描述与看似合理但虚构的幻觉信息,这对模型的接地性(grounding)能力提出极高要求。在数据集构建过程中,亦面临显著挑战:包括人工收集并标注覆盖 18 个国家的文化特定图像,确保语料的地域多样性与代表性;合成语音与真实录音之间的域差异(domain shift),导致模型在开发阶段与最终测试阶段性能不一致;以及多语言(标准阿拉伯语与英语)并行任务的标注一致性维护,均构成数据质量与任务可靠性的关键瓶颈。
常用场景
经典使用场景
AynVQA-ArabicNLP26数据集的核心价值在于其为阿拉伯语文化场景下的多模态视觉问答与幻觉检测研究提供了标准化评测平台。该数据集精心收集了涵盖18个阿拉伯国家的图像素材,并配套了英语与现代标准阿拉伯语(MSA)两种语言轨道的合成语音提问与文本陈述。经典使用方式包括两项子任务:一是基于语音输入的多选视觉问答,要求模型聆听口语问题与选项后从三幅图像中选出正确答案;二是幻觉检测任务,即给定一张图像与三条陈述,模型需精确判别其中唯一一条真实描述,而另外两条为模型易产生的幻觉式错误。数据集的训练、验证与测试集划分明确,且语音部分从合成语音过渡至真实人类录音,增强了评测的挑战性与生态效度。
解决学术问题
该数据集针对性地解决了多模态大语言模型在非英语、高文化语境下存在的两大关键学术难题。其一,现有视觉问答基准普遍以英语为中心,忽视了阿拉伯语地区丰富的文化符号与视觉语义,导致模型在跨文化场景中表现急剧退化;AynVQA通过引入具有文化特异性的图像与多语言提问,迫使模型超越表面视觉特征、理解深层文化约定。其二,模型在面对多陈述评判时容易产生“幻觉”——即生成与图像内容不符但看似合理的描述,而传统评估指标难以捕捉此类细微错误。得益于任务1b的联合精确度与条件幻觉率等专门指标,研究者可系统量化模型在正确识别真实陈述的同时仍误判幻觉陈述的程度,从而推动对视觉-语言模型置信校准与鲁棒性的深入探索。
衍生相关工作
围绕AynVQA数据集的发布,已衍生了多项富有影响力的学术工作。其核心方法论文《OASIS: A Multilingual and Multimodal Dataset for Culturally Grounded Spoken Visual QA》系统阐述了数据集的构建原则、文化标注流程及基线模型表现,为后续跨文化多模态研究奠定了数据基础。针对幻觉检测任务,《Once Correct, Still Wrong: Counterfactual Hallucination in Multilingual Vision-Language Models》深入分析了即使在正确识别真实陈述的情形下模型仍倾向于肯定幻觉陈述的现象,并提出了条件幻觉率等新指标。同时,《Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models》聚焦于语音输入与视觉理解之间的跨模态不稳定性,揭示了听觉通道对视觉推理性能的潜在干扰,为多模态融合技术提供了诊断性思路。这些工作共同推动了阿拉伯语多模态评测从单一准确率向细粒度鲁棒性分析的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务