遇见数据集

ImageEval2026-Task1-AynVQA

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

Ayn-VQA数据集是ImageEval 2026共享任务的一部分,旨在评估阿拉伯文化背景下的多模态模型。数据集名称Ayn(阿拉伯语意为眼睛)寓意模型需具备阅读和理解蕴含特定文化信息图像的能力。该数据集包含两个核心评测任务:1) 任务1a(Spoken VQA):给定一张图像以及一个包含问题和三个选项的合成语音(音频),模型需选择正确答案(选项索引0、1或2)。2) 任务1c(幻觉检测):给定一张图像和三条陈述句(其中仅有一条基于图像内容,其余两条为看似合理但实为幻觉的陈述),模型需判断每条陈述的真假(True/False)。数据集提供英语和现代标准阿拉伯语(MSA)两个语言版本,两个版本在图像和答案上完全平行,问题互为翻译。数据覆盖阿尔及利亚、埃及、沙特阿拉伯等18个阿拉伯国家,内容具有文化特异性。数据规模方面,训练集包含3000个样本,开发集500个,开发测试集500个,最终测试集1000个。数据为多模态形式:包含图像文件(.jpg)、任务1a的音频文件(.wav)以及结构化标注文件(.jsonl)。任务1a的标注文件包含id、图像路径、音频路径和正确答案索引;任务1c的标注文件包含id、图像路径、三条陈述句列表及其对应的真假标签列表。该数据集适用于多模态视觉问答、跨语言多模态理解、幻觉检测以及针对阿拉伯文化内容的人工智能模型评估等研究与应用场景。

The Ayn-VQA dataset is part of the ImageEval 2026 shared task, aimed at evaluating multimodal models in the context of Arabic culture. The dataset name Ayn (Arabic for eye) symbolizes the models need to read and understand images containing specific cultural information. It includes two core evaluation tasks: 1) Task 1a (Spoken VQA): Given an image and a synthetic speech (audio) containing a question and three options, the model must select the correct answer (option index 0, 1, or 2). 2) Task 1c (Hallucination Detection): Given an image and three statements (only one based on image content, the other two are plausible but hallucinatory), the model must judge the truth value (True/False) of each statement. The dataset is available in two language versions: English and Modern Standard Arabic (MSA), with both versions being fully parallel in images and answers, and questions translated between them. Data covers 18 Arab countries, including Algeria, Egypt, and Saudi Arabia, with culturally specific content. In terms of scale, the training set contains 3000 samples, the development set 500, the development test set 500, and the final test set 1000. The data is multimodal: including image files (.jpg), audio files (.wav) for Task 1a, and structured annotation files (.jsonl). Annotation files for Task 1a include id, image path, audio path, and correct answer index; for Task 1c, they include id, image path, a list of three statements, and a list of corresponding truth labels. This dataset is suitable for research and applications in multimodal visual question answering, cross-lingual multimodal understanding, hallucination detection, and evaluation of AI models for Arabic cultural content.

创建时间:
2026-06-01
原始信息汇总

数据集概述:ImageEval 2026, Task 1: Ayn-VQA

该数据集是 ImageEval 2026 共享任务(ArabicNLP 2026 的一部分)中的第一个任务,名为 Ayn-VQA(Ayn,意为“眼睛”)。其核心目标是评估多模态模型在阿拉伯文化特定图像理解上的能力,具体包括从口语阿拉伯语问题中选择正确答案,以及区分基于图像的真实描述与幻觉描述。

许可协议:CC BY-NC 4.0(仅限研究使用)。

语言:阿拉伯语(现代标准阿拉伯语,MSA)和英语。

🎯 任务

数据集包含两个子任务,每个任务均提供英语和现代标准阿拉伯语(MSA)两个语言轨道,并独立评分。

  1. 任务 1a:口语 VQA(Spoken VQA)
    给定一张图片和一个口语提问(含三个选项的音频),模型需从三个选项中选择正确的答案。预测输出为选项索引(0、1 或 2)。

  2. 任务 1c:幻觉检测(Hallucination detection)
    给定一张图片和三个陈述语句,模型需判断每个语句是 True(基于图像的事实)还是 False(幻觉)。其中恰好有一个语句是真实的。预测输出为每个语句对应的 True/False 标签。

🗂️ 数据子集与配置

数据集按任务和语言分为4个配置:

配置名称 任务 语言 Codabench 竞赛链接
task1a_en 口语 VQA 英语 https://www.codabench.org/competitions/17002/
task1a_msa 口语 VQA 现代标准阿拉伯语 https://www.codabench.org/competitions/17001/
task1c_en 幻觉检测 英语 https://www.codabench.org/competitions/17000/
task1c_msa 幻觉检测 现代标准阿拉伯语 https://www.codabench.org/competitions/16999/

每个任务的英语和现代标准阿拉伯语轨道是并行的:使用相同的图像和答案,问题互为翻译。

🌍 数据来源与覆盖范围

数据集覆盖 18 个阿拉伯国家:阿尔及利亚、巴林、埃及、伊拉克、约旦、科威特、黎巴嫩、利比亚、摩洛哥、阿曼、巴勒斯坦、卡塔尔、沙特阿拉伯、苏丹、叙利亚、突尼斯、阿联酋、也门。

🔊 音频信息(任务 1a)

  • 训练集(train)、开发集(dev)和开发测试集(devtest)中的问题是使用语音克隆技术(TTS)合成生成的。
  • 最终盲测集(test)中的问题将是人工录音,因此开发阶段音频与测试阶段音频之间会存在说话人/录音环境的差异。

📂 文件结构与字段说明

  • 文件结构

    • images/<id>.jpg:图像文件,所有任务和语言共享。
    • audio/<lang>/<id>.wav:口语问题及选项的音频文件(仅任务 1a)。
    • task1a/<split>_<lang>.jsonl:任务 1a 数据文件。
    • task1c/<split>_<lang>.jsonl:任务 1c 数据文件。
  • 字段说明

    任务 1a 数据文件字段

    字段 类型 描述
    id str 项目 ID
    image str 图像路径 images/<id>.jpg
    audio str 音频路径 audio/<lang>/<id>.wav,包含口语问题和三个选项(无文本提供)。
    label int 正确选项的索引(0-2)

    任务 1c 数据文件字段

    字段 类型 描述
    id str 项目 ID
    image str 图像路径 images/<id>.jpg
    statements list[str] 三个陈述语句,其中恰好有一个是真实的。
    labels list[bool] 每个陈述语句的真值(其中一个为 true)。

    附加字段traindev 分片额外包含 countrycategorysubcategory 字段。这些字段及标签在 devtesttest 分片中不提供

📊 数据分片

分片 是否含标签 样本数量 用途
train 3000 训练和微调
dev 500 验证
devtest 500 赛前测试,提交到 Codabench
test 1000 竞赛最终测试

盲测集 test 将在最终阶段发布。

🗓️ 时间线

  • 开发阶段:2026-05-22 至 2026-07-19,提交至 devtest 分片,实时排行榜。
  • 测试阶段:2026-07-20 至 2026-07-29,提交至盲测 test 分片,产生最终排名。

📏 评估指标

每个语言轨道独立评分。

  • 任务 1a(口语 VQA)

    • 排名指标:准确率(Accuracy),即回答正确的样本比例。
    • 报告指标:平衡准确率(Balanced accuracy)、宏平均F1(Macro-F1)。
  • 任务 1c(幻觉检测)

    • 排名指标:组合准确率(Combined accuracy),即所有三个标签(一个真实、两个幻觉)全部预测正确的样本比例。
    • 报告指标:幻觉率(Hallucination rate)、条件幻觉率(CFHR-2, CFHR-3)、Q+准确率、Q-准确率、Q-两者准确率。

🚀 提交方式

  1. 使用 datasets 库加载目标配置分片。
  2. 生成预测结果,并按要求格式写入 CSV 文件。
    • 任务 1a:CSV 包含列 id, prediction
    • 任务 1c:CSV 包含列 id, statement_index, predictionstatement_index 为 0-2,predictiontruefalse)。
  3. 将 CSV 文件压缩为 prediction.zip,并提交至对应任务的 Codabench 竞赛页面。

🧪 基线模型与参考

提供了端到端的 Colab 笔记本(位于 Google Drive),包括开源模型基线(如 Qwen2.5-Omni、Qwen2.5-VL)和级联 API 基线(如 Fanar Aura-STT + Oryx)。以下是参考基线得分:

任务 语言轨道 模型 指标 得分
1a 英语 Qwen2.5-Omni 准确率 0.6640
1a 现代标准阿拉伯语 Qwen2.5-Omni 准确率 0.3980
1c 英语 Qwen2.5-VL 组合准确率 0.6840
1c 现代标准阿拉伯语 Qwen2.5-VL 组合准确率 0.5080
搜集汇总
数据集介绍
ImageEval2026-Task1-AynVQA 数据集图片
构建方式
ImageEval2026-Task1-AynVQA 数据集由卡塔尔计算研究所主导构建,旨在评估多模态模型在阿拉伯文化语境中的视觉理解能力。该数据集涵盖18个阿拉伯国家的视觉场景,通过人工采集与合成技术相结合的方式生成。具体而言,Task 1a子任务的问答音频在训练、开发及开发测试阶段采用语音克隆技术进行合成,而最终盲测集则使用人类真实录音,以此模拟现实应用中可能出现的声学条件变化。每项任务均提供英语与现代标准阿拉伯语(MSA)两种语言轨道,且同一任务的不同语言版本共享相同的图像与答案,实现了跨语言评估的平行性。数据集被划分为训练集(3000项)、开发集(500项)、开发测试集(500项)以及盲测集(1000项),并通过JSONL格式文件组织图像、音频及标注信息。
特点
该数据集的核心特色在于其深厚的文化根基与多模态评测任务的创新设计。首先,所有视觉样本均源自阿拉伯世界18个国家的真实场景,涵盖丰富的本地化文化元素,对模型的文化敏感度提出了严苛要求。其次,数据集包含两项独具匠心的子任务:Task 1a的语音视觉问答要求模型仅凭音频理解问题与选项并进行选择,模拟了真实语音交互场景;Task 1c的幻觉检测任务则要求模型对每个图像关联的三条陈述逐一判断真伪,其中仅有一条与图像内容相符。这种设计不仅评估了模型的视觉逻辑推理能力,更直接挑战了其抵抗生成式幻觉的鲁棒性。此外,双语言轨道的并行设置与合成音频到真实音频的过渡设计,使得该数据集成为检验多模态模型跨语言、跨模态泛化能力的理想试金石。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集,具体命令如load_dataset("QCRI/ImageEval2026-Task1-AynVQA", "task1c_msa", split="devtest"),根据需求选择子任务(task1a或task1c)及语言轨道(_en或_msa)。对于Task 1a,需为每项数据输出0至2的整数索引表示所选选项,并以包含id与prediction两列的CSV文件提交。Task 1c则需对图像关联的三条陈述逐条预测True或False,提交格式为含id、statement_index及prediction三列的CSV文件。预测结果需压缩为prediction.zip后上传至对应的Codabench竞赛页面。官方提供了基于Qwen2.5-Omni和Qwen2.5-VL模型的参考基线代码(Colab笔记本),用户可在此基础上自由调整模型与策略。评估方面,Task 1a以准确率为排名指标,Task 1c则以组合准确率(三项陈述全对的比例)作为首要考核标准,并辅以幻觉率等诊断性指标。
背景与挑战
背景概述
ImageEval2026-Task1-AynVQA是由卡塔尔计算研究所(QCRI)主导构建的阿拉伯语多模态评估数据集,发布于2026年,作为ArabicNLP 2026会议共享任务ImageEval 2026的第一子任务。其核心研究问题聚焦于评估多模态大模型在阿拉伯文化语境下的视觉推理能力,涵盖口语视觉问答(Task 1a)与幻觉检测(Task 1c)两个维度。该数据集覆盖18个阿拉伯国家,提供英语和现代标准阿拉伯语双语轨道,并采用合成语音与真实语音混合的音频设计,旨在推动阿拉伯语多模态人工智能研究从通用场景向文化特异性场景的深化,对低资源语言多模态评估领域具有标杆意义。
当前挑战
该数据集所解决的领域挑战在于:现有视觉问答基准多基于英语和西方文化语境,缺乏对阿拉伯文化视觉符号(如宗教标志、传统服饰、地域性建筑)的覆盖,导致模型在该场景下易产生幻觉(hallucination)和语义偏差。构建过程中面临双重挑战:其一,需确保图像内容与口语阿拉伯语的方言多样性、语码转换特征高度对齐,避免文化误解;其二,合成语音(TTS)与测试阶段真人录音之间存在声学特征漂移(acoustic shift),使得模型必须兼顾多模态融合与跨域泛化能力,从而逼真模拟真实交互中的听力干扰与文化认知鸿沟。
常用场景
经典使用场景
在跨文化多模态理解的研究疆域中,ImageEval2026-Task1-AynVQA数据集为视觉问答与幻觉检测两大核心任务提供了独特的文化锚点。其经典使用场景聚焦于两项并行挑战:一是面向语音驱动的视觉问答(Task 1a),要求模型在聆听阿拉伯语或英语口语提问与选项后,从三选一中遴选出正确答案,这考验了模型在语音、视觉与语义三重模态间的协同推理能力;二是幻觉检测(Task 1c),需判断每张图片对应的三条陈述中哪一条真实存在于视觉内容中,其余皆为模型可能臆造的幻觉,以此衡量模型区分事实与虚构的精细判别力。该数据集覆盖18个阿拉伯国家,确保视觉场景与语言表达具有深厚的文化特异性,为评估模型在非西方语境下的鲁棒性提供了严苛的试金石。
衍生相关工作
围绕AynVQA数据集已催生一系列富有启发性的衍生工作。官方提供的基线方法中,Qwen2.5-Omni与Qwen2.5-VL被分别用于语音VQA和幻觉检测,展示了开源多模态模型在文化特定任务上的初步探索;而级联API基线(Fanar Aura-STT + Oryx)则验证了将语音识别与视觉理解串联的工程化路径,为低算力参与者提供了可行方案。可以预见,研究者将沿此脉络发展出文化敏感的多模态微调技术、语音-视觉联合对齐策略(如针对阿拉伯语音调差异的注意力机制),以及基于对抗性语句生成的幻觉鲁棒训练方法。此外,该数据集与ImageEval 2026共享任务及ArabicNLP 2026会议的结合,预计将孕育一批专门探讨阿拉伯跨文化视觉理解的新颖模型架构、评测指标与迁移学习范式,进一步丰富多模态领域在非英语世界的研究版图。
数据集最近研究
最新研究方向
ImageEval2026-Task1-AynVQA数据集聚焦于多模态阿拉伯语文化与幻觉检测的前沿交叉方向,其核心任务涵盖基于语音的视觉问答与图像陈述真实性判别,旨在推动模型在跨语言(英语与阿拉伯语)、跨模态(视觉、语音与文本)场景下的鲁棒理解能力。该数据集横跨18个阿拉伯国家,强调文化特定性图像与口语化提问的精细对齐,并专门针对合成语音与真实录音之间的领域迁移挑战。当前研究热点围绕如何利用大语言模型与视觉语言模型在低资源阿拉伯语环境中实现高精度幻觉抑制,同时保障对多元地域文化背景的感知。该任务通过引入严格的多维度评估指标(如组合准确率与条件幻觉率),为构建可信、文化敏感的多模态推理系统奠定了关键基准,其成果将深刻影响阿拉伯语NLP在智能客服、教育及跨文化信息检索等前沿应用中的落地实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务