ImageEval2026-Task1-AynVQA
收藏资源简介:
Ayn-VQA数据集是ImageEval 2026共享任务的一部分,旨在评估阿拉伯文化背景下的多模态模型。数据集名称Ayn(阿拉伯语意为眼睛)寓意模型需具备阅读和理解蕴含特定文化信息图像的能力。该数据集包含两个核心评测任务:1) 任务1a(Spoken VQA):给定一张图像以及一个包含问题和三个选项的合成语音(音频),模型需选择正确答案(选项索引0、1或2)。2) 任务1c(幻觉检测):给定一张图像和三条陈述句(其中仅有一条基于图像内容,其余两条为看似合理但实为幻觉的陈述),模型需判断每条陈述的真假(True/False)。数据集提供英语和现代标准阿拉伯语(MSA)两个语言版本,两个版本在图像和答案上完全平行,问题互为翻译。数据覆盖阿尔及利亚、埃及、沙特阿拉伯等18个阿拉伯国家,内容具有文化特异性。数据规模方面,训练集包含3000个样本,开发集500个,开发测试集500个,最终测试集1000个。数据为多模态形式:包含图像文件(.jpg)、任务1a的音频文件(.wav)以及结构化标注文件(.jsonl)。任务1a的标注文件包含id、图像路径、音频路径和正确答案索引;任务1c的标注文件包含id、图像路径、三条陈述句列表及其对应的真假标签列表。该数据集适用于多模态视觉问答、跨语言多模态理解、幻觉检测以及针对阿拉伯文化内容的人工智能模型评估等研究与应用场景。
The Ayn-VQA dataset is part of the ImageEval 2026 shared task, aimed at evaluating multimodal models in the context of Arabic culture. The dataset name Ayn (Arabic for eye) symbolizes the models need to read and understand images containing specific cultural information. It includes two core evaluation tasks: 1) Task 1a (Spoken VQA): Given an image and a synthetic speech (audio) containing a question and three options, the model must select the correct answer (option index 0, 1, or 2). 2) Task 1c (Hallucination Detection): Given an image and three statements (only one based on image content, the other two are plausible but hallucinatory), the model must judge the truth value (True/False) of each statement. The dataset is available in two language versions: English and Modern Standard Arabic (MSA), with both versions being fully parallel in images and answers, and questions translated between them. Data covers 18 Arab countries, including Algeria, Egypt, and Saudi Arabia, with culturally specific content. In terms of scale, the training set contains 3000 samples, the development set 500, the development test set 500, and the final test set 1000. The data is multimodal: including image files (.jpg), audio files (.wav) for Task 1a, and structured annotation files (.jsonl). Annotation files for Task 1a include id, image path, audio path, and correct answer index; for Task 1c, they include id, image path, a list of three statements, and a list of corresponding truth labels. This dataset is suitable for research and applications in multimodal visual question answering, cross-lingual multimodal understanding, hallucination detection, and evaluation of AI models for Arabic cultural content.
数据集概述:ImageEval 2026, Task 1: Ayn-VQA
该数据集是 ImageEval 2026 共享任务(ArabicNLP 2026 的一部分)中的第一个任务,名为 Ayn-VQA(Ayn,意为“眼睛”)。其核心目标是评估多模态模型在阿拉伯文化特定图像理解上的能力,具体包括从口语阿拉伯语问题中选择正确答案,以及区分基于图像的真实描述与幻觉描述。
许可协议:CC BY-NC 4.0(仅限研究使用)。
语言:阿拉伯语(现代标准阿拉伯语,MSA)和英语。
🎯 任务
数据集包含两个子任务,每个任务均提供英语和现代标准阿拉伯语(MSA)两个语言轨道,并独立评分。
-
任务 1a:口语 VQA(Spoken VQA)
给定一张图片和一个口语提问(含三个选项的音频),模型需从三个选项中选择正确的答案。预测输出为选项索引(0、1 或 2)。 -
任务 1c:幻觉检测(Hallucination detection)
给定一张图片和三个陈述语句,模型需判断每个语句是 True(基于图像的事实)还是 False(幻觉)。其中恰好有一个语句是真实的。预测输出为每个语句对应的 True/False 标签。
🗂️ 数据子集与配置
数据集按任务和语言分为4个配置:
| 配置名称 | 任务 | 语言 | Codabench 竞赛链接 |
|---|---|---|---|
task1a_en |
口语 VQA | 英语 | https://www.codabench.org/competitions/17002/ |
task1a_msa |
口语 VQA | 现代标准阿拉伯语 | https://www.codabench.org/competitions/17001/ |
task1c_en |
幻觉检测 | 英语 | https://www.codabench.org/competitions/17000/ |
task1c_msa |
幻觉检测 | 现代标准阿拉伯语 | https://www.codabench.org/competitions/16999/ |
每个任务的英语和现代标准阿拉伯语轨道是并行的:使用相同的图像和答案,问题互为翻译。
🌍 数据来源与覆盖范围
数据集覆盖 18 个阿拉伯国家:阿尔及利亚、巴林、埃及、伊拉克、约旦、科威特、黎巴嫩、利比亚、摩洛哥、阿曼、巴勒斯坦、卡塔尔、沙特阿拉伯、苏丹、叙利亚、突尼斯、阿联酋、也门。
🔊 音频信息(任务 1a)
- 训练集(
train)、开发集(dev)和开发测试集(devtest)中的问题是使用语音克隆技术(TTS)合成生成的。 - 最终盲测集(
test)中的问题将是人工录音,因此开发阶段音频与测试阶段音频之间会存在说话人/录音环境的差异。
📂 文件结构与字段说明
-
文件结构:
images/<id>.jpg:图像文件,所有任务和语言共享。audio/<lang>/<id>.wav:口语问题及选项的音频文件(仅任务 1a)。task1a/<split>_<lang>.jsonl:任务 1a 数据文件。task1c/<split>_<lang>.jsonl:任务 1c 数据文件。
-
字段说明:
任务 1a 数据文件字段:
字段 类型 描述 idstr 项目 ID imagestr 图像路径 images/<id>.jpgaudiostr 音频路径 audio/<lang>/<id>.wav,包含口语问题和三个选项(无文本提供)。labelint 正确选项的索引(0-2) 任务 1c 数据文件字段:
字段 类型 描述 idstr 项目 ID imagestr 图像路径 images/<id>.jpgstatementslist[str] 三个陈述语句,其中恰好有一个是真实的。 labelslist[bool] 每个陈述语句的真值(其中一个为 true)。附加字段:
train和dev分片额外包含country、category和subcategory字段。这些字段及标签在devtest和test分片中不提供。
📊 数据分片
| 分片 | 是否含标签 | 样本数量 | 用途 |
|---|---|---|---|
train |
是 | 3000 | 训练和微调 |
dev |
是 | 500 | 验证 |
devtest |
否 | 500 | 赛前测试,提交到 Codabench |
test |
否 | 1000 | 竞赛最终测试 |
盲测集 test 将在最终阶段发布。
🗓️ 时间线
- 开发阶段:2026-05-22 至 2026-07-19,提交至
devtest分片,实时排行榜。 - 测试阶段:2026-07-20 至 2026-07-29,提交至盲测
test分片,产生最终排名。
📏 评估指标
每个语言轨道独立评分。
-
任务 1a(口语 VQA):
- 排名指标:准确率(Accuracy),即回答正确的样本比例。
- 报告指标:平衡准确率(Balanced accuracy)、宏平均F1(Macro-F1)。
-
任务 1c(幻觉检测):
- 排名指标:组合准确率(Combined accuracy),即所有三个标签(一个真实、两个幻觉)全部预测正确的样本比例。
- 报告指标:幻觉率(Hallucination rate)、条件幻觉率(CFHR-2, CFHR-3)、Q+准确率、Q-准确率、Q-两者准确率。
🚀 提交方式
- 使用
datasets库加载目标配置分片。 - 生成预测结果,并按要求格式写入 CSV 文件。
- 任务 1a:CSV 包含列
id, prediction。 - 任务 1c:CSV 包含列
id, statement_index, prediction(statement_index为 0-2,prediction为true或false)。
- 任务 1a:CSV 包含列
- 将 CSV 文件压缩为
prediction.zip,并提交至对应任务的 Codabench 竞赛页面。
🧪 基线模型与参考
提供了端到端的 Colab 笔记本(位于 Google Drive),包括开源模型基线(如 Qwen2.5-Omni、Qwen2.5-VL)和级联 API 基线(如 Fanar Aura-STT + Oryx)。以下是参考基线得分:
| 任务 | 语言轨道 | 模型 | 指标 | 得分 |
|---|---|---|---|---|
| 1a | 英语 | Qwen2.5-Omni | 准确率 | 0.6640 |
| 1a | 现代标准阿拉伯语 | Qwen2.5-Omni | 准确率 | 0.3980 |
| 1c | 英语 | Qwen2.5-VL | 组合准确率 | 0.6840 |
| 1c | 现代标准阿拉伯语 | Qwen2.5-VL | 组合准确率 | 0.5080 |





