coco-arvqa
收藏资源简介:
COCO-ARVQA是一个基于MS COCO 2017 train2017图像的阿拉伯语视觉问答数据集。该数据集提供了阿拉伯语问题、阿拉伯语答案、答案列表、问题标识符、图像标识符和COCO图像文件名。数据集不重新分发COCO图像,训练和验证拆分都引用了官方COCO 2017 train2017.zip存档中的图像。数据集包含93,645个训练示例和10,361个验证示例,总计104,006个示例,涉及55,438张独特图像。每个示例包含多个字段,如任务名称、问题ID、图像ID、阿拉伯语问题、阿拉伯语答案、答案类型等。该数据集适用于阿拉伯语视觉问答、多语言和阿拉伯语视觉语言建模、低资源多模态学习研究等任务。数据集中的阿拉伯语问答注释采用CC BY 4.0许可,而COCO图像需从官方存档下载并遵守原始图像许可。
数据集概述:COCO-ARVQA
COCO-ARVQA 是一个面向阿拉伯语的视觉问答(VQA)数据集,基于 MS COCO 2017 train2017 图像构建。
数据集摘要
- 语言:阿拉伯语
- 许可证:CC BY 4.0
- 任务类型:视觉问答、图像到文本
- 标签:阿拉伯语、VQA、视觉问答、COCO、多模态、低资源语言、阿拉伯语NLP
数据集结构
coco-arvqa/ ├── README.md ├── CITATION.cff ├── LICENSE ├── dataset_stats.json ├── data/ │ ├── train.jsonl │ └── validation.jsonl └── assets/ ├── split_examples.png ├── unique_images.png ├── answer_type_distribution.png └── top_question_types_train.png
数据划分
| 划分 | 样本数 | 唯一图像数 | 图像来源 |
|---|---|---|---|
| 训练集 (Train) | 93,645 | 49,894 | COCO 2017 train2017 |
| 验证集 (Validation) | 10,361 | 5,544 | COCO 2017 train2017 |
| 总计 | 104,006 | 55,438 | COCO 2017 train2017 |
答案类型分布
| 答案类型 | 训练集 | 验证集 | 总计 |
|---|---|---|---|
| 是/否 (yes/no) | 36,157 | 3,925 | 40,082 |
| 数字 (number) | 26,591 | 2,921 | 29,512 |
| 其他 (other) | 30,897 | 3,515 | 34,412 |
数据字段
每条 JSONL 记录包含以下字段:
| 字段 | 类型 | 描述 |
|---|---|---|
task |
string | 任务名称,通常为 vqa_ar |
question_id |
integer/string | 问题标识符 |
image_id |
integer/string | COCO图像标识符 |
image_file_name |
string | 图像在COCO train2017 中的文件名 |
coco_split |
string | COCO图像划分,此处为 train2017 |
coco_images_zip |
string | 官方COCO图像压缩包URL |
question_ar |
string | 阿拉伯语视觉问题 |
prompt |
string | 指令形式的阿拉伯语提示 |
answer_ar |
string | 主要阿拉伯语答案 |
multiple_choice_answer_ar |
string | 阿拉伯语多项选择答案(可用时) |
answers_ar |
list[string] | 阿拉伯语答案标注列表 |
question_type_en |
string | 原始或继承的英语问题类型类别 |
answer_type |
string | 答案类别:yes/no、number 或 other |
source_dataset |
string | 图像来源数据集 |
dataset_name |
string | 数据集名称 |
使用方式
从 Hugging Face 加载标注
python from datasets import load_dataset
ds = load_dataset("MouaffakAyoub/coco-arvqa")
下载并匹配 COCO 图像
bash wget http://images.cocodataset.org/zips/train2017.zip unzip train2017.zip
python from pathlib import Path
image_root = Path("train2017") example = ds["train"][0] image_path = image_root / example["image_file_name"]
预期用途
- 阿拉伯语视觉问答研究
- 多语言和阿拉伯语视觉-语言建模
- 多模态模型的参数高效适配
- 低资源多模态学习研究
- 阿拉伯语VQA系统评估
限制说明
- 本仓库不包含COCO图像,用户需自行下载
- 训练集和验证集均引用COCO 2017
train2017图像 - 阿拉伯语问答可能存在翻译或生成噪声
- 数据集可能继承COCO图像及自动生成/翻译过程中的视觉、文化和社会偏见
- 部分答案简短,如颜色、数字或是否回答
许可与版权
- 阿拉伯语VQA标注:采用 CC BY 4.0 协议发布
- COCO图像:本仓库不重新分发,用户须从官方COCO存档下载并遵守原始图像许可和Flickr条款




