室内场景VQA数据集
收藏资源简介:
该数据集专门针对室内场景,通过从Visual Genome、VQA v2和原始图像中过滤和生成问题与答案,形成一个特定领域的视觉问答数据集。数据集的生成过程包括使用关键词文件过滤图像和问题,应用对象检测算法(如YOLO 9000),并根据检测到的对象生成问题。此外,数据集还可以通过修改代码适应其他领域。
This dataset is specifically tailored for indoor scenes, forming a domain-specific visual question answering dataset by filtering and generating questions and answers from Visual Genome, VQA v2, and original images. The dataset generation process involves filtering images and questions using keyword files, applying object detection algorithms (such as YOLO 9000), and generating questions based on the detected objects. Additionally, the dataset can be adapted to other domains by modifying the code.
VQA Dataset Generator
数据集目标
本项目旨在开发一种技术,用于生成特定领域的视觉问答(VQA)数据集。当前版本专注于“室内场景”领域,生成室内场景的VQA数据集,该技术可通过少量代码修改适应其他数据集。
数据集结构
项目包含三个主要笔记本:
- visualGenome.ipynb: 从Visual Genome数据集中筛选包含特定关键词的图像,生成特定领域的数据集,并通过负筛选减少误报。
- VQA2_Dataset.ipynb: 从VQA v2数据集中筛选包含特定关键词的问题,生成特定领域的数据集。
- Raw_images_generator: 使用YOLO 9000算法从原始图像中检测对象,并应用问题模板生成问题,创建特定领域的数据集。
数据集处理流程
若要运行代码,需遵循以下步骤:
- 运行
install.ipynb设置环境。 - 运行
VQA_V2_Dataset.ipynb从VQA v2数据集中提取室内场景。 - 运行
VisualGenome.ipynb从VG和GQA数据集中提取室内场景。 - 运行
Questions_answers_generation.ipynb从NUY Depth V2数据集生成室内VQA数据集。 - 运行
Fusion.ipynb将所有数据集融合并分割为训练集和验证集。
注意事项
- 每个笔记本包含变量部分,用户需根据特定需求填充变量,特别是
data_root变量,需在所有笔记本中保持一致。 - 部分内容如房间模板问题、图像格式转换等特定于室内场景,如不需要可移除。
- 代码中包含的Google Colab相关代码可根据需要跳过。




