xiaorui638/finer-comprecap
收藏资源简介:
该数据集是一个多模态视觉问答数据集,包含图像和对应的问答数据。数据集特征包括图像、问题类型、问题文本、多个选项(最多5个)、正确答案索引、图像文件名和子集标识。数据分为四个子集:multi_attr(多属性,3338个样本)、multi_obj(多对象,6300个样本)、multi_rel(多关系,4280个样本)和 wh(wh-问题,3166个样本),总样本数约17084。数据集用于评估模型在视觉理解、属性识别、对象检测和关系推理等方面的能力。
This dataset is a multimodal visual question answering dataset containing images and corresponding question-answer pairs. Features include images, question types, question text, multiple choices (up to 5), ground truth index, image filenames, and subset identifiers. It is divided into four subsets: multi_attr (multi-attribute, 3338 examples), multi_obj (multi-object, 6300 examples), multi_rel (multi-relation, 4280 examples), and wh (wh-questions, 3166 examples), totaling approximately 17084 examples. The dataset is designed for evaluating model capabilities in visual understanding, attribute recognition, object detection, and relationship reasoning.




