遇见数据集

VQA v2视觉问答数据集

收藏
官方服务:

资源简介:

VQA v2原始数据是一个大规模视觉问答数据集,用于测试模型对图像内容的视觉理解、语言理解和常识推理能力。数据包含:(1)图像:来自MS COCO数据集的真实自然场景彩色图像(JPG格式),分辨率不固定(通常数百像素);(2)问题:针对每张图像提出的开放式自然语言问题(英文),平均每张图像约5.4个问题;(3)答案:每个问题对应10个人工标注的真实答案(由不同标注者独立提供),答案形式为简短文本(通常1-3个词,包含“是/否”答案、数字、物体名称等);(4)数据集划分:训练集约44.4万问题(对应约8.3万张图像)、验证集约21.4万问题(对应约4.1万张图像)、测试集约44.8万问题(对应约8.1万张图像);(5)v2版本通过成对互补问题减少语言偏置(例如“是/否”问题中“是”和“否”的答案分布更均衡)。衍生数据为项目基于VQA v2原始数据进行的数据处理、评估方式、方法结果、衍生结论。

提供机构:
浙江大学
二维码
社区交流群
二维码
科研交流群
商业服务