abcasas/VIGIA-QA-dataset
收藏资源简介:
该数据集是一个视频理解和问答数据集,包含视频剪辑及其相关元数据。每个样本包括视频ID、剪辑ID、开始和结束时间戳、初始帧图像和索引、三个剪辑分段的帧图像和索引、基于Florence2模型的边界框标注、记忆文本、记忆内容、问答问题、是否回答为是的答案、情景记忆来源、是否冷启动标志、冷启动目标和类型。数据集分为训练集(202个样本)和测试集(14个样本),用于支持视频分析、记忆增强问答和冷启动场景下的任务。
This dataset is a video understanding and question-answering dataset containing video clips and associated metadata. Each sample includes video ID, clip ID, start and end timestamps, initial frame images and indices, frame images and indices for three clip sectors, bounding box annotations based on the Florence2 model, memory text, memory content, QA question, yes/no answer, episodic memory source, cold start flag, cold start target, and cold start type. The dataset is split into a training set (202 examples) and a test set (14 examples), designed to support video analysis, memory-enhanced QA, and tasks in cold-start scenarios.




