Grounded conversation Generation (GCG)
收藏资源简介:
一个用于视频视觉定位的基准数据集,包含38k个视频问答三元组、87k个对象和大约671k个细粒度的时空掩码。
A benchmark dataset for video visual grounding, which contains 38k video question-answer triples, 87k objects, and approximately 671k fine-grained spatio-temporal masks.
VideoGLaMM 数据集概述
数据集简介
VideoGLaMM 是一个大规模视频多模态模型,能够进行像素级视觉定位。该模型能够响应用户的自然语言查询,并在其生成的文本响应中交织时空对象掩码,以提供对视频内容的详细理解。VideoGLaMM 由三个关键组件组成:大型语言模型(LLM)、双视觉编码器和时空像素解码器。双视觉编码器分别提取空间和时间特征,这些特征共同传递给 LLM,以输出富含空间和时间线索的响应。
数据集亮点
- 引入了 Video Grounded Large Multi-modal Model (VideoGLaMM),这是一个视频大规模多模态模型,能够进行像素级视觉定位,具有端到端的对齐机制。
- 为了实现细粒度的时空对齐,引入了一个基准数据集 Grounded conversation Generation (GCG),包含 38k 个基于视频的 QA 三元组对、83k 个对象和大约 671k 个细粒度的时空掩码。
- 在基于对话生成、视觉定位和视频分割等多样化任务中评估了 VideoGLaMM 的性能,并取得了最先进的性能。
数据集架构
VideoGLaMM 由以下关键组件组成:
- 时空双编码器
- 双对齐 V-L 适配器,用于图像和视频特征
- 大型语言模型(LLM)
- L-V 适配器
- 可提示的像素解码器
数据集标注流程
提出了一个半自动标注流程,用于创建基于视频的 Grounded conversation Generation (GCG) 数据集。
数据集示例
在给定用户查询的情况下,VideoGLaMM 生成文本响应,并使用像素级掩码定位对象和短语,展示了其对视频内容的详细理解。
引用
bibtex @article{munasinghe2024videoglamm, title={VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos}, author={Shehan Munasinghe and Hanan Gani and Wenqi Zhu and Jiale Cao and Eric Xing and Fahad Khan and Salman Khan}, journal={ArXiv}, year={2024}, url={https://arxiv.org/abs/2411.04923} }




