VideoRefer-700K
收藏资源简介:
VideoRefer-700K是一个大规模、高质量的对象级视频指令数据集,通过复杂的多代理数据引擎精心策划,填补了高质量对象级视频指令数据的空白。
VideoRefer-700K is a large-scale, high-quality object-level video instruction dataset. Meticulously curated via a sophisticated multi-agent data engine, it fills the gap in high-quality object-level video instruction data.
VideoRefer Suite 数据集概述
数据集简介
VideoRefer Suite 是一个旨在增强视频大语言模型(Video LLMs)在细粒度时空理解能力的套件。它包含三个主要组件:模型(VideoRefer)、数据集(VideoRefer-700K)和基准测试(VideoRefer-Bench)。
主要组件
1. 模型(VideoRefer)
- 功能:
VideoRefer是一个有效的视频大语言模型,能够在任意指定时间戳对用户定义的区域进行细粒度感知、推理和检索。 - 支持:支持单帧和多帧区域输入。
2. 数据集(VideoRefer-700K)
- 规模:
VideoRefer-700K是一个大规模、高质量的对象级视频指令数据集。 - 生成方式:通过复杂的多代理数据引擎生成,填补了高质量对象级视频指令数据的空白。
3. 基准测试(VideoRefer-Bench)
- 评估内容:
VideoRefer-Bench是一个综合基准测试,用于评估模型在对象级视频理解方面的能力。 - 子基准:包含两个子基准测试:
VideoRefer-Bench-D(描述生成)和VideoRefer-Bench-Q(多项选择题回答)。
数据集使用
安装与依赖
- 基本依赖:Python >= 3.8, Pytorch >= 2.2.0, CUDA Version >= 11.8, transformers == 4.40.0, tokenizers == 0.19.1。
- 安装步骤: bash git clone https://github.com/DAMO-NLP-SG/VideoRefer cd VideoRefer pip install -r requirements.txt pip install flash-attn==2.5.8 --no-build-isolation
训练与评估
- 训练阶段:分为四个阶段,包括图像-文本对齐预训练、区域-文本对齐预训练、高质量知识学习和视觉指令微调。
- 评估:详细评估方法请参考 eval。
模型库
基准测试使用
- 注释:基准测试的注释可在 🤗benchmark 找到。
- 使用说明:详细使用方法请参考 doc。
引用
如果 VideoRefer Suite 对您的研究和应用有帮助,请使用以下 BibTeX 引用:
bibtex
@article{yuan2024videorefersuite,
title = {VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM},
author = {Yuqian Yuan, Hang Zhang, Wentong Li, Zesen Cheng, Boqiang Zhang, Long Li, Xin Li, Deli Zhao, Wenqiao Zhang, Yueting Zhuang, Jianke Zhu, Lidong Bing},
journal={arXiv},
year={2024},
url = {}
}




