IDVTG-Gym, IDVTG-InternVid
收藏资源简介:
ID-VTG任务包含两个数据集:IDVTG-Gym和IDVTG-InternVid,由北京大学王选计算机技术研究所构建,旨在解决视频时间定位中文本查询难以区分视觉相似实体的问题。IDVTG-Gym专注于精细动作,包含14.7k条查询,涵盖204.1小时视频,基于FineGym体操视频构建,具有强视觉歧义性;IDVTG-InternVid面向开放世界,包含62.1k条查询,跨越302.7小时视频,从InternVid自动生成,涵盖多种实体类型。数据集通过两阶段流水线构建:首先生成文本歧义事件,然后选择可消歧的参考图像作为查询。该数据集主要应用于需要图像辅助消歧的视频时间定位任务,如智能监控、体育广播和多模态检索等场景。
The ID-VTG task encompasses two datasets: IDVTG-Gym and IDVTG-InternVid, which were constructed by the Wangxuan Institute of Computer Technology at Peking University. This work aims to address the critical challenge that text queries in video temporal localization struggle to distinguish visually similar entities. IDVTG-Gym focuses on fine-grained movements, containing 14.7k queries spanning 204.1 hours of video footage. It is built upon FineGym gymnastics video corpus and features significant visual ambiguity. IDVTG-InternVid targets open-world scenarios, with 62.1k queries covering 302.7 hours of video content. It is automatically generated from InternVid and includes a diverse range of entity types. The datasets are developed via a two-stage pipeline: first, generate textually ambiguous events, then select disambiguating reference images as queries. These datasets are primarily applicable to video temporal localization tasks that require image-assisted disambiguation, such as intelligent surveillance, sports broadcasting, and multimodal retrieval scenarios.
ID-VTG 数据集详情
数据集简介
ID-VTG(Image-Disambiguated Video Temporal Grounding)是一个用于图像消歧视频时间定位任务的数据集,发表于 ACM MM 2026。该任务旨在解决传统视频时间定位中,仅凭文本查询难以区分视觉相似主体执行相同或相似动作的问题。每个查询包含两部分:
- 文本查询:描述目标动作
- 参考图像:标识目标实例
基准测试集
数据集包含三个基准测试集:
| 基准测试集 | 特点 |
|---|---|
| IDVTG-Gym | 细粒度、组合顺序的体操动作,涉及视觉相似的运动员 |
| IDVTG-InternVid | 开放世界视频,包含多样实体和强时间干扰 |
| IDVTG-Web | 用于跨域泛化评估的测试集 |
主要结果
| 数据集 | R@1, IoU=0.5 | R@1, IoU=0.7 | mIoU |
|---|---|---|---|
| IDVTG-Gym | 61.83 | 56.53 | 54.17 |
| IDVTG-InternVid | 51.21 | 41.24 | 48.30 |
| IDVTG-Web | 21.99 | 13.25 | 22.34 |
改进结果:通过将有效总批大小从4增加到8,IDVTG-Gym性能提升至 R@1@0.5=66.13,R@1@0.7=60.88,mIoU=57.89。
数据集资源
- 数据集地址:https://huggingface.co/datasets/Chloe-UniU-oO/ID-VTG
- 预提取特征:提供视频和查询图像的CLIP ViT-L/14预提取特征(特征维度D=768),可直接下载用于训练和评估
- 数据组织:包含原始视频、查询图像、标注文件和预提取特征
数据集结构
数据集包含以下标注文件:
- IDVTG-Gym:训练集、验证集(含动作级验证集)
- IDVTG-InternVid:训练集、验证集(含不同歧义类型验证集)
- IDVTG-Web:测试集
特征文件按以下方式组织:
- 视频特征:
{video_name}.npy - 查询图像特征:
{query_id}.npy
开源代码与模型
- 代码仓库:https://github.com/oceanflowlab/ID-VTG
- 模型架构:采用视觉引导消歧聚合(VGD-Agg)框架,包含双分支快慢架构,使用可学习的Compare Token和Depress Value机制抑制视觉干扰
- 基线依赖:基于SnAG代码库构建,使用ActionFormer和CLIP预训练模型
- 最佳检查点:可通过PKU Disk下载(提取码:YXGP,有效期至2029年7月1日)




