遇见数据集

IDVTG-Gym, IDVTG-InternVid

收藏
arXiv2026-08-20 更新2026-08-22 收录
官方服务:

资源简介:

ID-VTG任务包含两个数据集:IDVTG-Gym和IDVTG-InternVid,由北京大学王选计算机技术研究所构建,旨在解决视频时间定位中文本查询难以区分视觉相似实体的问题。IDVTG-Gym专注于精细动作,包含14.7k条查询,涵盖204.1小时视频,基于FineGym体操视频构建,具有强视觉歧义性;IDVTG-InternVid面向开放世界,包含62.1k条查询,跨越302.7小时视频,从InternVid自动生成,涵盖多种实体类型。数据集通过两阶段流水线构建:首先生成文本歧义事件,然后选择可消歧的参考图像作为查询。该数据集主要应用于需要图像辅助消歧的视频时间定位任务,如智能监控、体育广播和多模态检索等场景。

The ID-VTG task encompasses two datasets: IDVTG-Gym and IDVTG-InternVid, which were constructed by the Wangxuan Institute of Computer Technology at Peking University. This work aims to address the critical challenge that text queries in video temporal localization struggle to distinguish visually similar entities. IDVTG-Gym focuses on fine-grained movements, containing 14.7k queries spanning 204.1 hours of video footage. It is built upon FineGym gymnastics video corpus and features significant visual ambiguity. IDVTG-InternVid targets open-world scenarios, with 62.1k queries covering 302.7 hours of video content. It is automatically generated from InternVid and includes a diverse range of entity types. The datasets are developed via a two-stage pipeline: first, generate textually ambiguous events, then select disambiguating reference images as queries. These datasets are primarily applicable to video temporal localization tasks that require image-assisted disambiguation, such as intelligent surveillance, sports broadcasting, and multimodal retrieval scenarios.

创建时间:
2026-08-20
原始信息汇总

ID-VTG 数据集详情

数据集简介

ID-VTG(Image-Disambiguated Video Temporal Grounding)是一个用于图像消歧视频时间定位任务的数据集,发表于 ACM MM 2026。该任务旨在解决传统视频时间定位中,仅凭文本查询难以区分视觉相似主体执行相同或相似动作的问题。每个查询包含两部分:

  • 文本查询:描述目标动作
  • 参考图像:标识目标实例

基准测试集

数据集包含三个基准测试集:

基准测试集 特点
IDVTG-Gym 细粒度、组合顺序的体操动作,涉及视觉相似的运动员
IDVTG-InternVid 开放世界视频,包含多样实体和强时间干扰
IDVTG-Web 用于跨域泛化评估的测试集

主要结果

数据集 R@1, IoU=0.5 R@1, IoU=0.7 mIoU
IDVTG-Gym 61.83 56.53 54.17
IDVTG-InternVid 51.21 41.24 48.30
IDVTG-Web 21.99 13.25 22.34

改进结果:通过将有效总批大小从4增加到8,IDVTG-Gym性能提升至 R@1@0.5=66.13,R@1@0.7=60.88,mIoU=57.89。

数据集资源

  • 数据集地址:https://huggingface.co/datasets/Chloe-UniU-oO/ID-VTG
  • 预提取特征:提供视频和查询图像的CLIP ViT-L/14预提取特征(特征维度D=768),可直接下载用于训练和评估
  • 数据组织:包含原始视频、查询图像、标注文件和预提取特征

数据集结构

数据集包含以下标注文件:

  • IDVTG-Gym:训练集、验证集(含动作级验证集)
  • IDVTG-InternVid:训练集、验证集(含不同歧义类型验证集)
  • IDVTG-Web:测试集

特征文件按以下方式组织:

  • 视频特征{video_name}.npy
  • 查询图像特征{query_id}.npy

开源代码与模型

  • 代码仓库:https://github.com/oceanflowlab/ID-VTG
  • 模型架构:采用视觉引导消歧聚合(VGD-Agg)框架,包含双分支快慢架构,使用可学习的Compare Token和Depress Value机制抑制视觉干扰
  • 基线依赖:基于SnAG代码库构建,使用ActionFormer和CLIP预训练模型
  • 最佳检查点:可通过PKU Disk下载(提取码:YXGP,有效期至2029年7月1日)
搜集汇总
数据集介绍
IDVTG-Gym, IDVTG-InternVid 数据集图片
构建方式
IDVTG-Gym与IDVTG-InternVid数据集通过两阶段流水线构建,旨在解决文本查询无法区分视觉相似实例的难题。第一阶段为歧义事件生成,IDVTG-Gym基于FineGym的层次化注释,筛选包含至少两次相同原子动作的片段,利用多模态大模型将离散标签转化为自由文本查询,并注入序数线索(如“第二次”)以强化时序推理;IDVTG-InternVid则利用Gemini-2.5-Pro自动标注目标角色的所有事件,确保文本和图像双重歧义,并经过后滤波与人工验证。第二阶段为消歧查询图像选择,使用Sa2VA进行实例级图像定位,结合多模态大模型评分选取最能体现身份特征的候选帧作为图像查询,最终形成具有严格视觉约束的文本-图像配对数据。
特点
这两个数据集在视频时间定位领域具有开创性,首次引入图像消歧查询范式,强制要求模型处理视觉相似实例的歧义。IDVTG-Gym聚焦于精细且有序的体操动作,运动员着装相似,包含细粒度子动作与整体事件,测试集分为子动作和整体两个子集,以评估不同粒度下的定位能力。IDVTG-InternVid则覆盖开放世界场景,包含人类、动物、虚构角色等多样实体,并设置强时间干扰项,如不同个体执行相似动作,显著提升定位难度。此外,数据集还包含领域外(OOD)网络视频测试集,用于检验模型的泛化鲁棒性。总计包含76.8K查询和506.8小时视频,规模远超现有基准。
使用方法
数据集适用于训练和评估图像消歧视频时间定位模型,典型应用包括智能监控、体育转播和多媒体检索。模型输入为视频片段、文本查询及参考图像,输出为目标事件的起止时间戳。评估指标采用Recall@n和mIoU,其中IoU阈值设为0.5和0.7。研究者可基于公开代码框架,利用预训练的视觉-语言模型(如CLIP)提取特征,并通过双分支架构(快速分支生成粗粒度提案,慢速分支进行细粒度帧级匹配)结合比较令牌和抑制值机制来消歧,最终通过文本引导模块进行边界回归。此外,数据集支持不同歧义类型(文本歧义、图像歧义)的单独评估,以及图像质量扰动下的鲁棒性测试。
背景与挑战
背景概述
视频时序定位(VTG)旨在依据自然语言查询在视频中定位目标事件,然而当文本描述无法区分视觉上相似的实体时,传统方法便陷入困境。为突破这一瓶颈,北京大学王选计算机研究所的Minghang Zheng、Yang Liu等研究者于2026年提出图像消歧视频时序定位(ID-VTG)任务,创新性地引入参考图像与文本联合的多模态查询,为视频理解领域开辟了新的研究方向。基于此,团队构建了IDVTG-Gym与IDVTG-InternVid两大基准数据集,前者聚焦于体操动作中运动员身着相似服装所引发的细微视觉歧义,后者则涵盖开放世界场景下多样的实体与显著的时序干扰。这些数据集填补了现有VTG基准在实例级歧义评估上的空白,为多模态视频理解提供了强有力的评测平台,并推动了相关算法在智能监控、体育转播及多模态检索等实际应用中的发展。
当前挑战
IDVTG数据集面临的首要挑战在于解决跨模态的语义歧义:当多个视频片段均符合文本描述时,模型需依赖参考图像的细微视觉线索来锁定唯一目标实例,这要求模型具备超越单纯语义匹配的细粒度视觉辨别能力。在数据集构建过程中,亦遭遇多重困难:IDVTG-Gym需从层级化注释中提取既包含整体事件又涵盖原子子动作的文本查询,并植入序数线索以强化时序推理;而IDVTG-InternVid则借助Gemini-2.5-Pro自动生成注释,需严格把控文本与图像双向歧义的构造质量,并辅以人工验证确保标注精度。此外,如何在开放世界环境下有效挖掘强干扰样本,以及如何设计既能保留全局时序信息又能进行帧级精细匹配的模型架构,亦是该领域持续面临的重大挑战。
常用场景
经典使用场景
IDVTG-Gym与IDVTG-InternVid数据集的核心使用场景聚焦于图像消歧视频时间定位任务,即通过结合参考图像与文本描述的多模态查询,在视频中精确锁定特定实例执行特定动作的视频片段。在IDVTG-Gym中,研究者可基于精细且具有组合顺序的体操动作,利用身着相似队服的运动员影像,评估模型在高度视觉混淆条件下对原子子动作与整体事件的定位能力。而IDVTG-InternVid则面向开放世界,涵盖人类、动物、虚构角色等多样实体,并引入显著的时间干扰项,用于检验模型在复杂动态场景中对细微视觉差异的辨别力。该数据集的经典应用范式要求模型不仅理解文本语义,还需通过参考图像约束视觉身份,从而在多个相似候选片段中准确选出目标片段,为多模态视频理解提供了更具挑战性的评测基准。
实际应用
在实际应用层面,IDVTG-Gym和IDVTG-InternVid所定义的任务具有广泛的落地价值。在智能监控领域,基于嫌疑人的照片即可快速定位其在视频中的行为轨迹,极大提升安防效率;在体育转播中,借助运动员的静态图像,系统能够自动追踪特定选手的表现片段,辅助精彩集锦生成与战术分析;在多模态检索场景下,用户可通过提供产品图片快速在视频流中定位具体商品的出现时机,优化购物体验。此外,该技术还可延伸至自动驾驶中特定行人的行为识别、医疗视频中特定病理特征的追溯等,其以图补文的交互模式为复杂视频内容的高效解析提供了新途径。数据集中包含的多样化实体与动作类型,为上述应用场景的模型训练与测试提供了贴近真实的基准。
衍生相关工作
这两个数据集的发布催生了一系列相关研究。在方法层面,VGD-Agg框架通过双分支快慢架构和可学习的Compare Token与Depress Value,为图像消歧视频时间定位提供了强有力基线,启发了后续关于自适应决策边界和跨模态特征聚集的研究。在任务拓展方面,该工作与STVG、视频高亮检测等任务形成互补,推动了多模态查询统一建模的探索。此外,数据集构建中采用的自动化标注流水线,结合多模态大语言模型进行事件生成与图像选择,也促进了基于大模型的视频标注技术发展。未来工作可能围绕更高效的视觉-语言融合策略、跨域泛化能力提升以及弱监督场景下的消歧技术展开,从而不断丰富视频理解的研究版图。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务