遇见数据集

kinetics400-grt-video-masks

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

Kinetics-400 GRT Video Masks 是一个用于立体视频生成自监督学习的预计算遮挡掩码数据集,为ICML 2026论文《Geometric Reciprocity: Unlocking Self-Supervision for Stereoscopic Video Generation》而发布。该数据集基于Kinetics-400源视频,使用Video Depth Anything Large深度模型生成几何互易性(GRT)遮挡掩码。掩码通过应用相对立体位移(比例为视频宽度的0.06倍)计算得出,以模拟立体视觉中的视差效应。数据集包含总计298,337个视频的掩码序列,具体划分为239,789个训练样本、19,877个验证样本和38,671个测试样本。数据以压缩的.npz格式存储,每个视频对应一个掩码序列,并按2,984个tar分片进行组织,每个分片附带.done标记以指示完整性。掩码文件与原始Kinetics-400视频的文件名保持对应关系(例如,<split>/<relative_stem>.mp4 对应 <split>/<relative_stem>.npz),便于对齐使用。该数据集主要适用于视频修复、单目到立体视频转换、立体视频生成及几何互易性自监督学习等计算机视觉任务。

Kinetics-400 GRT Video Masks is a pre-computed occlusion mask dataset for self-supervised learning in stereoscopic video generation, released alongside the ICML 2026 paper *Geometric Reciprocity: Unlocking Self-Supervision for Stereoscopic Video Generation*. Built upon Kinetics-400 source videos, this dataset provides Geometric Reciprocity (GRT) occlusion masks generated via the Video Depth Anything Large depth model. The masks are calculated by applying relative stereoscopic displacement scaled to 0.06 times the video width to simulate the disparity effect in stereoscopic vision. The dataset contains mask sequences for a total of 298,337 videos, specifically split into 239,789 training samples, 19,877 validation samples, and 38,671 test samples. The data is stored in compressed .npz format, with each video corresponding to one mask sequence, and organized into 2,984 tar shards, each accompanied by a .done marker to indicate completeness. The mask filenames maintain correspondence with the original Kinetics-400 video filenames (e.g., <split>/<relative_stem>.mp4 corresponds to <split>/<relative_stem>.npz), facilitating aligned usage. This dataset is primarily applicable to computer vision tasks including video inpainting, monocular-to-stereoscopic video conversion, stereoscopic video generation, and self-supervised learning for geometric reciprocity.

创建时间:
2026-06-14
搜集汇总
数据集介绍
kinetics400-grt-video-masks 数据集图片
构建方式
Kinetics-400 GRT Video Masks数据集专为立体视频生成中的自监督学习而构建,源自经典的Kinetics-400视频库。其核心构建过程依托于几何互易性原理,首先利用Video Depth Anything Large模型从原始单目视频中精确估计深度信息,随后在水平方向上施加相对立体移位尺度——即视频宽度的0.06倍——来模拟立体视差。通过此移位操作,系统自动计算出由于视角变化而产生的遮挡区域,从而生成掩码序列。所有掩码以压缩的.npz格式存储,每个视频对应一个掩码文件,并保持与原视频相同的相对文件名路径,确保数据管理的便捷性与一致性。最终数据集覆盖298,337个视频,划分为训练、验证和测试子集,并打包为2,984个tar分片文件,辅以完成标记以便高效加载。
使用方法
用户可便捷地将此掩码数据集与Kinetics-400原始视频结合使用,以训练立体视频生成或视频修复模型。具体而言,首先根据掩码文件名中的分割标签(train/val/test)与相对路径定位对应的原始.mp4视频;随后加载.npz文件中的掩码序列,其序列长度与视频帧数一致;在训练过程中,可将掩码作为输入条件,引导模型学习如何从单目视频推理出立体视差下的遮挡区域修复策略。数据集提供了详尽的代码仓库(github.com/LuJingyi-John/GRT),包含掩码生成与模型训练的完整流水线。实践中建议采用分片加载方式,利用.tar归档与.done标记进行高效的数据迭代,避免内存瓶颈,同时可基于几何互逆性损失函数优化模型,以提升立体视频的生成质量与时空一致性。
背景与挑战
背景概述
Kinetics-400 GRT Video Masks数据集由Jingyi Lu和Kai Han在2026年国际机器学习大会(ICML)上提出的研究工作“Geometric Reciprocity: Unlocking Self-Supervision for Stereoscopic Video Generation”中创建。该数据集基于广泛使用的Kinetics-400视频数据集,通过Video Depth Anything大模型生成的深度信息,计算并预存了相对立体位移尺度为0.06倍视频宽度的几何互易(GRT)遮挡掩码。核心研究问题在于如何利用自监督学习范式从单目视频中生成立体视频,从而突破传统立体视频生成对大规模标注数据的依赖。数据集涵盖了239,789个训练视频、19,877个验证视频和38,671个测试视频,总计298,337个视频的掩码序列,为立体视频生成领域提供了标准化的预计算资源,显著推动了自监督立体视觉的研究进展。
当前挑战
该数据集面临的核心领域挑战在于解决从单目视频到立体视频的自监督生成问题,传统方法依赖昂贵的双目视频对或深度真值标注,而GRT方法通过几何互易性设计避免了对标注数据的依赖,但仍需处理视频中复杂运动场景导致的遮挡区域不连续、深度估计误差累积等问题。在构建过程中,挑战主要体现在大规模深度计算与掩码生成的计算效率上,需要为近30万个Kinetics-400视频片段逐一运行深度模型并计算掩码,且掩码数据需以紧凑的压缩.npz格式存储至2,984个分片档案中,以确保存储与读取的可行性。此外,如何确保不同分辨率与帧率的视频源生成一致且可靠的立体掩码,同时保持与原始视频文件名的对应关系,也是数据整理中的关键难点。
常用场景
经典使用场景
Kinetics-400 GRT Video Masks 数据集专为立体视频生成与视频修复任务而设计,其核心价值在于提供了基于几何互易性原理预计算的不遮挡掩码。这些掩码源自Kinetics-400大规模视频库,利用Video Depth Anything Large模型估计深度信息,并通过相对立体视差缩放生成左右视图之间的遮挡区域标注。研究人员可借助该掩码数据,对任意单目视频进行立体化转换或缺失区域修复,从而在无须人工标注的前提下,高效构建自监督训练样本,推动视频立体化与时空一致性修复技术的进步。
解决学术问题
该数据集直击立体视频生成领域长期存在的标注匮乏难题。传统方法依赖双目相机捕获或人工标注遮挡区域,成本高昂且难以规模化。Kinetics-400 GRT Video Masks 通过几何互易性自监督框架,首次实现从大规模单目视频中自动提取高质量遮挡掩码,解决了视差预测中的空洞与遮挡模糊问题。这一突破为视频立体化、深度感知增强以及时空一致性修复提供了关键训练信号,显著推动了无监督立体视频生成方法的发展,其影响延伸至计算机视觉中关于几何一致性与运动感知的前沿探索。
实际应用
在实际应用中,该数据集可服务于虚拟现实与增强现实内容制作,通过将平面视频转换为立体画面,提升沉浸式体验。好莱坞影视工业中的2D转3D后期流程,以及短视频平台的立体化特效功能,均可借助预计算掩码实现高效自动化处理。此外,在自动驾驶领域,该数据集可用于单目摄像头深度估计与场景重建的辅助训练;在远程会议系统中,它能改善复杂背景下的实时立体渲染效果,提供更自然的视觉呈现。
数据集最近研究
最新研究方向
在当前视频生成与三维视觉交叉的前沿领域,kinetics400-grt-video-masks数据集的发布为立体视频生成提供了关键的几何先验支持。该数据集基于大规模动作识别基准Kinetics-400,利用Video Depth Anything深度模型预计算了接近三十万段视频的几何互易遮挡掩码,直接服务于ICML 2026所提出的自监督立体视频生成范式。这一工作突破了传统单目转立体任务中对人工标注或外部几何信息的依赖,通过几何互易性原理实现无需配对数据的高效训练,显著推动了视频内容从二维平面向沉浸式三维体验的跃迁。其大规模、高精度掩码的公开,不仅为视频修复、深度估计等下游任务提供了可靠基准,更呼应了业界对虚实融合与空间智能日益增长的需求,为下一代交互式媒体与增强现实应用奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务