遇见数据集

grt-davis-eval-masks

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

DAVIS GRT 评估掩码数据集是为论文《几何互惠性:解锁立体视频生成的自监督学习(ICML 2026)》发布的预计算评估掩码。该数据集基于 DAVIS 2017 480p 视频源,使用 Video Depth Anything Large 深度模型生成,并按照相对立体位移比例(视频宽度的 0.06 倍)进行处理。数据以压缩的 .npz 格式存储,每个视频对应一个掩码序列,掩码文件名与原始视频文件名(不含扩展名)保持一致。该数据集主要用于立体视频生成、视频修复等任务的评估,支持几何互惠性自监督方法的研究与应用。

The DAVIS GRT Evaluation Mask Dataset is a pre-computed evaluation mask set released for the paper *Geometric Reciprocity: Unlocking Self-Supervised Learning for Stereo Video Generation* (ICML 2026). This dataset is based on the DAVIS 2017 480p video source, generated using the Video Depth Anything Large depth model, and processed according to the relative stereo displacement ratio (0.06 times the video width). The data is stored in compressed .npz format, with each video corresponding to a mask sequence, and the mask filenames are consistent with the original video filenames (without file extensions). This dataset is primarily used for evaluating tasks such as stereo video generation and video inpainting, and supports the research and application of geometric reciprocity-based self-supervised learning methods.

创建时间:
2026-06-27
搜集汇总
数据集介绍
grt-davis-eval-masks 数据集图片
构建方式
该数据集源自DAVIS 2017 480p视频基准,通过集成Video Depth Anything Large深度估计模型,以相对立体偏移尺度0.06倍视频宽度生成立体对,并预先计算几何互易性(Geometric Reciprocity)评估所需的掩码序列。所有掩码以压缩的.npz格式存储,每个视频对应一个独立的掩码序列文件,文件名与源视频主干名一致,确保匹配的便捷性。构建过程旨在为立体视频生成的自监督学习提供标准化的评估工具。
使用方法
使用该数据集时,研究者需从DAVIS 2017获取原始视频,并将对应的.npz掩码文件加载至自定义的立体视频生成与评估流程中。掩码序列与视频帧一一对应,可用于计算几何互易性损失或评估生成效果。建议搭配官方GitHub仓库(github.com/LuJingyi-John/GRT)中的代码库,以复现论文实验或进行扩展研究。加载掩码时可直接根据视频主干名匹配文件,无需额外整理。
背景与挑战
背景概述
该数据集由卢景宜与韩凯等研究人员为2026年国际机器学习大会提出的《几何互易性:解锁立体视频生成的自监督方法》而创建,旨在推动立体视频生成领域的发展。其核心研究问题在于如何利用几何互易性原理,从单目视频中自监督地训练立体视频生成模型,摆脱对昂贵人工标注数据的依赖。数据集基于DAVIS 2017基准视频,通过Video Depth Anything深度模型计算视差,并生成GRT评估遮罩,为立体视频生成任务提供了标准化的评价工具。作为ICML 2026收录工作的重要资源,该数据集有望推动自监督立体视频生成研究,促进视频编辑、虚拟现实等应用领域的算法评估与对比。
当前挑战
该数据集所解决的领域挑战在于立体视频生成任务中缺乏大规模、高质量的自监督评价标准。传统方法依赖于手工标注的立体视频对,成本高且难以规模化,而几何互易性通过单目视频自监督学习,无需成对数据即可训练模型,但需精确的遮罩来评估生成立体视频的几何一致性。构建过程中的挑战则包括:如何从DAVIS单目视频中可靠地估计深度图并生成左右视图的遮罩,避免深度估计误差导致的伪影;如何选择最优的立体偏移比例(如0.06倍视频宽度)以平衡立体感与图像质量;以及如何保证遮罩序列与原始视频帧的精确对齐和压缩存储的高效性。
常用场景
经典使用场景
在立体视频生成与视频修复领域,GRT-DAVIS评估掩码集作为一项不可或缺的基准工具,广泛应用于基于几何互易性的自监督立体视频生成方法的性能评估。该数据集依托于DAVIS 2017高分辨率视频源,通过预测深度图并施加相对立体偏移,生成精准的掩码序列,为研究者提供了衡量立体视频一致性与修复质量的标准化测试平台。其经典使用场景在于评估模型在保持几何一致性的前提下,从单目视频生成稳定、无伪影的立体视频的能力,尤其在视频修复任务中,这些掩码能够定位待修复区域,确保修复过程不破坏立体对应关系。
解决学术问题
该数据集的核心贡献在于解决了立体视频生成领域长期存在的监督信号匮乏这一学术瓶颈。传统的立体视频生成方法依赖大量成对立体视频数据进行有监督训练,而获取这种标注数据成本高昂。GRT-DAVIS评估掩码集基于几何互易性原理,提供了一种无需真实立体视频标注的自监督训练与评估方案,使研究者能够在单目视频上直接检验立体一致性。其意义在于推动了自监督学习在立体视觉中的理论突破,显著降低了立体视频生成研究的数据门槛,并鼓励学术界探索更鲁棒的几何约束机制,从而提升了生成视频的时空连续性与视觉真实性。
实际应用
在实际应用中,GRT-DAVIS评估掩码集为立体视频内容的自动化生产与修复提供了关键支撑。例如,影视制作中从历史单目影像生成立体版本时,该掩码集可用于验证生成视频的立体效果是否自然,避免出现深度翻转或视觉疲劳。在沉浸式虚拟现实与增强现实场景中,该数据集帮助开发者优化立体视频的渲染质量,确保用户在头戴显示器中获得一致且舒适的深度感知。此外,在视频修复领域,该掩码集能够辅助自动识别需要修复的立体区域,使得老旧视频修复、遮挡物移除等任务在保持立体结构完整性的前提下高效完成,显著提升了相关工业流程的智能化水平。
数据集最近研究
最新研究方向
该数据集服务于立体视频生成领域的自监督学习范式,依托几何互易性原理,突破传统立体视频生成对成对左右视图的依赖。通过预置DAVIS视频序列的几何互易性评估掩码,研究者可系统验证单目视频向立体视频转换的生成质量与几何一致性。当前前沿方向聚焦于将视频深度估计与相对立体偏移量结合,利用掩码实现像素级几何约束,推动无监督立体视频生成模型在动态场景中的鲁棒性提升。该工作被ICML 2026收录,标志着几何先验在视频生成领域从辅助监督信号向核心自监督机制的关键转变,为降低立体内容创作成本提供理论支持。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务