EgoMask
收藏国家基础学科公共科学数据中心2026-07-06 收录
官方服务:
资源简介:
时空视频定位旨在根据文本查询在视频中定位目标实体。尽管现有研究在第三视角视频场景中已取得显著进展,但第一视角场景仍相对缺乏充分探索,而其在增强现实、机器人等应用中正变得日益重要。我们系统分析了第一视角视频与第三视角视频之间的差异,揭示了第一视角场景面临的若干关键挑战,包括目标持续时间更短、运动轨迹更稀疏、目标尺寸更小以及位置变化更剧烈。为应对这些挑战,我们提出了 EgoMask,这是首个面向第一视角视频细粒度时空定位的像素级基准。该基准由我们提出的自动标注流程构建,能够在短期、中期和长期视频中标注指代表达及目标掩码。此外,我们构建了 EgoMask-Train,一个大规模训练数据集,用于促进相关模型的发展。实验结果表明,现有最先进的时空定位模型在我们的 EgoMask 基准上表现不佳;而在 EgoMask-Train 上进行微调后,模型性能获得显著提升,同时仍能保持其在第三视角数据集上的表现。本文为推动第一视角视频理解的发展提供了重要资源与深入见解。
提供机构:
香港中文大学


