遇见数据集

BeyondMasks

收藏
github2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

BeyondMasks是一个用于评估视频对象移除方法因果和物理一致性的基准数据集,包含时间对齐的合成和真实世界视频对,具有干净的背景参考。数据集涵盖多种光度、几何、体积和动态交互,支持基于掩码和指令驱动的编辑。每个样本包括输入视频(目标对象及其物理后效存在)、干净地面实况视频(对象和后效不存在)和二进制掩码视频(指示目标对象区域)。

BeyondMasks is a benchmark dataset for evaluating the causal and physical consistency of video object removal methods. It contains temporally aligned pairs of synthetic and real-world videos with clean background references. The dataset covers a wide range of photometric, geometric, volumetric and dynamic interaction scenarios, supporting both mask-based and instruction-driven video editing. Each sample comprises an input video (in which the target object and its physical aftereffects are present), a clean ground-truth video (where the object and its associated aftereffects are absent), and a binary mask video that delineates the region of the target object.

创建时间:
2026-06-19
原始信息汇总

数据集概述:BeyondMasks

BeyondMasks 是一个用于评估视频物体移除方法因果一致性和物理一致性的基准数据集,相关论文已被 ECCV 2026 接收。

核心目标

该数据集旨在评估视频物体移除方法是否不仅移除了目标物体,还消除了其产生的因果及物理后效,例如阴影、反射、光照变化、半透明效果、蒸汽和动态物理痕迹。它重新定义了视频物体移除任务:从局部重建转向因果场景一致性评估。

数据集内容

数据集包含时间对齐的视频三元组,每个样本包括:

  • 输入视频:目标物体及其物理后效存在的视频。
  • 真实背景视频:物体及其后效均不存在的干净参考视频。
  • 二值掩码视频:指示目标物体区域的视频。

数据集结构与访问

  • 托管平台:Hugging Face

  • 数据集地址https://huggingface.co/datasets/yigitekin/BeyondMasks/tree/main

  • 目录结构

    BeyondMasks/ ├── masks/ # 二值掩码视频 ├── object_not_present/ # 真实背景视频(无物体及后效) ├── objects_added/ # 输入视频(物体及后效存在) ├── data_example.json # 元数据格式示例 └── eval.py # 评估指标代码

    三个视频文件夹通过样本ID对齐,例如 masks/1.mp4object_not_present/1.mp4objects_added/1.mp4 对应同一样本。

物理后效类别

数据集涵盖以下六类物体引发的因果及物理后效:

类别 描述
阴影 物体投射的阴影及局部辐照度变化。
反射 物体在镜子、玻璃、水面等反射面上的直接或间接影像。
半透明效果 半透明或折射物体产生的效果。
蒸汽/散射 蒸汽、烟雾等体积痕迹或散射效果。
光源 发光物体引起的光照变化。
因果物理效果 动态痕迹,如涟漪、脚印、物体位移或表面变形。

评估协议:CORE

CORE(Causal Object Removal Evaluation)是一个基于视觉-语言模型的评估协议,包含两个互补的评分:

  • ObjectScore:衡量目标物体被移除的完整程度。
  • AftereffectScore:衡量物体引发的物理后效被清除的彻底程度。

支持的操作

  • 支持基于掩码和基于指令的编辑方式。
  • 提供了一个用于评估的代码仓库,包含 eval.pyrequirements.txt 及项目资产。
  • 评估代码仓库地址:https://github.com/YigitEkin/BeyondMasks

数据集许可

BeyondMasks 数据集采用 CC BY 4.0 许可协议发布。

搜集汇总
数据集介绍
BeyondMasks 数据集图片
构建方式
在视频物体移除领域,现有评估方法往往局限于掩膜区域的修复保真度,忽视了移除物体后其遗留的阴影、反射、光照变化等物理后效。为填补这一空白,BeyondMasks基准数据集应运而生。该数据集采用配对构建策略,精心收集了时间对齐的合成与真实世界视频对,每一对均包含带有目标物体及其物理后效的输入视频、无物体及后效的干净背景参考视频,以及指示目标物体区域的二进制掩膜视频。视频内容涵盖了光度、几何、体积及动态交互等多种后效类别,确保了数据集的全面性与挑战性。
特点
BeyondMasks数据集的核心特点在于其超越传统掩膜区域评估的视角,将视频物体移除重新定义为因果场景一致性任务。数据集不仅关注物体本身的去除,更系统性地评估了阴影、反射、透射、蒸汽散射、光照源及动态物理痕迹(如涟漪、脚印)等多达六类因果物理后效的清除程度。这种对因果一致性的强调,使得该基准能够揭示现有最先进方法在视觉逼真度与因果正确性之间的显著鸿沟,为领域提供了全新的评估维度。
使用方法
该数据集的使用遵循标准化的评估流程。研究者首先需从Hugging Face平台下载包含masks、object_not_present和objects_added三文件夹的配对视频数据。接着,将待评估方法的输出视频置于result文件夹中,并确保文件名与输入及参考视频对齐。随后,通过运行官方提供的CORE评估脚本,脚本会调用Gemini视觉语言模型作为评判工具,分别计算衡量目标物体去除完整性的ObjectScore和评估物理后效移除彻底性的AftereffectScore。最终,评估结果以JSON格式输出,支持断点续评,极大便利了大规模基准测试。
背景与挑战
背景概述
近年来,生成式视频模型在视觉真实性方面取得了显著进展,然而视频物体移除领域的评价标准仍局限于掩码区域的局部修复质量,忽略了物体移除作为一种因果干预所必需的物理一致性。为此,来自比尔肯大学和哈斯特帕大学的研究人员于2026年提出了BeyondMasks基准,旨在评估移除方法是否能够同时消除目标物体及其引发的阴影、反射、光照变化、半透明效应、蒸汽和动态物理痕迹等因果与物理后效。该数据集包含时空对齐的合成与真实视频对,涵盖了多种光度、几何、体积和动态交互场景,并支持基于掩码和指令驱动的编辑方式,重新定义了视频物体移除作为因果场景一致性的评价框架,对提升生成模型的物理可解释性与鲁棒性具有重要影响。
当前挑战
BeyondMasks所应对的核心挑战在于现有视频物体移除方法仅关注掩码区域的视觉保真度,却未能解决因果一致性问题,即物体移除后其物理后效的残留现象。这涉及从局部修复到全局因果干预的范式转变,需要评价模型能否识别并移除阴影、反射、光照变化、半透明折射、蒸汽散射以及涟漪、足迹等动态物理痕迹。在构建过程中,研究团队面临的难点包括:如何在真实场景中获取去除物体及其后效的干净参考视频,以及如何生成包含多样化物理交互且时空对齐的高质量合成-真实配对数据,同时确保标注的准确性与类别覆盖的全面性,为系统性因果一致性评估奠定基础。
常用场景
经典使用场景
在视频编辑与生成领域,BeyondMasks基准数据集为评估视频对象移除方法的因果与物理一致性提供了标准化的测试平台。其核心使用场景在于,研究者可基于该数据集提供的时空对齐三元组——包含输入视频、干净背景参考视频及目标对象掩码——系统性地评估各类移除算法在消除目标对象及其导致的阴影、反射、光照变化、半透明效果、蒸汽及动态物理痕迹等次生效应的表现。该数据集尤其适用于考察基于掩码和指令驱动的视频编辑模型是否能够实现真正意义上的因果一致场景重建,而非仅仅完成局部区域修复。
解决学术问题
该数据集解决了现有视频对象移除评估中忽视因果一致性的关键学术问题。传统评估协议仅聚焦于掩码区域的像素级保真度,将对象移除简化为局部修复任务,而未能考虑物体作为因果干预因素所引发的物理效应消除。BeyondMasks首次构建了包含多样光度、几何、体积与动态交互效应的真实与合成视频对,提出了CORE评估协议,联合衡量对象消失与次生效应的消除程度,填补了视觉真实性与因果正确性之间的鸿沟,推动了视频编辑评估从局部重建到场景因果一致性的范式转变。
衍生相关工作
BeyondMasks的发布催生了一系列经典衍生工作,包括基于大规模视频扩散模型的因果一致性优化方法、融合物理建模的阴影与反射移除网络,以及利用视觉-语言大模型(如Gemini)作为自动评估代理的范式探索。围绕其引入的CORE评估指标,研究者开发了多种改进型评估框架,如引入时间一致性约束或对动态物理痕迹(如水波、烟尘)进行显式建模。此外,该数据集还启发了若干关于因果关系在视频理解中角色的理论分析工作,推动了生成模型编辑能力从视觉相似性向语义与物理正确性的跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务