遇见数据集

netflix/Vera-Layered-Video-Dataset

收藏
Hugging Face2026-07-17 更新2026-07-22 收录
官方服务:

资源简介:

该数据集名为Vera分层视频数据集,专为Vera分层扩散模型设计,用于内容保持的视频编辑任务。数据集包含训练集和测试集,训练集分为49帧(3秒)和81帧(5秒)两种序列长度,其中49帧训练集总样本数为11,996,包括背景替换和对象添加两种编辑类型,具体划分如:realistic-set1-bg-change(914样本)、realistic-set1-obj-add(470样本)、realistic-set2-obj-add(770样本)、synthetic-bg-change(4,994样本)和synthetic-obj-add(4,848样本);81帧训练集总样本数为6,005,类似地包含背景替换和对象添加类型。测试集总样本数为141,分为bg-change(69样本)和obj-add(72样本)。数据来源于多个公开数据集,训练集包括Pexels、Mixkit和VideoMatte240K,测试集额外增加了DAVIS和VACEBench。该数据集支持视频生成和编辑研究,尤其适用于分层扩散框架,以分离生成内容与保留内容。

The Vera Hierarchical Video Dataset is a specialized dataset designed for the Vera Hierarchical Diffusion Model, targeting content-preserving video editing tasks. The dataset comprises a training set and a test set. The training set is split into two sequence lengths: 49 frames (3 seconds) and 81 frames (5 seconds). The 49-frame training subset contains a total of 11,996 samples, covering two editing categories: background replacement and object addition, with specific subdivisions as follows: realistic-set1-bg-change (914 samples), realistic-set1-obj-add (470 samples), realistic-set2-obj-add (770 samples), synthetic-bg-change (4,994 samples), and synthetic-obj-add (4,848 samples). The 81-frame training subset has a total of 6,005 samples, which also includes the aforementioned two editing categories. The test set consists of 141 samples in total, divided into bg-change (69 samples) and obj-add (72 samples). The dataset is sourced from multiple public datasets: the training set is collected from Pexels, Mixkit, and VideoMatte240K, while the test set additionally incorporates DAVIS and VACEBench. This dataset supports research on video generation and editing, and is particularly well-suited for hierarchical diffusion frameworks that separate generated content from preserved original content.

提供机构:
netflix
搜集汇总
数据集介绍
netflix/Vera-Layered-Video-Dataset 数据集图片
构建方式
Vera-Layered-Video-Dataset是为内容保留视频编辑任务而构建的专业分层数据集,源自加州理工学院与Netflix的联合研究。该数据集通过整合Pexels、Mixkit等高质量视频素材库以及VideoMatte240K背景抠图数据,经过精细的标注与过滤流程,构建出包含背景替换和物体添加两种编辑类型的训练与测试样本。数据以49帧(3秒)和81帧(5秒)两种时长范式组织,分别包含11,996和6,005个训练样本,以及141个涵盖DAVIS和VACEBench的测试样本,为模型学习分层视频编辑提供了坚实的数据基础。
特点
该数据集最显著的特点在于其分层编辑导向与多样化的样本构成。每个样本均明确标注编辑类型,包括“背景替换”和“物体添加”两大类,并进一步区分为真实场景与合成场景,覆盖了现实应用中的核心编辑需求。数据集还提供多帧率版本,支持不同长度视频的模型训练。此外,数据来源严格遵循开源许可协议,确保了研究的可复现性与合规性,为开发高质量的视频编辑模型提供了结构清晰且内容丰富的资源池。
使用方法
该数据集适用于训练基于扩散模型的视频编辑框架,尤其适配Vera分层扩散模型。研究者可根据任务需求选择49帧或81帧的子集进行训练,并通过编辑类型标签定向优化特定技能。数据以HuggingFace Datasets格式发布,用户可直接通过load_dataset接口加载,并利用内置的拆分信息划分训练与测试集。建议结合官方论文中描述的训练流水线与评估协议使用,以充分发挥数据集在保留原视频内容下的精准编辑能力。
背景与挑战
背景概述
Vera-Layered-Video-Dataset 由加州理工学院与 Netflix 的研究人员于 2026 年联合创建,主要团队成员包括 Hongkai Zheng、Ta-Ying Cheng、Benjamin Klein、Yisong Yue 和 Zhuoning Yuan。该数据集旨在支撑 Vera 分层扩散模型的研究,聚焦于内容保持的视频编辑任务,特别是背景替换与对象添加两大核心编辑类型。通过整合来自 Pexels、Mixkit、VideoMatte240K 等公开资源的高质量视频数据,并辅以合成样本,数据集构建了涵盖 49 帧与 81 帧两种时序长度的训练与测试样本共计约 1.8 万条。该研究在视频编辑领域首次系统性地提出“生成层与保留层分离”的范式,推动了扩散模型在视频级语义理解与精细编辑方向的发展,对后续的视频生成与编辑研究具有重要示范意义。
当前挑战
该数据集所面临的核心挑战包括三个方面:其一,视频编辑领域长期存在的语义一致性问题,即编辑过程中需精准区分哪些内容应被修改、哪些应被保留,而现有方法往往难以实现细粒度的区域控制;其二,构建过程中的数据来源多样且格式不一,需对来自不同许可协议下的真实与合成视频进行统一标注与格式转换,尤其是为每一帧生成精确的 alpha 遮罩及编辑图层,数据处理复杂度极高;其三,现有训练样本总量仍相对有限,尤其在真实场景中,复杂光照、运动模糊及遮挡情形下的编辑效果难以充分保障,亟需更大规模、更多样化的数据集以提升模型的泛化能力。
常用场景
经典使用场景
在视频编辑与生成领域,Vera-Layered-Video-Dataset 的经典使用场景聚焦于基于分层扩散模型的视频内容编辑任务,尤其是背景替换(background_replace)与对象添加(obj_add)这两类核心操作。该数据集精心设计为包含多帧序列(49帧与81帧)的训练与测试样本,其中涵盖了来自Pexels、Mixkit等高质量真实视频源以及合成生成的视频数据。研究者可利用该数据集训练能够同时生成编辑层、alpha遮罩及合成视频的分层扩散模型,从而精确分离“待生成”与“待保留”的内容,实现内容保持性极高的视频编辑。该数据集为评估和优化视频编辑模型的时序一致性、编辑精度与视觉自然度提供了标准化基准。
衍生相关工作
Vera-Layered-Video-Dataset的发布催生了一系列衍生研究工作。该项目本身即基于Vera分层扩散模型框架,其联合生成编辑层与alpha遮罩的思路启发了后续在视频分层表示、可控视频生成以及时序注意力机制方面的探索。相关经典工作包括利用类似分层策略进行视频对象移除、智能补全及风格迁移的研究,以及将分层扩散与光流约束相结合的时空一致性优化方法。此外,该数据集与DAVIS、VACEBench等基准的交叉引用,促进了视频编辑模型在新场景下的迁移学习与跨域评估。这些衍生工作共同推动了视频编辑领域从简单逐帧处理向结构化、内容感知的端到端生成的演进,为未来无监督视频分解与多模态编辑融合奠定了基础。
数据集最近研究
最新研究方向
在视频编辑领域,如何在不破坏原始内容结构的前提下实现精准的语义级修改,一直是生成式模型面临的重大挑战。Vera-Layered-Video-Dataset的提出,标志着分层扩散模型在内容保持型视频编辑中迈出了关键一步。该数据集由Netflix与加州理工学院联合构建,聚焦于‘背景替换’与‘对象添加’两类核心编辑任务,整合了Pexels、Mixkit等高质量视频源以及DAVIS、VACEBench等权威测试基准,为模型训练提供了海量带有alpha遮罩的分层样本。其独特之处在于,模型需同时生成编辑层、遮罩层与合成视频,从而将‘生成什么’与‘保留什么’严格解耦。这一研究方向正紧密呼应着影视后期、虚拟制片与短视频创作中对非破坏性编辑工具的强烈需求,推动了扩散模型从单帧图像操作向长时序、高保真视频编辑的跨越,为未来实现实时、可控的视频内容生成奠定了数据与架构基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务