遇见数据集

RefVideo-6M

收藏
arXiv2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

RefVideo-6M是一个大规模、高可靠性的参考引导视频编辑数据集,由中国电信人工智能研究院、香港中文大学等机构联合构建。该数据集包含500万视频编辑样本和100万图像编辑样本,总计600万条,视频分辨率达720p且帧数介于81至129帧,覆盖26种视频编辑任务与6种图像编辑任务,并提供约600万视觉参考,涵盖边界框、圆形、风格、纹理等多元参考类型。数据集采用逆向构建策略,以无伪影的真实视频作为编辑目标,利用12个编辑专家生成输入条件,并借助大语言模型过滤失败案例,确保监督信号的可靠性。该数据集旨在解决现有编辑数据集因依赖自动生成模型而引入伪影、以及缺乏视觉参考导致可控性不足的问题,为训练高质量参考引导视频编辑模型提供坚实基础,显著提升编辑的视觉质量、可控性与参考一致性。

RefVideo-6M is a large-scale, high-reliability reference-guided video editing dataset jointly constructed by China Telecom Artificial Intelligence Research Institute, The Chinese University of Hong Kong and other institutions. This dataset contains 5 million video editing samples and 1 million image editing samples, totaling 6 million samples overall. The videos have a resolution of 720p with frame counts ranging from 81 to 129, covering 26 video editing tasks and 6 image editing tasks, and provides approximately 6 million visual references spanning diverse types such as bounding boxes, circles, artistic styles, textures and more. The dataset adopts a reverse construction strategy: taking artifact-free real videos as editing targets, employing 12 professional editing experts to generate input conditions, and filtering failed cases with large language models (LLMs) to guarantee the reliability of supervision signals. This dataset addresses the core limitations of existing editing datasets, including artifacts introduced by reliance on automated generation models and insufficient controllability caused by the lack of visual references. It provides a solid foundation for training high-quality reference-guided video editing models, and significantly improves the visual quality, controllability and reference consistency of edited content.

创建时间:
2026-08-27
搜集汇总
数据集介绍
RefVideo-6M 数据集图片
构建方式
RefVideo-6M的构建流程匠心独运,旨在克服现有数据集在监督信号可靠性与视觉参考缺失方面的局限。该数据集依托于一个精心设计的管道:首先,从Pexels平台收集约百万量级的高清视频,经过去重、时长筛选后,利用先进的视觉模型提取物体掩膜与语义标注。随后,数据集通过12个专业编辑专家(涵盖全局风格迁移、局部物体操作、可控生成等)协同工作,生成5百万视频编辑对与1百万图像编辑对。尤为关键的是,构建过程中采取了反转策略——将人工编辑后的视频作为源视频,而将原始无瑕疵视频作为目标视频,从而确保了监督信号的高度可靠性。此外,每个样本均配有高质量的视觉参考图像(如边界框、圆圈、风格图、纹理图等),总数约6百万,覆盖10种参考类型,极大地丰富了编辑指令的维度。
使用方法
RefVideo-6M可被直接用于训练指令引导与参考引导的视频编辑模型。使用者可将源视频、编辑指令及可选的视觉参考图像作为输入,通过两阶段训练策略(先训练纯文本指令编辑模型,再引入参考令牌)实现模型能力的升级。数据集在Hugging Face上开源,便于直接下载与集成。基于该数据集,研究者可验证其模型的编辑质量、参考一致性及时间稳定性,并通过与现有数据集(如Señorita-2M、Ditto)的对比实验,展示其优越性。此外,数据集的构建流程(如反转策略、多专家协同)亦可为其他数据集的构造提供方法论启示。
背景与挑战
背景概述
随着基于指令的视频编辑技术蓬勃发展,高质量训练数据集的构建成为推动模型性能提升的关键因素。现有数据集多依赖自动编辑模型生成目标视频,却往往引入可见伪影,且过度依赖文本指令而缺乏关键视觉参考,制约了编辑的精准性与可控性。为突破这些瓶颈,由香港中文大学、中山大学及中国电信人工智能研究院等机构的研究人员于2026年联合推出了RefVideo-6M,一个大规模、高可靠的参考引导编辑数据集,涵盖500万视频编辑样本与100万图像编辑样本。该数据集颠覆常规构建流程,以无伪影的真实视频作为编辑目标,通过多专家管道生成经质量过滤的输入条件,并配备约600万视觉参考,覆盖多样参考类型与编辑场景,显著增强了模型对细粒度视觉对应关系的理解,为视频编辑领域树立了新的数据基准。
当前挑战
RefVideo-6M的构建面临多重挑战。在领域层面,现有数据集受限于自动编辑模型引入的伪影,导致监督信号不可靠;同时,仅凭文本指令难以实现身份保持、精确可控的编辑,缺乏视觉参考成为制约模型表现的核心瓶颈。在构建层面,数据规模与质量难以兼得:需兼顾720p高清分辨率与81至129帧的时长,并确保编辑任务覆盖全局、局部及可控编辑三大类共26项任务。为此,研究者设计了反向数据配对策略,以原始视频为编辑目标,规避生成伪影;并借助12个编辑专家与大型语言模型过滤失败样本,同时引入多类型参考图像(如边界框、圆形、纹理等)以增强视觉引导,最终在可靠性与多样性之间取得平衡。
常用场景
经典使用场景
RefVideo-6M作为大规模参考引导视频编辑数据集,其经典使用场景集中在基于指令与视觉参考的精细视频编辑模型训练与评估。研究者可利用其海量高质量视频对,涵盖全局风格转换、局部对象操作、可控条件生成等26类编辑任务,系统性地训练和验证模型在遵循文本指令的同时,精准利用边界框、圆形区域、物体图像、光线方向等多样化视觉参考信息完成编辑的能力。该数据集为视频编辑领域提供了统一且规模化的训练与测试平台,推动了从纯文本驱动向多模态参考引导的范式转变,成为衡量生成模型编辑精度、视觉一致性与用户可控性的关键基准。
解决学术问题
该数据集直面现有视频编辑数据集的两大痼疾:目标视频由自动编辑模型生成导致伪影与不可靠监督,以及缺失视觉参考导致编辑可控性与身份保持不足。RefVideo-6M通过创新性地反转源与目标视频角色,以无伪影的真实视频作为编辑目标,并辅以多专家生成与LLM严格过滤,确保了训练信号的可靠性与纯净度。其提供的约600万视觉参考,覆盖丰富参考类型与编辑场景,使模型能学习超越纯文本指令的细粒度视觉对应关系,有效解决了身份保持、空间定位、外观迁移等学术难题,显著提升了编辑模型的视觉质量、可控性与参考一致性,为建立高可靠性视频编辑数据构建范式提供了重要参考。
实际应用
在实际应用中,RefVideo-6M为视频内容创作与后期制作提供了强大的技术支撑,其应用场景涵盖影视特效、广告制作、社交媒体内容编辑及个性化视频定制等。基于该数据集训练的编辑模型,能够依据用户提供的参考图像、区域框选或方向指示,实现诸如风格迁移、物体替换、背景更换、人物换装、光照调整等专业级编辑操作,且保持视频的时间一致性与细节保真度。该数据集还支持多种视觉参考方式,使非专业用户也能通过直观的视觉指引实现精准编辑,极大地降低了视频编辑的专业门槛,推动了编辑工具的智能化与普及化,为视频行业的创意表达与效率提升注入了新的活力。
数据集最近研究
最新研究方向
RefVideo-6M数据集的问世,标志着视频编辑领域正经历从文本指令驱动向多模态参考引导的范式跃迁。该数据集以其600万级样本规模、26类精细编辑任务及720p高保真分辨率,构建了迄今最为完备的参考编辑基准,有效弥合了现有数据集中伪影干扰与视觉参考缺失的双重桎梏。尤为值得注意的是,其创新性的源-目标反转构造策略,确保了监督信号的纯净性;而涵盖空间定位、外观迁移等多维度的参考类型,则极大拓展了编辑控制的精细度与灵活性。这一数据基础不仅显著提升了编辑模型的视觉质量与指令遵循能力,更催生了如RefMoT等高效架构,为视频编辑技术向更精准、更可控、更富表现力的方向演进铺设了坚实的基石。
相关研究论文
  • 1
    RefVideo-6M: A Reliable Reference-Based Dataset for Instructional Video Editing中国电信人工智能研究院; 香港中文大学; 中山大学; 复旦大学; 清华大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务