遇见数据集

VicEdit-400K

收藏
arXiv2026-08-17 更新2026-08-19 收录
数据链接:
官方服务:

资源简介:

VicEdit-400K是首个面向视觉上下文视频编辑的大规模数据集,由上海交通大学、腾讯优图实验室及浙江大学联合构建。该数据集包含约40万条高质量样本,覆盖单张图像、图像对和视频对三种参考模态,以及十种精细编辑任务,视频长度主要集中于30至120帧区间。通过自动化流水线完成数据构建,涵盖源数据筛选、指令合成、视觉参考生成和语义验证四个阶段,确保了高视觉保真度与语义一致性。该数据集旨在弥补文本指令在细粒度纹理、空间变换及动态运动描述上的不足,为可控视频编辑提供多模态视觉引导的坚实基础。

VicEdit-400K is the first large-scale dataset for visual-context-aware video editing, jointly constructed by Shanghai Jiao Tong University, Tencent YouTu Lab, and Zhejiang University. This dataset contains approximately 400,000 high-quality samples, covering three reference modalities: single image, image pair, and video pair, as well as ten fine-grained editing tasks, with video lengths mainly ranging from 30 to 120 frames. The dataset is built via an automated pipeline that includes four stages: source data filtering, instruction synthesis, visual reference generation, and semantic verification, ensuring high visual fidelity and semantic consistency. This dataset aims to address the shortcomings of text instructions in describing fine-grained textures, spatial transformations, and dynamic motions, providing a solid foundation for multi-modal visual-guided controllable video editing.

创建时间:
2026-08-17
原始信息汇总

VicEdit: 基于视觉上下文示例的视频编辑

项目概述

VicEdit 提出了一种视觉上下文编辑(Visual In-context Editing) 新范式,将视频编辑从纯文本指令扩展到多模态视觉指导,涵盖单张图像、图像对和视频对三种参考模态。该项目包含数据集、模型框架和评测基准三大部分。

关键贡献

  1. 视觉上下文编辑范式:将视频编辑从仅文本指令扩展到多模态指导(单张图像、图像对、视频对),解决语言在传达纹理、空间布局和时间动态方面的表达瓶颈。
  2. VicEdit-400K 数据集:首个大规模视觉上下文视频编辑数据集,包含 40 万个高质量样本,覆盖三种参考模态和十种任务类型,通过自动化流水线和多维质量过滤构建。
  3. VicEdit 框架:统一框架,包含模态自适应语义蒸馏(MASD) 用于提取特定模态语义令牌,以及双上下文注入(DCI) 用于将视觉和文本上下文协同融合到视频 DiT 中。

数据集详情(VicEdit-400K)

  • 规模:400K 高质量样本
  • 参考模态:单张图像、图像对、视频对
  • 任务类型:10 种
  • 构建流程:四阶段流水线(源数据过滤、指令合成、视觉参考生成、质量验证)
  • 统计信息:提供主题分析、提示词长度分布、帧分布、编辑任务分布和提示词词云

视觉参考类型与解决的问题

参考类型 解决的问题
单张图像 解决文本基线方法中的风格漂移问题,精确锚定目标纹理,实现连贯风格迁移
图像对 解决文本指令只说明"改什么"而不说明"改哪里"的问题,直观定义空间锚点
视频对 解决复杂运动动态无法用文本描述的问题,提供时间运动线索实现动态编辑

评测基准(VicEdit-Bench)

  • 覆盖三种参考模态和多种任务类型
  • 在视觉上下文编辑和基础指令编辑任务上均取得最先进性能(SOTA)
  • 定量结果显示在视觉上下文编辑任务上显著优于所有基线方法

支持的任务类别

包括背景更换、局部替换、创意编辑、字幕编辑、局部修复(inpainting)、局部外扩(outpainting)、全局风格迁移、局部风格迁移、局部移除、局部添加等十种任务。

对比方法

与以下现有方法进行对比:VideoCoF、NovaEdit、Lucy-Edit、Kiwi-Edit。

搜集汇总
数据集介绍
VicEdit-400K 数据集图片
构建方式
VicEdit-400K的构建依托于一个精心设计的自动化流程,旨在为视觉上下文视频编辑提供大规模、多模态的监督信号。该流程首先从Señorita-2M和OpenVE-3M等现有大规模数据集中筛选出高质量源视频,通过美学评分与语义一致性双重过滤机制确保数据基础的精良。随后,利用多模态大语言模型合成与参考类型适配的编辑指令,并通过视觉参考生成阶段产出三类参考模态:单张图像、图像对和视频对,其中视频对通过语义知识图谱与谱聚类保证时序连贯性与内容关联性。最终,所有样本经过多维度语义验证,包括指令遵循度、时序一致性与参考对齐度,以过滤不合格样本,确保数据集整体质量。
特点
VicEdit-400K作为视觉上下文视频编辑领域的首个大规模数据集,具有显著的创新性与多样性。其核心特色在于涵盖三种参考模态(单图像、图像对、视频对)与十种细粒度编辑任务,统一了从全局风格迁移到局部对象操作、再到时空综合生成的编辑语义空间。数据集规模达40万样本,视频帧数跨度从33至129帧,分辨率覆盖480×832至1120×1984,广泛覆盖多样化的编辑场景与复杂指令。此外,数据集中每类任务与模态的组合均保持均匀分布,为训练具备通用视觉上下文理解能力的模型奠定了坚实基础。
使用方法
VicEdit-400K的设计支持两阶段使用范式。首先,其可作为大规模训练语料,用于联合优化视觉与文本双上下文的条件生成模型,通过VicEdit框架中的模态自适应语义蒸馏与双上下文注入模块,实现跨异构参考的高保真编辑。其次,数据集划分出一部分独立样本构建VicEdit-Bench基准,该基准包含200个代表性实例,专用于评估模型在零样本场景下的视觉上下文编辑能力。研究者可将源视频、指令及参考样本(图像或视频对)作为输入,基于文本指导与视觉示例的协同作用,生成符合预期编辑意图的目标视频。
背景与挑战
背景概述
随着视频编辑技术的迅猛发展,基于指令的编辑方法虽已取得显著进展,但纯文本指令在传达细腻纹理与复杂动态方面存在固有局限。为弥合这一感知鸿沟,上海交通大学与腾讯优图实验室、浙江大学的研究团队于2026年提出视觉上下文编辑(Visual In-context Editing)新范式,并构建了首个大规模数据集VicEdit-400K。该数据集涵盖单张图像、图像对和视频对三种参考模态,覆盖十种编辑任务类型,共计四十万高质量样本。其构建依托自动化流水线,综合多维度过滤机制确保视觉保真度与语义一致性。VicEdit-400K的发布为多模态视频编辑研究奠定了系统性数据基础,推动了编辑范式从文本描述向视觉演示的转变。
当前挑战
VicEdit-400K面临的挑战体现在两个层面。在领域问题层面,现有视频编辑数据集多局限于文本指令或单一图像参考,难以支撑跨模态视觉引导的学习;同时,异构参考模态间的语义结构差异显著,如何统一建模空间变换、时间动态与全局纹理构成根本性挑战。在数据构建层面,自动化流水线面临多重困难:源数据筛选需兼顾美学质量与语义可编辑性;指令合成须确保与视觉参考严格对齐;视觉参考生成需规避时间伪影,尤其是视频对构建中需通过语义知识图谱与谱聚类保证参考的保真度;最终的多维语义验证则要求精细的评估模板以过滤不一致样本,确保数据集整体可靠性。
常用场景
经典使用场景
VicEdit-400K作为首个面向视觉上下文视频编辑的大规模数据集,其经典使用场景聚焦于多模态视觉引导的视频编辑任务。该数据集涵盖了单图像、图像对和视频对三种参考模态,以及全局风格迁移、局部对象操作和时空合成等十种细粒度编辑任务,为训练和评估统一的视频编辑模型提供了系统化的数据基础。研究者可借助该数据集深入探索如何利用视觉示例而非单纯文本指令来精确传达编辑意图,从而突破传统文本驱动编辑在纹理细节、空间变换和时序动态表达上的局限性,推动视频编辑从描述性指令向示范性引导的范式转变。
实际应用
在实际应用层面,VicEdit-400K所支撑的技术可广泛服务于影视后期制作、短视频内容创作及广告特效合成等场景。例如,创作者能够借助单张参考图片快速实现风格迁移,利用图像对直观指定空间变换,或通过视频对传授复杂的运动模式,使得编辑过程更加直观高效。此外,该数据集还可用于开发智能视频编辑助手,帮助非专业用户通过简单的视觉示例完成高质量的内容修改,如去除特定物体、添加元素或延展场景边界,从而大幅降低专业编辑的门槛,提升内容生产的效率与创意空间。
衍生相关工作
基于VicEdit-400K,研究者衍生出一系列开创性工作,其中最具代表性的是VicEdit框架本身,其引入了模态自适应语义蒸馏(MASD)与双上下文注入(DCI)机制,为异构视觉参考的统一处理树立了标杆。此外,该数据集激发了关于视频上下文学习(ICL)的深入探索,如将视觉示例作为条件信号融入扩散Transformer,以及设计更为精细的语义对齐损失。这些衍生工作不仅巩固了视觉示例在视频编辑中的核心地位,还推动了多模态生成模型在理解复杂视觉指令方面的能力跃升,为后续研究提供了丰富的理论支撑和实践范本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务