VicEdit-400K
收藏资源简介:
VicEdit-400K是首个面向视觉上下文视频编辑的大规模数据集,由上海交通大学、腾讯优图实验室及浙江大学联合构建。该数据集包含约40万条高质量样本,覆盖单张图像、图像对和视频对三种参考模态,以及十种精细编辑任务,视频长度主要集中于30至120帧区间。通过自动化流水线完成数据构建,涵盖源数据筛选、指令合成、视觉参考生成和语义验证四个阶段,确保了高视觉保真度与语义一致性。该数据集旨在弥补文本指令在细粒度纹理、空间变换及动态运动描述上的不足,为可控视频编辑提供多模态视觉引导的坚实基础。
VicEdit-400K is the first large-scale dataset for visual-context-aware video editing, jointly constructed by Shanghai Jiao Tong University, Tencent YouTu Lab, and Zhejiang University. This dataset contains approximately 400,000 high-quality samples, covering three reference modalities: single image, image pair, and video pair, as well as ten fine-grained editing tasks, with video lengths mainly ranging from 30 to 120 frames. The dataset is built via an automated pipeline that includes four stages: source data filtering, instruction synthesis, visual reference generation, and semantic verification, ensuring high visual fidelity and semantic consistency. This dataset aims to address the shortcomings of text instructions in describing fine-grained textures, spatial transformations, and dynamic motions, providing a solid foundation for multi-modal visual-guided controllable video editing.
VicEdit: 基于视觉上下文示例的视频编辑
项目概述
VicEdit 提出了一种视觉上下文编辑(Visual In-context Editing) 新范式,将视频编辑从纯文本指令扩展到多模态视觉指导,涵盖单张图像、图像对和视频对三种参考模态。该项目包含数据集、模型框架和评测基准三大部分。
关键贡献
- 视觉上下文编辑范式:将视频编辑从仅文本指令扩展到多模态指导(单张图像、图像对、视频对),解决语言在传达纹理、空间布局和时间动态方面的表达瓶颈。
- VicEdit-400K 数据集:首个大规模视觉上下文视频编辑数据集,包含 40 万个高质量样本,覆盖三种参考模态和十种任务类型,通过自动化流水线和多维质量过滤构建。
- VicEdit 框架:统一框架,包含模态自适应语义蒸馏(MASD) 用于提取特定模态语义令牌,以及双上下文注入(DCI) 用于将视觉和文本上下文协同融合到视频 DiT 中。
数据集详情(VicEdit-400K)
- 规模:400K 高质量样本
- 参考模态:单张图像、图像对、视频对
- 任务类型:10 种
- 构建流程:四阶段流水线(源数据过滤、指令合成、视觉参考生成、质量验证)
- 统计信息:提供主题分析、提示词长度分布、帧分布、编辑任务分布和提示词词云
视觉参考类型与解决的问题
| 参考类型 | 解决的问题 |
|---|---|
| 单张图像 | 解决文本基线方法中的风格漂移问题,精确锚定目标纹理,实现连贯风格迁移 |
| 图像对 | 解决文本指令只说明"改什么"而不说明"改哪里"的问题,直观定义空间锚点 |
| 视频对 | 解决复杂运动动态无法用文本描述的问题,提供时间运动线索实现动态编辑 |
评测基准(VicEdit-Bench)
- 覆盖三种参考模态和多种任务类型
- 在视觉上下文编辑和基础指令编辑任务上均取得最先进性能(SOTA)
- 定量结果显示在视觉上下文编辑任务上显著优于所有基线方法
支持的任务类别
包括背景更换、局部替换、创意编辑、字幕编辑、局部修复(inpainting)、局部外扩(outpainting)、全局风格迁移、局部风格迁移、局部移除、局部添加等十种任务。
对比方法
与以下现有方法进行对比:VideoCoF、NovaEdit、Lucy-Edit、Kiwi-Edit。




