Ditto-1M
收藏资源简介:
Ditto-1M是一个包含一百万个高质量视频编辑三联体的综合数据集,旨在解决指令式视频编辑的基本挑战。该数据集通过将领先图像编辑器的创意多样性与创新上下文视频生成器结合,克服了现有模型的局限性。数据集包含多种视频编辑场景,包括全局风格转换、全局自由形态编辑和局部编辑。
Ditto-1M is a comprehensive dataset encompassing one million high-quality video editing triplets, designed to address the fundamental challenges of instruction-driven video editing. This dataset overcomes the limitations of existing models by integrating the creative diversity of state-of-the-art image editors with innovative contextual video generators. The dataset covers a diverse range of video editing scenarios, including global style transfer, global free-form editing, and local editing.
Ditto-1M数据集概述
基本信息
- 数据集名称: Ditto-1M
- 语言: 英语
- 许可证: CC-BY-NC-SA-4.0
- 规模: 大于1TB
- 任务类别: 视频到视频编辑
数据集简介
Ditto-1M是一个包含一百万高质量视频编辑三元组的综合数据集,专门为解决基于指令的视频编辑的基本挑战而设计。该数据集通过创新的数据生成流程创建,融合了领先图像编辑器的创意多样性和上下文视频生成器。
数据集特点
- 高质量合成数据: 通过自动化流程生成高质量、高度多样化的视频编辑数据
- 多样化编辑场景: 涵盖全局和局部编辑任务
- 大规模: 超过1,000,000个视频编辑三元组
编辑任务类型
- 全局风格迁移: 艺术风格变化、色彩分级和视觉效果
- 全局自由编辑: 复杂场景修改、环境变化和创意转换
- 局部编辑: 精确对象修改、属性变化和局部转换
数据集结构
Ditto-1M/ ├── mini_test_videos/ # 30+测试视频案例 ├── videos/ # 主视频数据 │ ├── source/ # 源视频(原始视频) │ ├── local/ # 局部编辑结果 │ ├── global_style1/ # 全局风格编辑 │ ├── global_style2/ # 全局风格编辑 │ ├── global_freeform1/ # 自由形式编辑 │ ├── global_freeform2/ # 自由形式编辑 │ └── global_freeform3/ # 自由形式编辑(相对困难) ├── source_video_captions/ # QwenVL生成的源视频描述 ├── training_metadata/ # 训练元数据 └── csvs_for_DiffSynth/ # DiffSynth-Studio训练用CSV文件
数据规模分布
- 源视频: ~180GB
- 全局风格: ~350GB(230GB + 120GB)
- 全局自由编辑: ~1070GB(370GB + 430GB + 270GB)
- 局部编辑: ~530GB
技术规格
- 视频分辨率: 1280×720 / 720×1280
- 视频长度: 每视频101帧
- 总样本数: 1,000,000+视频编辑三元组
元数据结构
每个元数据json文件包含三元组项目:
source_path: 源视频路径instruction: 编辑指令edited_path: 对应编辑后视频路径
质量控制
- 通过数据过滤流程处理
- 使用去噪增强器增强质量
- 指令由智能代理生成的描述和编辑指令
相关资源
- 论文: https://arxiv.org/abs/2510.15742
- 项目页面: https://ezioby.github.io/Ditto_page/
- 代码仓库: https://github.com/EzioBy/Ditto
- 模型权重: https://huggingface.co/QingyanBai/Ditto/tree/main




