CoinVE-200K
收藏资源简介:
CoinVE-200K是一个由腾讯创建的大规模、高质量组合指令引导视频编辑数据集,旨在解决现有数据集仅支持单操作编辑、无法应对多意图组合编辑的局限。该数据集包含200,000个1080p分辨率的视频-编辑对,每个样本涵盖2至5个原子编辑操作,帧数最高达201帧,编辑类型包括添加、移除、修改和风格化,目标覆盖人物、物体和背景等多种主体。数据集通过精心设计的数据生成与质量过滤流水线构建,经由多阶段评估确保指令忠实度、视觉质量、时序一致性和组合多样性。该数据集主要用于训练和评估组合指令视频编辑模型,推动多意图理解、区域感知编辑和复杂操作交互等前沿研究。
CoinVE-200K is a large-scale, high-quality compositional instruction-guided video editing dataset developed by Tencent, which aims to address the limitation of existing datasets that only support single-operation editing and cannot handle multi-intent compositional editing. This dataset contains 200,000 1080p video-editing pairs, where each sample covers 2 to 5 atomic editing operations with a maximum of 201 frames per video. The editing types include addition, removal, modification and stylization, and the targets cover a variety of subjects such as people, objects and backgrounds. The dataset is constructed via a well-designed data generation and quality filtering pipeline, and ensures instruction fidelity, visual quality, temporal consistency and compositional diversity through multi-stage evaluation. It is mainly used for training and evaluating compositional instruction-guided video editing models, and promotes cutting-edge research directions including multi-intent understanding, region-aware editing and complex operation interaction.
CoinVE-200K 数据集详情
数据集简介
CoinVE-200K 是一个大规模、高质量的组合式指令引导视频编辑(Compositional Instruction-Guided Video Editing)数据集,由腾讯在线视频事业部智能创作平台部门构建。该数据集旨在解决现有开源数据集(如 ReCo-Data、OpenVE-3M)仅支持单一指令编辑的局限性,每个样本包含多条编辑指令,可同时应用于同一个源视频,并附带逐指令的区域掩码和组合掩码,以标注所有编辑区域。
核心特点
- 组合式指令:每个样本包含 2~5 条指令,涵盖不同的编辑操作(替换、添加、移除、背景更换等),作用于不同区域(主体、物体、背景)。
- 区域感知掩码:逐指令掩码标明每个编辑的空间区域,组合掩码汇总所有编辑区域以进行整体监督。
- 大规模高质量:包含 200K+ 视频编辑对,约 118 万个视频文件,总大小约 2.8 TB,数据来源多样。
- 丰富标注:每个样本包含结构化字段——指令文本、操作类型、对象类型及对应的掩码视频路径。
数据集统计
| 指标 | 数值 |
|---|---|
| 视频来源 | OpenVid-1M 的子集(即 OpenVidHD) |
| 总编辑样本数 | 200,916 |
| 总视频文件数 | 约 118 万 |
| 总大小 | 约 2.8 TB |
| 视频分辨率 | 1080P |
| 最大编辑帧数 | 201 |
| 每样本指令数 | 2~5 条(平均 2.55 条) |
文件分布
| 类型 | 目录 | 分片数 | 文件数 | 大小 |
|---|---|---|---|---|
| 源视频 | src_videos/ |
74 | 194,450 | 约 1.56 TB |
| 编辑后视频 | tgt_videos/ |
41 | 200,916 | 约 873 GB |
| 组合掩码 | combined_masks/ |
8 | 223,773 | 约 158 GB |
| 指令掩码 | instruction_masks/ |
10 | 558,717 | 约 189 GB |
数据集结构
CoinVE-200K/ ├── src_videos/ # 源视频 ├── tgt_videos/ # 编辑后视频 ├── combined_masks/ # 组合掩码 ├── instruction_masks/ # 指令掩码 └── metadata_coinve200k.jsonl # 元数据文件
每个 tar 归档包含相对路径的视频文件。metadata_coinve200k.jsonl 每行是一个 JSON 对象,包含以下字段:
source_video_path:源视频路径edited_video_path:编辑后视频路径instruction:编辑指令列表instruction_operation:操作类型列表(如 Replace、Add)instruction_object:对象类型列表(如 subject、object、background)instruction_mask_video_paths:逐指令掩码视频路径列表combined_mask_video_path:组合掩码视频路径
使用方式
- 完整下载:通过
hf download FireCRT/CoinVE-200K --repo-type dataset --local-dir ./CoinVE-200K命令下载全部文件。 - 部分下载:可仅下载元数据文件或特定分片以节省带宽。
- 数据加载:使用 Python 读取
metadata_coinve200k.jsonl文件加载元数据,并解压所需的 tar 分片文件。
引用信息
如需引用该数据集,可参考其 arXiv 论文(arXiv:2608.17566)。如有问题或合作意向,可联系 longfc.ustc@gmail.com。




