CoinVE-200K
收藏官方服务:
资源简介:
大规模、高质量的组合指令引导视频编辑数据集,包含200K+样本,约2.8TB,每个样本包含多个指令和对应的区域掩码。
A large-scale, high-quality combined instruction-guided video editing dataset consisting of over 200K samples with a total size of approximately 2.8 TB. Each sample contains multiple instructions and their corresponding regional masks.
创建时间:
2026-08-17
原始信息汇总
CoinVE-200K 数据集概述
基本信息
- 数据集名称:CoinVE-200K
- 全称:A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing
- 发布机构:腾讯在线视频事业部智能创作平台部门
- 发布时间:2026年8月18日
- 论文地址:https://arxiv.org/abs/2608.17566
- 项目主页:https://coinve200k.github.io/
数据集简介
CoinVE-200K 是一个面向组合式指令引导视频编辑的大规模高质量数据集。与现有开源数据集(如 ReCo-Data、OpenVE-3M)仅支持单指令编辑不同,该数据集的每个样本包含2至5条同时应用于同一源视频的编辑指令,并配备每条指令对应的区域掩码以及综合掩码。
核心特点
- 组合式指令:每个样本包含 2~5 条指令,覆盖不同的编辑操作(替换、添加、删除、背景更换等)作用于不同区域(主体、对象、背景)。
- 区域感知掩码:每条指令有独立的掩码视频指示编辑区域,同时提供综合掩码覆盖所有编辑区域。
- 大规模高质量:包含 20万+ 个视频编辑样本,约 118 万个视频文件,总大小约 2.8 TB,来源于多样化的开源视频集合。
- 丰富标注:每个样本包含结构化字段——指令文本、操作类型、对象类型及对应的掩码视频路径。
数据集统计
| 指标 | 数值 |
|---|---|
| 视频来源 | OpenVid-1M 数据集中的 OpenVidHD 子集 |
| 总编辑样本数 | 200,916 |
| 总视频文件数 | 约118万 |
| 总大小 | 约2.8 TB |
| 视频分辨率 | 1080P |
| 最大编辑帧数 | 201 |
| 每条样本指令数 | 2~5条(平均2.55条) |
文件分布
| 类型 | 目录 | 分片数 | 文件数 | 大小 |
|---|---|---|---|---|
| 源视频 | src_videos/ |
74 | 194,450 | 约1.56 TB |
| 编辑后视频 | tgt_videos/ |
41 | 200,916 | 约873 GB |
| 综合掩码 | combined_masks/ |
8 | 223,773 | 约158 GB |
| 指令掩码 | instruction_masks/ |
10 | 558,717 | 约189 GB |
数据集结构
数据集以 tar 分片形式存储,目录结构如下:
CoinVE-200K/ ├── src_videos/ ├── tgt_videos/ ├── combined_masks/ ├── instruction_masks/ └── metadata_coinve200k.jsonl
元数据文件 metadata_coinve200k.jsonl 每行包含一个编辑样本的 JSON 对象,字段包括:
source_video_path:源视频路径edited_video_path:编辑后视频路径instruction:指令列表instruction_operation:操作类型列表instruction_object:编辑对象类型列表instruction_mask_video_paths:各指令独立掩码视频路径列表combined_mask_video_path:综合掩码视频路径
下载方式
- 完整下载(来自 HuggingFace):https://huggingface.co/datasets/FireCRT/CoinVE-200K
- 支持部分下载,例如仅下载元数据或指定分片。
使用方法
- 提供 Python 代码示例用于加载元数据和提取 tar 分片。
- 提供现成的 PyTorch 数据集加载器
coinve_dataset.py,可同步加载源视频、编辑视频、各指令掩码及综合掩码,并支持帧数采样、空间缩放和对齐操作。
相关资源
- CoinVE-Edit 模型:基于 Wan2.1-T2V-14B 和 Qwen3-VL-8B,实现区域感知的组合式指令视频编辑,模型权重发布在 https://huggingface.co/FireCRT/CoinVE-Edit
- CoinVE-Bench 基准:提供 361 个多指令测试用例及 4 维度评估指标,详见 https://huggingface.co/datasets/FireCRT/CoinVE-Bench
联系方式
如有问题或合作意向,请联系:longfc.ustc@gmail.com
搜集汇总
数据集介绍

构建方式
指令引导视频编辑的迅猛发展催生了对复杂编辑数据集的迫切需求,然而现有公开数据集多局限于单一指令编辑,难以应对真实场景中用户同时发出多重编辑指令的挑战。CoinVE-200K应运而生,其构建依托于精心设计的数据处理管线,从OpenVidHD高清视频源中筛选出超过20万个样本,涵盖2至5条组合指令,每条指令均配有精确的区域掩码及汇总掩码。通过严格的质量过滤与多样性控制,确保指令组合、编辑类型及视频内容的丰富性,最终形成规模约2.8TB的高质量视频编辑数据集。
特点
CoinVE-200K的核心特色在于其组合式指令设计,每个样本同时包含多类编辑操作,如替换、添加、移除及背景更改等,精细作用于不同主体、物体及背景区域。每条指令均配备独立的空间掩码,汇总掩码则提供全局编辑监督,实现细粒度的区域感知。此外,数据集规模庞大,包含超过一百万个视频文件,分辨率高达1080P,并附有结构化的丰富标注,涵盖指令文本、操作类型及对象类别,为训练高鲁棒性的视频编辑模型提供了坚实的数据基础。
使用方法
使用者可通过HuggingFace平台便捷下载完整数据集或按需获取部分分片,元数据以JSONL格式存储,便于解析。数据集以tar压缩包形式分发,解压后即可与提供的PyTorch数据加载器无缝对接,该加载器能自动同步源视频、编辑后视频、各指令掩码及汇总掩码的帧序列,并支持帧采样与空间尺寸调整。用户可轻松将其集成至现有训练或评估流程,借助DataLoader实现批量处理,高效推进区域感知的组合式视频编辑研究。
背景与挑战
背景概述
随着扩散模型与视频生成技术的迅猛发展,指令引导的视频编辑(instruction-guided video editing)已成为多媒体内容创作与智能视频处理领域的研究热点。然而,现有公开数据集(如ReCo-Data、OpenVE-3M)大多聚焦于单一指令编辑,即对源视频仅施加一种编辑操作(如替换、添加、移除或风格化),难以满足真实场景中用户对同一视频同时提出多重编辑指令的复杂需求。为弥合这一空白,腾讯在线视频事业部智能创作平台部门的研究团队(Fuchen Long、Cong Wang、Zitao Gao等)于2026年构建并发布了大规模高质量组合式指令视频编辑数据集CoinVE-200K。该数据集包含超过20万个编辑样本,每个样本均包含2至5条针对不同区域(主体、对象、背景)的组合式编辑指令,并配套提供了每条指令对应的区域掩码及合并掩码,为组合式视频编辑模型的训练与评估提供了坚实基础。CoinVE-200K的发布不仅推动了视频编辑领域从单一指令向组合指令的范式演进,也为多模态理解与生成任务的交叉研究提供了宝贵的数据资源。
当前挑战
CoinVE-200K的构建与发布面临多重挑战。在领域问题层面,所解决的组合式指令视频编辑(compositional instruction-guided video editing)任务要求模型能够同时理解并执行多条编辑指令,且需精确定位每个指令对应的编辑区域,这在时空维度上远复杂于传统的单指令编辑,对模型的指令解析、区域感知与视频生成能力提出了极高要求。在数据集构建过程中,挑战尤为显著:首先,数据来源于OpenVid-1M的OpenVidHD子集,需从海量视频中筛选出适合多指令编辑的高质量片段,并进行严格的语义一致性过滤;其次,每条样本需人工或半自动生成2至5条多样化、互不冲突的编辑指令,同时为每条指令生成精确的时空掩码,以及合并掩码,这要求精细的标注流程与严格的质量控制;再者,数据集规模庞大(200K+样本,约2.8TB,包含约118万个视频文件),存储、传输与加载均需高效的分布式处理方案;最后,为保障指令组合的多样性与编辑类型的覆盖度,需设计合理的采样策略,避免数据偏差,确保模型泛化能力。这些挑战共同构成了构建该数据集的艰巨性与创新性。
常用场景
经典使用场景
CoinVE-200K作为大规模组合式指令引导视频编辑数据集,其核心应用场景在于训练和评估支持多指令并行编辑的视频编辑模型。该数据集包含超过20万条样本,每条样本均附带2至5条编辑指令、逐指令的区域掩码以及全局组合掩码,为模型提供细粒度的空间与语义监督。研究者可借此构建能够同时执行替换、添加、删除、背景变换等多种操作的视频编辑系统,从而满足复杂现实场景中对多目标协同编辑的需求。
解决学术问题
该数据集解决了现有开源视频编辑数据集仅支持单指令编辑的局限,为组合式指令引导视频编辑研究提供了大规模、高质量的基准资源。通过提供丰富的指令组合、编辑类型和视频内容多样性,CoinVE-200K有效支撑了多指令协同编辑任务的模型训练与性能评估,推动了视频编辑领域从单一操作向复合操作演进,并为后续研究提供了标准化的评估平台。
衍生相关工作
基于CoinVE-200K,研究者已衍生出多项经典工作,包括区域感知的组合式视频编辑模型CoinVE-Edit,该模型结合Wan2.1-T2V-14B与Qwen3-VL-8B,实现多指令同步编辑;同时构建了CoinVE-Bench基准测试,涵盖361个多指令测试用例及四维评价指标,为组合式编辑任务提供系统评估工具。这些衍生工作进一步推动了视频编辑领域的实证研究,并为后续模型优化与性能比较奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成



