遇见数据集

CoinVE-200K

收藏
arXiv2026-08-25 更新2026-08-27 收录
官方服务:

资源简介:

CoinVE-200K是一个由腾讯创建的大规模、高质量组合指令引导视频编辑数据集,旨在解决现有数据集仅支持单操作编辑、无法应对多意图组合编辑的局限。该数据集包含200,000个1080p分辨率的视频-编辑对,每个样本涵盖2至5个原子编辑操作,帧数最高达201帧,编辑类型包括添加、移除、修改和风格化,目标覆盖人物、物体和背景等多种主体。数据集通过精心设计的数据生成与质量过滤流水线构建,经由多阶段评估确保指令忠实度、视觉质量、时序一致性和组合多样性。该数据集主要用于训练和评估组合指令视频编辑模型,推动多意图理解、区域感知编辑和复杂操作交互等前沿研究。

CoinVE-200K is a large-scale, high-quality compositional instruction-guided video editing dataset developed by Tencent, which aims to address the limitation of existing datasets that only support single-operation editing and cannot handle multi-intent compositional editing. This dataset contains 200,000 1080p video-editing pairs, where each sample covers 2 to 5 atomic editing operations with a maximum of 201 frames per video. The editing types include addition, removal, modification and stylization, and the targets cover a variety of subjects such as people, objects and backgrounds. The dataset is constructed via a well-designed data generation and quality filtering pipeline, and ensures instruction fidelity, visual quality, temporal consistency and compositional diversity through multi-stage evaluation. It is mainly used for training and evaluating compositional instruction-guided video editing models, and promotes cutting-edge research directions including multi-intent understanding, region-aware editing and complex operation interaction.

提供机构:
腾讯
创建时间:
2026-08-18
原始信息汇总

CoinVE-200K 数据集详情

数据集简介

CoinVE-200K 是一个大规模、高质量的组合式指令引导视频编辑(Compositional Instruction-Guided Video Editing)数据集,由腾讯在线视频事业部智能创作平台部门构建。该数据集旨在解决现有开源数据集(如 ReCo-Data、OpenVE-3M)仅支持单一指令编辑的局限性,每个样本包含多条编辑指令,可同时应用于同一个源视频,并附带逐指令的区域掩码组合掩码,以标注所有编辑区域。

核心特点

  • 组合式指令:每个样本包含 2~5 条指令,涵盖不同的编辑操作(替换、添加、移除、背景更换等),作用于不同区域(主体、物体、背景)。
  • 区域感知掩码:逐指令掩码标明每个编辑的空间区域,组合掩码汇总所有编辑区域以进行整体监督。
  • 大规模高质量:包含 200K+ 视频编辑对,约 118 万个视频文件,总大小约 2.8 TB,数据来源多样。
  • 丰富标注:每个样本包含结构化字段——指令文本、操作类型、对象类型及对应的掩码视频路径。

数据集统计

指标 数值
视频来源 OpenVid-1M 的子集(即 OpenVidHD)
总编辑样本数 200,916
总视频文件数 约 118 万
总大小 约 2.8 TB
视频分辨率 1080P
最大编辑帧数 201
每样本指令数 2~5 条(平均 2.55 条)

文件分布

类型 目录 分片数 文件数 大小
源视频 src_videos/ 74 194,450 约 1.56 TB
编辑后视频 tgt_videos/ 41 200,916 约 873 GB
组合掩码 combined_masks/ 8 223,773 约 158 GB
指令掩码 instruction_masks/ 10 558,717 约 189 GB

数据集结构

CoinVE-200K/ ├── src_videos/ # 源视频 ├── tgt_videos/ # 编辑后视频 ├── combined_masks/ # 组合掩码 ├── instruction_masks/ # 指令掩码 └── metadata_coinve200k.jsonl # 元数据文件

每个 tar 归档包含相对路径的视频文件。metadata_coinve200k.jsonl 每行是一个 JSON 对象,包含以下字段:

  • source_video_path:源视频路径
  • edited_video_path:编辑后视频路径
  • instruction:编辑指令列表
  • instruction_operation:操作类型列表(如 Replace、Add)
  • instruction_object:对象类型列表(如 subject、object、background)
  • instruction_mask_video_paths:逐指令掩码视频路径列表
  • combined_mask_video_path:组合掩码视频路径

使用方式

  • 完整下载:通过 hf download FireCRT/CoinVE-200K --repo-type dataset --local-dir ./CoinVE-200K 命令下载全部文件。
  • 部分下载:可仅下载元数据文件或特定分片以节省带宽。
  • 数据加载:使用 Python 读取 metadata_coinve200k.jsonl 文件加载元数据,并解压所需的 tar 分片文件。

引用信息

如需引用该数据集,可参考其 arXiv 论文(arXiv:2608.17566)。如有问题或合作意向,可联系 longfc.ustc@gmail.com。

搜集汇总
数据集介绍
CoinVE-200K 数据集图片
构建方式
CoinVE-200K的构建始于从OpenVid-HD中筛选高质量源视频,要求至少81帧且短边不低于1080像素,并借助美学评分与光流技术剔除低质样本,最终保留42万条视频。随后,利用Qwen3.6-27B对视频进行结构化解析,提取主体、物体与背景三类可编辑要素,基于此生成涵盖添加、移除、修改与风格化等操作的原子指令,并通过组合2至5个原子操作构成复合编辑指令。合成阶段采用掩码引导策略,首先利用SAM3定位关键帧中的目标区域,再通过SAM2将掩码传播至全视频,继而使用HunyuanImage-3.0等图像编辑模型处理关键帧,最终由微调后的Wan2.2-Animate-14B或VACE生成编辑后视频。所有候选样本经Gemini 2.5 Pro进行多维度质量过滤,仅保留指令执行准确、语义与时间一致且物理合理的样本,最终形成含20万对视频编辑样本的CoinVE-200K数据集。
特点
CoinVE-200K以其独特的组合性指令视频编辑能力脱颖而出,显著区别于现有数据集。其视频样本均以1080p分辨率呈现,时长跨度从81至201帧,涵盖丰富的时空维度。每个样本内嵌2至5条原子编辑指令,平均2.55条,促使模型学习多意图的联合解析与协调执行。数据集在编辑类型上呈现均衡分布,涵盖局部添加(24.1%)、背景替换(23.8%)、物体替换(22.8%)、局部移除(18.5%)及风格化编辑,极大增强了编辑操作的多样性。更为关键的是,其编辑指令均以高度结构化的方式生成,确保每条指令与视频内容精确关联,加之严格的多阶段质量过滤流程,使得最终数据具有较高的编辑保真度与时间一致性,其平均编辑质量评分达到4.85,为训练复合编辑模型提供了坚实可靠的数据基础。
使用方法
CoinVE-200K专为组合指令视频编辑任务设计,可用于训练与评估多指令协同编辑的生成模型。研究者和开发者可将其作为微调数据,增强视频编辑模型对复杂指令的解析能力,尤其在涉及多目标区域同时编辑的场景下。使用时,需将样本中的源视频与复合指令对作为输入,模型需学习解构指令,关联至对应时空区域,并输出符合所有编辑意图且保持背景连贯性的编辑后视频。此外,CoinVE-200K还配套了CoinVE-Bench基准,提供统一的评估协议,涵盖编辑准确性、物理自然度、内容保持及视频质量等多个维度,便于公平比较不同模型的性能。该数据集也可用于增强现有模型在区域感知编辑和防止指令干扰方面的鲁棒性,推动视频编辑领域向更复杂、更实际的应用场景迈进。
背景与挑战
背景概述
CoinVE-200K数据集由腾讯在线视频事业部智能创作平台团队于2026年8月构建,旨在解决组合式指令引导视频编辑这一新兴研究问题。该数据集包含20万对1080p分辨率、最多201帧的视频编辑样本,每个样本涵盖2至5种原子编辑操作,涉及人类、物体和背景等多重目标主体,以及添加、移除、修改和风格化等编辑类型。其构建采用了基于分类法的指令生成、掩码引导的视频合成及多阶段质量过滤流程,确保了指令忠实度、视觉质量、时间一致性和组合多样性。CoinVE-200K的发布为组合式视频编辑提供了大规模高质量训练数据,推动了该领域从单一操作编辑向多意图复杂编辑的范式转变,并伴随专用基准CoinVE-Bench和模型CoinVE-Edit,对后续研究具有重要影响力。
当前挑战
CoinVE-200K的构建面临多重挑战。在领域问题层面,组合式指令引导视频编辑要求模型联合理解多个编辑意图,并精准执行于同一视频中的不同时空区域,这远超单一操作编辑的难度,易出现指令干扰、非目标区域误改和时间不一致等问题,而现有数据集大多仅支持单一编辑操作,缺乏多意图组合的标注和构造策略。在数据构建层面,需从海量来源视频中筛选高质量片段,利用多模态大模型解析可编辑主体并生成语义丰富的组合指令,同时通过掩码传播和图像编辑模型合成编辑视频,而合成结果常存在指令执行不完整、时间闪烁或物理不合理等缺陷,需设计严格的多阶段质量过滤策略,确保每个原子操作都被正确执行且整体编辑效果保持一致。
常用场景
经典使用场景
CoinVE-200K作为首个大规模组合式指令引导视频编辑数据集,其经典使用场景聚焦于多意图、多目标区域的视频编辑任务。该数据集包含200K对1080p视频编辑样本,每对样本涉及2至5个原子编辑操作,覆盖人体、物体与背景等多种目标主体,以及添加、移除、修改与风格化等编辑类型。研究者可利用该数据集训练模型实现组合指令的联合理解、空间-时间区域的精准定位以及多操作的协调执行,从而在单一视频中忠实完成复杂编辑请求,例如同时替换人物服装、移除前景物体并风格化背景。
解决学术问题
CoinVE-200K解决了现有指令引导视频编辑数据集仅支持单一编辑操作、难以应对组合指令的学术难题。该数据集通过精心设计的生成与质量过滤流程,确保了指令忠实度、视觉质量、时间一致性与组合多样性,为模型学习多意图推理、区域感知编辑及复杂操作交互提供了高质量监督。其引入的CoinVE-Bench基准进一步建立了统一评估协议,从编辑准确性、物理自然度、语义保持和视频质量等多个维度衡量组合编辑能力,推动了该方向研究从单操作向多操作组合的范式转变,为后续工作奠定了数据与评估基础。
衍生相关工作
围绕CoinVE-200K,研究社区已衍生出多项相关工作。首先是CoinVE-Edit,一个22B参数的组合式视频编辑模型,通过解耦区域感知注意力机制实现多指令的精准执行。此外,CoinVE-Bench作为专用基准,启发了后续研究对组合编辑能力的系统评估。该数据集还促进了区域约束生成(如ReCo)与复杂指令分解方法的发展,并为多模态大模型在视频编辑中的应用提供了训练资源。这些衍生工作共同推动了从图像编辑向视频组合编辑的技术迁移,并为更复杂的编辑场景(如参考编辑、运动编辑)奠定了研究基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务