遇见数据集

CoinVE-Bench

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

CoinVE-Bench 是一个专门用于组合(多指令)视频编辑评估的基准数据集。它包含 361 个测试样本,每个样本包含 2 到 5 条编辑指令,并配有 4,131 个检查表问题,用于细粒度评估。数据集支持三种评估维度:编辑准确性(包括语义准确性、范围准确性和编辑持久性)、物理自然性(包括外观自然性、尺度一致性和运动自然性)以及语义保留(内容保留)。每个维度下的指标均通过基于视觉语言模型(如 Gemini)的检查表协议自动评分,评分范围 0-100。数据集结构包括源视频文件夹(src_videos)和检查表 JSON 文件(checklist_json/coinve-bench-361-checklist.json),源视频按 YouTube ID 和片段索引命名。评估流程分为两步:首先使用编辑模型在 361 个源视频上生成编辑后的视频,然后使用 Gemini 评估器进行评分并输出报告。该数据集适用于指令引导的视频编辑模型评估和比较。

CoinVE-Bench is a benchmark dataset specifically designed for compositional (multi-instruction) video editing evaluation. It contains 361 test samples, each with 2 to 5 editing instructions, and is accompanied by 4,131 checklist questions for fine-grained evaluation. The dataset supports three evaluation dimensions: editing accuracy (including semantic accuracy, scope accuracy, and editing persistence), physical naturalness (including appearance naturalness, scale consistency, and motion naturalness), and semantic preservation (content preservation). Metrics under each dimension are automatically scored via a checklist protocol based on a vision-language model (e.g., Gemini), with scores ranging from 0-100. The dataset structure includes a source video folder (src_videos) and a checklist JSON file (checklist_json/coinve-bench-361-checklist.json). The evaluation process consists of two steps: first, generate edited videos on 361 source videos using an editing model, then use the Gemini evaluator to score and output a report. This dataset is suitable for evaluating and comparing instruction-guided video editing models.

创建时间:
2026-08-13
原始信息汇总

CoinVE-Bench 数据集详情

数据集概览

CoinVE-Bench 是一个专门用于组合式(多指令)视频编辑评估的基准数据集,包含 361 个测试样本,每个样本包含 2–5 条编辑指令。该数据集采用区域感知的评估方法,通过每条指令对应的掩码来精细检查每个编辑操作是否被正确地限制在目标区域内。

基础信息

属性 内容
许可证 CC BY-SA 4.0
任务类别 视频到视频(video-to-video)
语言 英语
标签 视频编辑、组合式编辑、指令引导、基准测试、VLLM 评估
数据规模 少于 1K 样本

数据集统计

指标 数值
总测试样本数 361
每个样本的指令数 2–5 条
检查清单问题数 4,131
评估维度 3 个(编辑准确性 / 物理自然性 / 语义保持)

评估指标

所有指标由 Gemini 3.6 Flash(默认,可通过 --model 参数配置)基于检查清单的 VLLM 协议进行评分。

评分维度与指标

维度 指标(缩写) 范围 问题数 描述
编辑准确性(每条指令) 语义准确性(SA) [0, 100] 1,081 预期编辑语义的正确执行
范围准确性(SPA) [0, 100] 379 编辑定位准确,无泄漏或干扰
编辑持续性(EP) [0, 100] 923 编辑在整个视频中的时间一致性
物理自然性 外观自然性(AN) [0, 100] 356 光照、阴影、纹理和风格的自然融合
尺度一致性(SC) [0, 100] 521 编辑对象尺度和透视的合理性
运动自然性(MN) [0, 100] 447 运动和物理交互的合理性
语义保持 内容保持(CP) [0, 100] 424 非编辑区域、对象和结构的保持

评分公式

  • ACC 类指标(SA / SPA / EP / AN / SC / MN):score = num_correct / num_questions × 100
  • Score 类指标(CP):score = mean(score) × 10(每个问题评分为 0–10,然后缩放至 [0, 100])
  • 维度分数 = 其各指标 score_100 值的算术平均值

问题类型

类型 问题数 上传视频 答案格式
单一真/假(Single-TF) 2,524 仅编辑视频 是 / 否
A/B 选择题(AB-MCQ) 609 仅编辑视频 A / B / A 和 B
双重真/假(Dual-TF) 574 源视频 + 编辑视频 是 / 否
评分选择题(Score-MCQ) 424 源视频 + 编辑视频 0–10 评分

数据集结构

text CoinVE-Bench/ ├── src_videos/ │ ├── 9CicJDFN1TA_9_0to183.mp4 │ ├── gWG0LiuZnFQ_8_0to137.mp4 │ ├── JwVDrRmyoXc_51_0to172.mp4 │ └── ... └── checklist_json/ └── coinve-bench-361-checklist.json

源视频命名为 <youtube_id>_<clip_index>_<start>to<end>.mp4,通过检查清单中每个案例的 src_video 字段引用。

评估流程

评估是一个两阶段流程:(1)在 361 个源视频上运行编辑模型以生成编辑视频;(2)使用基于 Gemini 的评估器进行评分。

编辑视频准备要求

  • 格式:MP4(.mp4
  • 命名<case_id>.mp4(case_id 为整数 id 字段,范围 0–360,无零填充
  • 源视频配对:视频 A(原始视频)从检查清单中的 case["src_video"] 读取,无需放置在编辑视频目录中
  • 缺失视频:若某案例的编辑视频缺失,其所有问题将记录为 model_answer = null,并在最终分数中计为失败

运行 Gemini 评估

bash export GEMINI_API_KEY=your_key_here python eval_coinbench_gemini_public.py --input ./checklist_json/coinve-bench-361-checklist.json --gen-video-dir ./edited_videos/your_model --prompt-dir ./system_prompts --out-dir ./results/your_model --workers 8 --model gemini-3.6-flash --timestamp

该脚本端到端完成所有步骤——Gemini 调用、逐问题评分、维度/指标聚合和报告生成,无需单独的聚合步骤。

性能对比(部分模型)

模型 SA SPA EP AN SC MN CP
Seedance 2.0 85.34 87.71 88.08 93.19 95.84 92.87 93.91
Kling O3 86.91 80.93 89.06 92.55 90.30 93.91 84.51
VACE 3.98 17.15 6.50 26.69 13.82 15.21 87.83
Ditto 34.69 36.41 40.85 35.96 47.79 38.48 51.98
VINO 83.63 66.75 89.06 78.09 82.34 85.91 61.70
OmniWeaving 59.67 55.94 61.11 54.49 66.03 65.10 75.09
KiWiEdit 76.50 69.92 80.28 78.37 78.50 80.76 70.31
SAMA 75.58 73.35 79.63 83.43 83.88 88.14 90.08
CoinVE-Edit 87.97 89.45 89.60 91.85 91.17 95.30 90.83

引用与致谢

  • 引用:如需引用请参考论文 arXiv:2608.17566(CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing)
  • 联系:longfc.ustc@gmail.com
  • 致谢:受 ReCo-BenchOpenVE-BenchCoVEBench 的启发
搜集汇总
数据集介绍
CoinVE-Bench 数据集图片
构建方式
CoinVE-Bench是一个专为组合式(多指令)视频编辑评估而设计的基准数据集,源自大规模组合指令视频编辑数据集CoinVE-200K。该基准精心构建了361个测试样本,每个样本蕴含2至5条编辑指令,覆盖了从单一属性修改到复杂场景重组的广泛编辑需求。为确保评估的粒度与精确性,数据集为每条指令提供了区域感知掩码,能够细致检验每次编辑是否精准定位至目标区域,有效杜绝编辑泄漏或干扰。此外,为全面衡量编辑性能,CoinVE-Bench设计了三维度评估体系,涵盖编辑准确性、物理自然度与语义保持性,并通过生成4,131个清单问题,结合视觉语言模型(默认Gemini 3.6 Flash)进行自动化评分,从而实现对视频编辑模型性能的深度量化剖析。
特点
CoinVE-Bench的显著特点在于其组合式编辑评估范式与多维度的细致度量。相较于现有基准,它不仅关注单次编辑的质量,更强调多指令并发执行时的综合表现,通过每条指令独立掩码实现区域感知的精准评判。评估指标囊括语义准确性、范围准确性、编辑持久性,以及外观自然度、尺度一致性、运动自然度等物理层面,配合内容保持指标,力求从宏观到微观全面捕捉编辑效果。其基于清单的VLLM评估协议,将复杂视觉判断分解为具体问题,并采用多样化的回答格式(如判断题、选择题、评分题),大幅提升了评分的客观性与对齐人类感知的能力。此外,性能对比结果揭示了不同编辑模型的优劣,为领域研究提供了极具价值的参照基准。
使用方法
使用CoinVE-Bench开展评估遵循清晰的两阶段流程。首先,研究者需利用自身编辑模型对基准提供的361个源视频进行推理,生成对应的编辑后视频,并按照严格命名规范(以案例ID命名,如0.mp4至360.mp4)将结果存放于独立目录。随后,调用基于Gemini的评估脚本,通过设置API密钥并运行命令行工具,即可自动完成从加载清单、配对源视频与编辑视频,到逐问题评分、聚合指标与输出报告的端到端评估。该脚本支持并发处理与模型参数配置,使用便捷。为确保兼容性,CoinVE-Edit用户的推理输出可直接作为评估输入。最终,系统生成各维度及子指标的量化得分,便于横向比较不同模型的编辑能力,从而推动视频编辑技术发展。
背景与挑战
背景概述
CoinVE-Bench诞生于视频编辑领域对组合式指令理解与执行能力评估的迫切需求。随着文本引导视频编辑技术的飞速发展,现有基准大多局限于单一编辑操作,难以全面衡量模型在复杂多指令场景下的真实性能。为此,由Fuchen Long等研究者于2026年提出,隶属于CoinVE-200K项目,旨在构建首个专门面向组合式视频编辑的评测基准。该基准包含361个精心设计的测试样本,每个样本蕴含2至5条编辑指令,并创新性地引入区域感知的评估机制,通过逐指令掩码确保编辑操作的精准定位。其影响力在于,为视频编辑领域提供了首个系统化、多维度的评测体系,推动了该方向从单一操作向复杂语义组合的范式转变。
当前挑战
CoinVE-Bench面临的核心挑战在于组合式编辑的复杂性及其评估的精细化。领域层面,视频编辑需同时满足语义准确性、物理自然度与语义保持性,而多指令间的相互作用常导致编辑冲突或内容泄漏,对模型的区域控制与时间一致性提出严苛要求。构建层面,如何设计覆盖2-5条指令的多样化测试案例、精确标注逐指令掩码及生成数千个针对性的评估问题,成为数据集构建的难点。此外,采用视觉语言模型(如Gemini)进行自动化评分,需确保评估协议与人类感知高度对齐,同时设计诸如真/假选择、多选及评分式等混合题型,以捕捉编辑质量的细微差异,这些均对基准的有效性和可靠性构成挑战。
常用场景
经典使用场景
CoinVE-Bench作为构成性视频编辑领域的基准测试集,核心应用场景在于对视频编辑模型的多指令组合编辑能力进行标准化评估。该基准精心设计了361个测试样本,每个样本包含2至5条编辑指令,并辅以区域感知掩膜与多维度评分体系,能够细致检验模型在语义准确性、局部范围控制、编辑持续性、物理自然度及语义保留等维度的表现。研究者可藉此基准统一评测不同编辑模型(如Seedance 2.0、Kling O3)的性能差异,推动模型在复杂指令组合下的鲁棒性提升。
实际应用
在实际应用中,CoinVE-Bench为视频编辑工具的研发与迭代提供了可靠的性能标尺。模型开发者可利用该基准在统一协议下快速验证不同算法(如CoinVE-Edit、SAMA等)的编辑效果,识别语义理解、区域定位或动态自然度等短板,从而优化模型架构与训练策略。此外,该基准的评估流程设计简洁,支持端到端执行,便于工业界集成至自动化测试管线,助力高效筛选适用于影视后期、广告制作或短视频等场景的高质量视频编辑模型。
衍生相关工作
CoinVE-Bench的构建理念与评估范式,已催生一系列衍生研究。其参考并深化了ReCo-Bench、OpenVE-Bench及CoVEBench等先导工作的设计精髓,为构成性视频编辑评估树立了新标杆。该基准所倡导的基于视觉语言模型的自动化评分协议,以及多粒度指标聚合方法,被后续研究广泛借鉴,用于其他生成任务(如图像编辑、音频-视觉同步)的评估体系构建。同时,其公开的测试集与评估代码,为社区提供了可复用的研究基础设施,促进了视频编辑领域标准化、可比较的学术生态的形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务