CoinVE-Bench
收藏资源简介:
CoinVE-Bench 是一个专门用于组合(多指令)视频编辑评估的基准数据集。它包含 361 个测试样本,每个样本包含 2 到 5 条编辑指令,并配有 4,131 个检查表问题,用于细粒度评估。数据集支持三种评估维度:编辑准确性(包括语义准确性、范围准确性和编辑持久性)、物理自然性(包括外观自然性、尺度一致性和运动自然性)以及语义保留(内容保留)。每个维度下的指标均通过基于视觉语言模型(如 Gemini)的检查表协议自动评分,评分范围 0-100。数据集结构包括源视频文件夹(src_videos)和检查表 JSON 文件(checklist_json/coinve-bench-361-checklist.json),源视频按 YouTube ID 和片段索引命名。评估流程分为两步:首先使用编辑模型在 361 个源视频上生成编辑后的视频,然后使用 Gemini 评估器进行评分并输出报告。该数据集适用于指令引导的视频编辑模型评估和比较。
CoinVE-Bench is a benchmark dataset specifically designed for compositional (multi-instruction) video editing evaluation. It contains 361 test samples, each with 2 to 5 editing instructions, and is accompanied by 4,131 checklist questions for fine-grained evaluation. The dataset supports three evaluation dimensions: editing accuracy (including semantic accuracy, scope accuracy, and editing persistence), physical naturalness (including appearance naturalness, scale consistency, and motion naturalness), and semantic preservation (content preservation). Metrics under each dimension are automatically scored via a checklist protocol based on a vision-language model (e.g., Gemini), with scores ranging from 0-100. The dataset structure includes a source video folder (src_videos) and a checklist JSON file (checklist_json/coinve-bench-361-checklist.json). The evaluation process consists of two steps: first, generate edited videos on 361 source videos using an editing model, then use the Gemini evaluator to score and output a report. This dataset is suitable for evaluating and comparing instruction-guided video editing models.
CoinVE-Bench 数据集详情
数据集概览
CoinVE-Bench 是一个专门用于组合式(多指令)视频编辑评估的基准数据集,包含 361 个测试样本,每个样本包含 2–5 条编辑指令。该数据集采用区域感知的评估方法,通过每条指令对应的掩码来精细检查每个编辑操作是否被正确地限制在目标区域内。
基础信息
| 属性 | 内容 |
|---|---|
| 许可证 | CC BY-SA 4.0 |
| 任务类别 | 视频到视频(video-to-video) |
| 语言 | 英语 |
| 标签 | 视频编辑、组合式编辑、指令引导、基准测试、VLLM 评估 |
| 数据规模 | 少于 1K 样本 |
数据集统计
| 指标 | 数值 |
|---|---|
| 总测试样本数 | 361 |
| 每个样本的指令数 | 2–5 条 |
| 检查清单问题数 | 4,131 |
| 评估维度 | 3 个(编辑准确性 / 物理自然性 / 语义保持) |
评估指标
所有指标由 Gemini 3.6 Flash(默认,可通过 --model 参数配置)基于检查清单的 VLLM 协议进行评分。
评分维度与指标
| 维度 | 指标(缩写) | 范围 | 问题数 | 描述 |
|---|---|---|---|---|
| 编辑准确性(每条指令) | 语义准确性(SA) | [0, 100] | 1,081 | 预期编辑语义的正确执行 |
| 范围准确性(SPA) | [0, 100] | 379 | 编辑定位准确,无泄漏或干扰 | |
| 编辑持续性(EP) | [0, 100] | 923 | 编辑在整个视频中的时间一致性 | |
| 物理自然性 | 外观自然性(AN) | [0, 100] | 356 | 光照、阴影、纹理和风格的自然融合 |
| 尺度一致性(SC) | [0, 100] | 521 | 编辑对象尺度和透视的合理性 | |
| 运动自然性(MN) | [0, 100] | 447 | 运动和物理交互的合理性 | |
| 语义保持 | 内容保持(CP) | [0, 100] | 424 | 非编辑区域、对象和结构的保持 |
评分公式
- ACC 类指标(SA / SPA / EP / AN / SC / MN):
score = num_correct / num_questions × 100 - Score 类指标(CP):
score = mean(score) × 10(每个问题评分为 0–10,然后缩放至 [0, 100]) - 维度分数 = 其各指标
score_100值的算术平均值
问题类型
| 类型 | 问题数 | 上传视频 | 答案格式 |
|---|---|---|---|
| 单一真/假(Single-TF) | 2,524 | 仅编辑视频 | 是 / 否 |
| A/B 选择题(AB-MCQ) | 609 | 仅编辑视频 | A / B / A 和 B |
| 双重真/假(Dual-TF) | 574 | 源视频 + 编辑视频 | 是 / 否 |
| 评分选择题(Score-MCQ) | 424 | 源视频 + 编辑视频 | 0–10 评分 |
数据集结构
text CoinVE-Bench/ ├── src_videos/ │ ├── 9CicJDFN1TA_9_0to183.mp4 │ ├── gWG0LiuZnFQ_8_0to137.mp4 │ ├── JwVDrRmyoXc_51_0to172.mp4 │ └── ... └── checklist_json/ └── coinve-bench-361-checklist.json
源视频命名为 <youtube_id>_<clip_index>_<start>to<end>.mp4,通过检查清单中每个案例的 src_video 字段引用。
评估流程
评估是一个两阶段流程:(1)在 361 个源视频上运行编辑模型以生成编辑视频;(2)使用基于 Gemini 的评估器进行评分。
编辑视频准备要求
- 格式:MP4(
.mp4) - 命名:
<case_id>.mp4(case_id 为整数id字段,范围 0–360,无零填充) - 源视频配对:视频 A(原始视频)从检查清单中的
case["src_video"]读取,无需放置在编辑视频目录中 - 缺失视频:若某案例的编辑视频缺失,其所有问题将记录为
model_answer = null,并在最终分数中计为失败
运行 Gemini 评估
bash export GEMINI_API_KEY=your_key_here python eval_coinbench_gemini_public.py --input ./checklist_json/coinve-bench-361-checklist.json --gen-video-dir ./edited_videos/your_model --prompt-dir ./system_prompts --out-dir ./results/your_model --workers 8 --model gemini-3.6-flash --timestamp
该脚本端到端完成所有步骤——Gemini 调用、逐问题评分、维度/指标聚合和报告生成,无需单独的聚合步骤。
性能对比(部分模型)
| 模型 | SA | SPA | EP | AN | SC | MN | CP |
|---|---|---|---|---|---|---|---|
| Seedance 2.0 | 85.34 | 87.71 | 88.08 | 93.19 | 95.84 | 92.87 | 93.91 |
| Kling O3 | 86.91 | 80.93 | 89.06 | 92.55 | 90.30 | 93.91 | 84.51 |
| VACE | 3.98 | 17.15 | 6.50 | 26.69 | 13.82 | 15.21 | 87.83 |
| Ditto | 34.69 | 36.41 | 40.85 | 35.96 | 47.79 | 38.48 | 51.98 |
| VINO | 83.63 | 66.75 | 89.06 | 78.09 | 82.34 | 85.91 | 61.70 |
| OmniWeaving | 59.67 | 55.94 | 61.11 | 54.49 | 66.03 | 65.10 | 75.09 |
| KiWiEdit | 76.50 | 69.92 | 80.28 | 78.37 | 78.50 | 80.76 | 70.31 |
| SAMA | 75.58 | 73.35 | 79.63 | 83.43 | 83.88 | 88.14 | 90.08 |
| CoinVE-Edit | 87.97 | 89.45 | 89.60 | 91.85 | 91.17 | 95.30 | 90.83 |
引用与致谢
- 引用:如需引用请参考论文
arXiv:2608.17566(CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing) - 联系:longfc.ustc@gmail.com
- 致谢:受 ReCo-Bench、OpenVE-Bench 和 CoVEBench 的启发




