遇见数据集

CoVEBench

收藏
github2026-06-04 更新2026-06-07 收录
数据链接:
官方服务:

资源简介:

CoVEBench是一个用于组合指令引导视频编辑的诊断基准。与单操作编辑基准不同,CoVEBench评估现实中的多点指令,要求模型修改请求内容的同时保留不相关的源视频语义和时间一致性。

CoVEBench is a diagnostic benchmark for compositional instruction-guided video editing. Unlike single-operation editing benchmarks, CoVEBench evaluates real-world multi-point instructions, requiring models to modify the requested content while preserving the irrelevant source video semantics and temporal consistency.

创建时间:
2026-05-29
原始信息汇总

数据集概述

CoVEBench 是一个用于评估组合指令引导视频编辑模型的诊断基准。与单一操作编辑基准不同,CoVEBench 评估需要模型在修改指定内容的同时,保留无关源视频语义和时间连贯性的现实多点指令。

评估维度与指标

CoVEBench 从三个互补维度衡量视频编辑性能:指令遵循度、视频质量和视频保真度。基准结合了多模态大语言模型(MLLM)清单主观指标与客观质量及保真度指标。

维度 指标 缩写 方法
指令遵循度 联合准确率 UAS MLLM + 清单
指令遵循度 指令跟随得分 IFS MLLM + 清单
指令遵循度 视频真实感得分 VRS MLLM + 清单
视频质量 综合质量 VQR VisualQuality-R1
视频质量 美学 AES aesthetic-predictor-v2-5
视频质量 运动平滑度 MSM 仅编辑视频的光流
视频质量 技术质量 TQ DOVER++ 技术分支
视频保真度 语义一致性 SEM MLLM + 清单
视频保真度 结构保真度 SSIM SSIM
视频保真度 运动保真度 MF CoTracker
视频保真度 静态区域一致性 SRC SAM2 + DINOv2

主要发现

  1. 当前视频编辑模型在处理组合指令时仍存在困难:模型常能满足单个编辑点,但难以满足严格的联合标准。
  2. 编辑强度与保留程度并非自动对齐:更强的修改可能会意外改变本应保持不变的区域。
  3. 细粒度的清单评估能够揭示粗粒度提示级或单一指标评分所隐藏的失败案例。

数据集内容

  • 数据集可从 Hugging Face 下载:NJU-LINK/CoVEBench
  • 数据结构包括 checklist.json 文件(基准任务ID到源视频的权威映射)和 data/ 目录下的源视频文件(如 .mp4 格式)。
  • 每个清单项包含 idvideoA_path,编辑后的视频需按清单任务 ID 命名。

使用方式

  • 下载数据集:通过 scripts/download_dataset.py 脚本下载,默认存储至 data/covebench_hf/
  • 评估流程:支持运行客观指标(如 AES, TQ, MSM, SSIM, MF, VQR, SRC)和主观 MLLM 清单指标(UAS, IFS, VRS, SEM)。主观评估默认使用 Qwen/Qwen3.5-122B-A10B 模型。
  • 输出:客观和主观评测均输出 CSV 文件,包含对应指标得分。客观评测还提供含任务ID的文件用于逐项检查。

重现性说明

  • 帧级指标默认使用10个等距帧。
  • AES、VQR、MSM 仅在编辑后的视频上计算。
  • SSIM、MF、SRC 按清单任务ID比较源视频和编辑视频。
  • SRC 可使用提供的源掩码缓存,或通过 LLM 动态生成掩码。
  • TQ 使用 DOVER++ 的技术得分。
  • 主观指标默认在 0-100 量表上报告,使用全局问题级聚合。

许可证与引用

  • 项目主页:https://nju-link.github.io/CoVEBench/
  • 代码仓库:https://github.com/NJU-LINK/CoVEBench
  • Hugging Face 数据集:https://huggingface.co/datasets/NJU-LINK/CoVEBench
  • 引用:详见项目提供的 BibTeX 引用格式。
搜集汇总
数据集介绍
CoVEBench 数据集图片
构建方式
CoVEBench由南京大学LINK团队与快手科技Kling团队联合构建,旨在评估视频编辑模型处理复杂指令的能力。该基准数据集从真实场景中提炼出多维度、多操作组合的编辑指令,要求模型在修改指定内容的同时,严格保留未提及区域的语义完整性与时间连贯性。每一条样本均包含源视频、细粒度操作清单以及多项客观与主观评价标签,从而系统性地衡量模型在指令遵循、视频质量与视频保真度三个互补维度上的表现。
特点
CoVEBench的核心特点在于其诊断性设计:通过多模态大语言模型结合操作清单的细粒度评估方法,精准揭示模型在满足单个编辑点与全局联合标准之间的差距。数据集融合了MLLM清单式主观指标(如联合准确率、指令遵循分数)与客观质量保真度指标(如结构相似度、运动平滑度、静态区域一致性),能够暴露粗粒度提示评分或单一指标所掩盖的失败模式。这种多维复合评估体系为视频编辑模型的性能瓶颈提供了深入的归因分析。
使用方法
使用CoVEBench时,研究者需先从Hugging Face下载基准数据集,随后将待评测模型生成的编辑视频按清单任务ID命名并存放于独立目录。通过运行预设的客观评测脚本,可一键计算包括美学质量、技术质量、运动平滑度在内的多种客观指标;主观评测则依赖指定的MLLM评判模型,调用清单式问答生成指令遵循与语义一致性分数。所有评测结果以CSV格式输出,便于进行模型间的横向对比与细粒度错误分析。
背景与挑战
背景概述
CoVEBench是由南京大学LINK实验室与快手科技Kling团队于2026年联合推出的诊断性基准数据集,旨在解决组合指令引导视频编辑领域的关键研究问题。现有的视频编辑基准多聚焦于单一操作指令,难以评估模型在复杂多指令场景下的真实性能。CoVEBench通过设计包含多个编辑点的组合指令,要求模型在修改指定内容的同时保持源视频中未被指令涉及区域的语义与时间一致性。该基准从指令遵循度、视频质量与视频保真度三个互补维度进行系统评估,其发布的融合多模态大语言模型检查表的评价体系为视频编辑领域提供了更精细的标准化测试平台,对推动该领域研究具有重要影响力。
当前挑战
CoVEBench所解决的领域核心挑战在于,当前视频编辑模型仍难以有效处理组合指令:模型往往能满足单个编辑点,但在严格的联合通过标准下表现不佳。此外,编辑强度与内容保持之间的平衡难以自动实现,较强的修改操作会无意识地改变本应保持不变的区域。在基准构建过程中,挑战包括如何设计能真实反映现实应用场景的多点组合指令,如何确保评价指标的细粒度与可解释性,以及如何构建包含源掩膜数据的完整评估体系以支持静态区域一致性(SRC)等高级指标的精确计算。
常用场景
经典使用场景
CoVEBench作为一项针对组合指令引导视频编辑的诊断性基准,其核心用途在于评估视频编辑模型在复杂多指令场景下的综合表现。与传统仅关注单一操作的编辑基准不同,该数据集精心设计了涵盖多要点的现实性指令,要求模型在精准修改指定内容的同时,必须维持未涉及区域的语义完整性与时间连续性。研究者可借助该基准,通过指令遵循度、视频质量与保真度三个互补维度,系统性地剖析模型在处理结构化组合指令时的能力边界与内在缺陷。
实际应用
在影视后期制作、短视频内容创作与自动化视频处理等实际应用场景中,用户常需同时执行多个编辑操作,例如在替换背景的同时保留前景主体的动作与光照一致性。CoVEBench所模拟的组合指令场景高度贴近此类真实需求,能够为视频编辑模型的工业部署提供可靠的性能筛选标准。通过其细粒度的清单式评估,开发人员可精准定位模型在特定类型组合指令上的短板,从而有针对性地优化编辑策略,推动智能视频编辑工具从实验室走向实际生产环境。
衍生相关工作
CoVEBench的提出催生了多项重要的后续研究工作。其清单式评估方法启发了更精细化的指令分解与验证机制,研究者开始探索将组合指令拆解为原子操作序列并逐项验证执行效果。该基准对编辑强度与保留能力之间非对齐关系的揭示,直接推动了面向语义约束的编辑强度自适应调控技术的发展。此外,基于其公开的评估矩阵与失败的典型案例分析,一系列旨在提升模型对未修改区域时序保真度的网络架构改进工作相继涌现,进一步丰富和深化了视频编辑领域的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务