IVEBench
收藏资源简介:
IVEBench是一个专门用于评估指令引导视频编辑(IVE)模型的基准数据集,包含600个高质量源视频,涵盖七个语义维度和三十个主题,帧长度从32到1024不等,提供八种主要编辑类别和三十五个子类别,整合了基于MLLM和传统指标的评估协议
IVEBench is a benchmark dataset specifically designed for evaluating Instruction-guided Video Editing (IVE) models. It includes 600 high-quality source videos covering seven semantic dimensions and thirty topics, with frame lengths ranging from 32 to 1024. The dataset provides eight main editing categories and thirty-five subcategories, and integrates evaluation protocols based on both MLLMs and traditional metrics.
IVEBench 数据集概述
数据集简介
IVEBench 是一个用于评估指令引导视频编辑(IVE)模型的综合性基准测试套件,同时兼容传统的源-目标提示方法。
核心特性
数据集规模
- 包含 600 个高质量源视频
- 视频帧长度范围:32 到 1,024 帧
- 涵盖 7 个语义维度和 30 个主题
编辑分类体系
- 8 个主要编辑类别
- 35 个子类别
- 涵盖风格、属性、主体运动、相机运动和视觉效果等多种编辑类型
评估体系
评估维度
- 视频质量
- 指令符合度
- 视频保真度
评估方法
- 结合传统客观指标
- 集成多模态大语言模型(MLLM)评估
- 提供更符合人类感知的全面评估
数据集结构
- IVEBench DB Short 子集:32–128 帧视频
- IVEBench DB Long 子集:129–1024 帧视频(更高难度)
使用方法
- 在 IVEBench DB 上运行视频编辑模型生成目标视频数据集
- 使用评估脚本计算性能得分
- 评估结果导出为 CSV 文件
数据获取
IVEBench 数据库可通过以下命令下载:
huggingface-cli download --repo-type dataset --resume-download Coraxor/IVEBench --local-dir $YOUR_LOCAL_PATH
引用信息
@article{chen2025ivebenchmodernbenchmarksuite, title={IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment}, author={Yinan Chen and Jiangning Zhang and Teng Hu and Yuxiang Zeng and Zhucun Xue and Qingdong He and Chengjie Wang and Yong Liu and Xiaobin Hu and Shuicheng Yan}, journal={arXiv preprint arXiv:2510.11647}, year={2025} }




