VEFX-Dataset
收藏资源简介:
VEFX-Dataset是由德克萨斯农工大学、Visko平台和Abaka AI联合构建的大规模视频编辑评估数据集,包含5,049条人工标注的编辑样本,覆盖9大类32子类任务。数据来源于开源视频库(如Open-Sora)和私有素材,经质量筛选后通过商业系统、开源模型及智能编辑流水线生成编辑结果。每个样本从指令遵循度、渲染质量和编辑排他性三个维度进行4级评分,标注过程经过严格的跨检查验证(标注一致率达91%以上)。该数据集专为AI辅助视频编辑系统的多维度质量评估而设计,填补了该领域缺乏标准化评估资源的空白。
The VEFX-Dataset is a large-scale video editing evaluation dataset jointly constructed by Texas A&M University, Visko Platform and Abaka AI. It includes 5,049 manually annotated editing samples covering 9 major categories and 32 sub-categories of tasks. The data is sourced from open-source video repositories (e.g., Open-Sora) and proprietary materials, and the editing results are generated via commercial systems, open-source models and intelligent editing pipelines after strict quality screening. Each sample is rated on a 4-level scale across three core dimensions: instruction adherence, rendering quality and editing exclusivity. The annotation process underwent rigorous cross-check validation, with an inter-annotator agreement rate of over 91%. This dataset is specifically designed for multi-dimensional quality evaluation of AI-assisted video editing systems, filling the gap caused by the lack of standardized evaluation resources in this field.
VEFX-Bench 数据集概述
数据集简介
VEFX-Bench 是一个用于评测通用视频编辑和视觉效果的基准数据集。该数据集旨在解决视频编辑模型质量评估的难题。
数据集构成
- VEFX-Dataset:包含 5,049 个人工标注的视频编辑示例。
- 源视频:来源于 1,419 个源视频。
- 类别覆盖:涵盖 9 个主要类别和 32 个子类别。
- VEFX-Bench:包含 300 个精心策划的配对,用于标准化比较。
- 评测系统:涉及 10 个编辑系统(模型)。
质量评估维度
每个编辑后的视频均按1-4分制在三个独立维度上进行评分:
- 指令遵循 (Instruction Following, IF):评估编辑是否忠实执行了给定的指令,衡量语义准确性。
- 渲染质量 (Rendering Quality, RQ):评估输出是否视觉清晰、无伪影,衡量时间一致性、空间保真度和整体视觉质量。
- 编辑排他性 (Edit Exclusivity, EE):评估无关区域是否被保留,衡量模型是否只改变了被要求修改的部分,而未产生意外的副作用。
关键发现
- 模型表现:Kling o3 Omni (GeoAgg: 3.057) 和 Kling o1 (GeoAgg: 2.985) 在排行榜上领先。UniVideo (GeoAgg: 2.516) 是最强的开源模型,表现优于多个商业系统。
- 质量维度差异:所有模型的RQ分数 consistently 高于IF分数,表明产生视觉上合理的编辑比忠实遵循编辑指令要容易得多。
- 局部性挑战:EE分数显示出最广泛的分布 (1.180–3.376),证实了过度编辑和意外的场景变化(如在VACE和Luma Ray 2等当前系统中)仍然是一个主要的失败模式。
引用信息
- 标题:VEFX-Bench: Benchmarking Generic Video Editing and Visual Effects
- 作者:Xiangbo Gao, Sicong Jiang, Bangya Liu, Xinghao Chen, Minglai Yang, Siyuan Yang, Mingyang Wu, Jiongze Yu, Qi Zheng, Haozhi Wang, Jiayi Zhang, Jared Yang, Jie Yang, Zihan Wang, Qing Yin, Zhengzhong Tu
- 期刊:arXiv preprint arXiv:2604.16272
- 年份:2026
相关资源
- 论文:https://xiangbogaobarry.github.io/VEFX-Bench/
- 代码:https://xiangbogaobarry.github.io/VEFX-Bench/
- 数据集:https://xiangbogaobarry.github.io/VEFX-Bench/
- 实时排行榜:https://vefx-leaderboard.com/

- 1VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects德克萨斯农工大学; Visko平台; Abaka AI · 2026年



