OmniEdit-Bench
收藏资源简介:
OmniEdit-Bench是由香港大学、阿里巴巴万团队、浙江大学及北京大学联合构建的全面化指令视频编辑基准。该基准精心囊括了790条视频编辑指令,系统性地划分为空间、时间、音频、参考及推理五大轨道,覆盖从低层视觉属性到高层语义推理的多维度编辑需求。其构建过程依据任务复杂度与模态特异性,将指令区分为显式与隐式两类,并融入基于推理的复合场景,旨在更真实地反映现实编辑挑战。该基准旨在解构现有评估体系任务覆盖窄、指令忠实度缺失之弊病,为视频编辑模型提供兼具诊断性与精炼度的测试平台,助力推动该领域研究的纵深发展。
OmniEdit-Bench is a comprehensive instructional video editing benchmark jointly developed by the University of Hong Kong, Alibaba Wan Team, Zhejiang University, and Peking University. It comprises 790 video editing instructions, which are systematically categorized into five tracks: spatial, temporal, audio, reference-based, and reasoning, covering multi-dimensional editing requirements ranging from low-level visual attributes to high-level semantic reasoning. During its development, based on task complexity and modality specificity, the benchmark classifies instructions into two categories: explicit and implicit, and incorporates reasoning-based composite scenarios to more realistically reflect real-world editing challenges. This benchmark aims to address the shortcomings of existing evaluation systems, such as narrow task coverage and lack of instruction faithfulness, providing a diagnostic and refined test platform for video editing models and facilitating the in-depth development of research in this field.
OmniEdit-Bench 数据集详情总结
数据集简介
OmniEdit-Bench是一个全面的指令式视频编辑基准测试集,旨在评估视频编辑模型能否遵循显式和隐式指令,覆盖空间、时间、音频、参考和推理等场景。
- 总实例数:790
- 编辑轨道:5个
- 评估维度:4个
基准分类(五条互补轨道)
| 轨道 | 实例数 | 任务描述 |
|---|---|---|
| 空间编辑(Spatial) | 240 | 属性、主体和全局场景编辑;包括颜色、纹理、材质、物体级操作、重新打光、天气和风格等精细视觉变化。 |
| 时间编辑(Temporal) | 200 | 相机、运动、动作和构图;要求稳定的轨迹、连贯的物体动态、语义运动变化和动作级合成。 |
| 参考编辑(Reference) | 200 | 空间和时间参考引导;测试模型能否将生成输出与外部视觉和运动信号对齐。 |
| 音频编辑(Audio) | 100 | 语音、物体声音和环境音;与视觉事件对齐的多模态编辑任务。 |
| 推理编辑(Reasoning) | 50 | 隐式意图和多步推理;包括物理、空间、时间、因果和假设推理,期望结果需推断得出。 |
评估框架
采用准确性感知评分机制,将编辑质量分解为四个维度,并使用轨道特定的VLM提示进行评估。准确性作为其他维度的门控信号,强调指令忠实度而非表面视觉吸引力。
- 准确性(Accuracy):编辑后的视频是否忠实遵循指令。
- 保持性(Preservation):无关的视觉或音频内容是否保持完整。
- 真实性(Realism):编辑结果是否合理、自然且无伪影。
- 一致性(Consistency):帧、运动、模态和参考线索是否保持连贯。
模型对比(按轨道排行榜)
空间编辑(8个模型)
- Wan2.7-Edit — 69.8
- KlingV3-Omni — 59.6
- Seedance2.0 — 56.9
- Runway Aleph — 54.2
- Grok Imagine — 51.7
- UniVideo — 39.9
- VIVA — 33.5
- Ditto — 22.9
时间编辑(8个模型)
- Wan2.7-Edit — 29.0
- Seedance2.0 — 25.2
- KlingV3-Omni — 18.5
- Runway Aleph — 16.5
- Grok Imagine — 15.0
- Ditto — 13.5
- UniVideo — 11.3
- VIVA — 9.6
音频编辑(2个模型)
- Wan2.7-Edit — 13.6
- Grok Imagine — 6.7
参考编辑(6个模型)
- KlingV3-Omni — 49.9
- Wan2.7-Edit — 46.4
- Runway Aleph — 15.1
- Grok Imagine — 13.1
- VIVA — 9.8
- UniVideo — 4.9
推理编辑(8个模型)
- Seedance2.0 — 29.8
- Wan2.7-Edit — 24.6
- KlingV3-Omni — 22.9
- Runway Aleph — 20.3
- Grok Imagine — 17.9
- Ditto — 8.6
- UniVideo — 8.4
- VIVA — 7.5
示例案例
页面提供了6个视频示例,每个案例包含源视频、编辑指令以及8个模型的输出对比,覆盖旋转、动作移除、衣物整理、物体交换、时序修改和状态变化等任务。
引用信息
bibtex @misc{omnieditbench2026, title = {OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing}, year = {2026} }




