遇见数据集

OmniEdit-Bench

收藏
arXiv2026-08-06 更新2026-08-07 收录
数据链接:
官方服务:

资源简介:

OmniEdit-Bench是由香港大学、阿里巴巴万团队、浙江大学及北京大学联合构建的全面化指令视频编辑基准。该基准精心囊括了790条视频编辑指令,系统性地划分为空间、时间、音频、参考及推理五大轨道,覆盖从低层视觉属性到高层语义推理的多维度编辑需求。其构建过程依据任务复杂度与模态特异性,将指令区分为显式与隐式两类,并融入基于推理的复合场景,旨在更真实地反映现实编辑挑战。该基准旨在解构现有评估体系任务覆盖窄、指令忠实度缺失之弊病,为视频编辑模型提供兼具诊断性与精炼度的测试平台,助力推动该领域研究的纵深发展。

OmniEdit-Bench is a comprehensive instructional video editing benchmark jointly developed by the University of Hong Kong, Alibaba Wan Team, Zhejiang University, and Peking University. It comprises 790 video editing instructions, which are systematically categorized into five tracks: spatial, temporal, audio, reference-based, and reasoning, covering multi-dimensional editing requirements ranging from low-level visual attributes to high-level semantic reasoning. During its development, based on task complexity and modality specificity, the benchmark classifies instructions into two categories: explicit and implicit, and incorporates reasoning-based composite scenarios to more realistically reflect real-world editing challenges. This benchmark aims to address the shortcomings of existing evaluation systems, such as narrow task coverage and lack of instruction faithfulness, providing a diagnostic and refined test platform for video editing models and facilitating the in-depth development of research in this field.

创建时间:
2026-08-06
原始信息汇总

OmniEdit-Bench 数据集详情总结

数据集简介

OmniEdit-Bench是一个全面的指令式视频编辑基准测试集,旨在评估视频编辑模型能否遵循显式和隐式指令,覆盖空间、时间、音频、参考和推理等场景。

  • 总实例数:790
  • 编辑轨道:5个
  • 评估维度:4个

基准分类(五条互补轨道)

轨道 实例数 任务描述
空间编辑(Spatial) 240 属性、主体和全局场景编辑;包括颜色、纹理、材质、物体级操作、重新打光、天气和风格等精细视觉变化。
时间编辑(Temporal) 200 相机、运动、动作和构图;要求稳定的轨迹、连贯的物体动态、语义运动变化和动作级合成。
参考编辑(Reference) 200 空间和时间参考引导;测试模型能否将生成输出与外部视觉和运动信号对齐。
音频编辑(Audio) 100 语音、物体声音和环境音;与视觉事件对齐的多模态编辑任务。
推理编辑(Reasoning) 50 隐式意图和多步推理;包括物理、空间、时间、因果和假设推理,期望结果需推断得出。

评估框架

采用准确性感知评分机制,将编辑质量分解为四个维度,并使用轨道特定的VLM提示进行评估。准确性作为其他维度的门控信号,强调指令忠实度而非表面视觉吸引力。

  • 准确性(Accuracy):编辑后的视频是否忠实遵循指令。
  • 保持性(Preservation):无关的视觉或音频内容是否保持完整。
  • 真实性(Realism):编辑结果是否合理、自然且无伪影。
  • 一致性(Consistency):帧、运动、模态和参考线索是否保持连贯。

模型对比(按轨道排行榜)

空间编辑(8个模型)

  1. Wan2.7-Edit — 69.8
  2. KlingV3-Omni — 59.6
  3. Seedance2.0 — 56.9
  4. Runway Aleph — 54.2
  5. Grok Imagine — 51.7
  6. UniVideo — 39.9
  7. VIVA — 33.5
  8. Ditto — 22.9

时间编辑(8个模型)

  1. Wan2.7-Edit — 29.0
  2. Seedance2.0 — 25.2
  3. KlingV3-Omni — 18.5
  4. Runway Aleph — 16.5
  5. Grok Imagine — 15.0
  6. Ditto — 13.5
  7. UniVideo — 11.3
  8. VIVA — 9.6

音频编辑(2个模型)

  1. Wan2.7-Edit — 13.6
  2. Grok Imagine — 6.7

参考编辑(6个模型)

  1. KlingV3-Omni — 49.9
  2. Wan2.7-Edit — 46.4
  3. Runway Aleph — 15.1
  4. Grok Imagine — 13.1
  5. VIVA — 9.8
  6. UniVideo — 4.9

推理编辑(8个模型)

  1. Seedance2.0 — 29.8
  2. Wan2.7-Edit — 24.6
  3. KlingV3-Omni — 22.9
  4. Runway Aleph — 20.3
  5. Grok Imagine — 17.9
  6. Ditto — 8.6
  7. UniVideo — 8.4
  8. VIVA — 7.5

示例案例

页面提供了6个视频示例,每个案例包含源视频、编辑指令以及8个模型的输出对比,覆盖旋转、动作移除、衣物整理、物体交换、时序修改和状态变化等任务。


引用信息

bibtex @misc{omnieditbench2026, title = {OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing}, year = {2026} }

搜集汇总
数据集介绍
OmniEdit-Bench 数据集图片
构建方式
OmniEdit-Bench的构建基于多维分类体系,系统性地划分了空间、时间、音频、参考和推理五个编辑轨道。数据来源涵盖开源视频平台、公开数据集及合成视频生成模型,确保内容多样性与场景覆盖。每个轨道细分为具体子任务,如空间轨道包含属性、主体和全局层级编辑,时间轨道涵盖相机属性、运动属性、运动语义及时序组合编辑。指令设计区分显式与隐式,融入推理场景,以反映真实编辑需求。
特点
该基准的显著特点在于其全面且细粒度的评估框架。它超越了传统帧级空间编辑,纳入视频特有的时间动态、音频信号及参考引导,并显式区分指令复杂度。评估体系将编辑质量分解为准确性、保留度、真实感和一致性四个维度,引入准确性感知惩罚机制,确保指令遵循成为核心评价标准,防止视觉合理但错误的编辑获得高分,提供可靠的模型能力诊断。
使用方法
该基准适用于系统评估和比较多种指令式视频编辑模型,包括开源与商业系统。研究者可依据五个轨道的结果分析模型在不同编辑维度上的优劣,如空间编辑能力与时间或音频编辑能力的差距。结合VLM与人类评估对齐的验证,该基准作为标准化测试平台,能够揭示当前模型在处理复杂时间、多模态和推理任务上的局限性,为后续研发提供方向指引。
背景与挑战
背景概述
随着生成式模型与多模态理解的迅猛发展,基于指令的视频编辑(Instruction-based Video Editing, IVE)已成为可控视频操作的前沿范式,广泛应用于影视制作、内容创作等领域。然而,现有评估基准普遍存在任务覆盖狭窄、过度依赖图像编辑框架以及评价指标与指令遵循度脱节等局限。为弥补这一空白,香港大学、阿里巴巴、浙江大学及北京大学的研究团队于2026年联合推出OmniEdit-Bench基准,系统性地将编辑任务分解为空间、时间、音频、参考与推理五大维度,并首次引入显式与隐式指令的区分,全面覆盖从低级视觉操作到高级多模态推理的复杂度层次。该基准通过三维度评估体系与精准度感知惩罚机制,为IVE模型提供了细致且可靠的诊断平台,深刻揭示了当前模型在多维编辑场景中的不足,为后续研究奠定了基础。
当前挑战
OmniEdit-Bench所面临的核心挑战根植于视频编辑任务固有的多维性与指令理解的复杂性。领域层面,现有模型在处理时间动态(如运动语义重构、时序组合)、音频-视觉协同编辑及隐式推理指令时表现显著退化,即便是商业级模型在时间轨迹、因果逻辑与假设情境等任务上仍远未达到实用水平,这暴露了视频特有维度建模的深层难题。构建层面,数据需兼顾真实世界的多样性与合成场景的可控性,同时跨越空间、时间、音频、参考与推理五大轨道,对视频来源、标注精度与指令复杂度进行精细平衡;此外,评价指标必须突破传统帧级相似度的局限,确保指令遵循度作为核心信号,并设计出可与人类判断高度一致的自动化评估机制,以规避视觉上合理却未达指令要求的误判风险。
常用场景
经典使用场景
OmniEdit-Bench作为指令驱动的视频编辑领域的一项综合性基准,其经典使用场景在于对视频编辑模型进行多维度、细粒度的能力评估。该基准突破了传统框架局限于空间编辑的窠臼,系统地涵盖了空间、时间、音频、参考及推理五大核心轨道,并进一步区分显式与隐式指令,从而在动静交织的复杂情境中检验模型的理解与执行能力。研究者可借此标准化的测试平台,横向对比开源与商业模型的性能优劣,纵向剖析模型在不同编辑维度上的薄弱环节,为模型迭代提供精准导向。
实际应用
在实际应用层面,OmniEdit-Bench所确立的评估标准为视频内容创作、影视后期、智能教育及无障碍服务等众多领域提供了坚实的技术支撑。通过精准衡量模型在时间连贯性、多模态同步及隐式推理等维度上的表现,该基准助力开发者筛选并优化适用于真实场景的编辑工具,例如自动生成符合逻辑的动作序列、依据参考视频调整镜头语言或实现复杂的因果推理编辑。其标准化的评估框架亦为行业质检与内容审核提供了参照,促进了视频编辑技术从实验室走向产业化的安全、可控落地。
衍生相关工作
OmniEdit-Bench的构建催生了一系列衍生研究,推动了指令视频编辑领域的理论深化与技术创新。其全面的任务分类与严谨的评估协议,为后续工作提供了可复用的范式基准,激发了针对时间编辑、音频对齐及推理型编辑等难点方向的专项攻关。例如,研究者基于此基准开发了更精细的时间注意力机制与跨模态融合策略,并探索了利用视觉语言模型进行自动评估的优化路径。这些衍生工作不仅丰富了视频编辑的方法论体系,也形成了以OmniEdit-Bench为核心的良性学术生态,持续牵引着该领域向更高阶的智能编辑迈进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务