NJU-LINK/AVE-Compass
收藏官方服务:
资源简介:
AVE-Compass是一个用于评估基于指令的音视频编辑能力的基准数据集。它针对视觉和音频流紧密耦合的现实编辑请求,例如同时更改可见事件及其声音、在视觉编辑中保留背景环境音,或编辑语音同时保持视听一致性。该数据集发布包含源视频、编辑指令JSON文件和AVE-Compass使用的检查清单JSON文件。
AVE-Compass is a benchmark for evaluating instruction-based audio-video editing abilities. It targets realistic editing requests where visual and audio streams are tightly coupled, such as changing a visible event together with its sound, preserving background ambience during visual edits, or editing speech while maintaining audio-visual consistency. This dataset release contains the source videos, edit instruction JSON files, and checklist JSON files used by AVE-Compass.
提供机构:
NJU-LINK搜集汇总
数据集介绍

构建方式
AVE-Compass的构建过程融合了人工参与的流水线机制。首先,基于结构化源视频描述,利用模态感知的大语言模型生成候选编辑指令。随后,通过一个评判模型过滤掉不自然、不可行或模糊的指令。最后,经过人工标注者对指令的自然性、可执行性和目标特异性进行验证,并将验证后的指令转化为细粒度的检查清单条目,再进行人工去重与精炼,形成了最终的高质量基准数据集。
特点
该数据集涵盖了145个精心挑选的源视频和196条经人工验证的音视频编辑指令,支持联合音视频编辑、语音编辑、仅视频编辑和仅音频编辑四大分支,共计28种细粒度操作类型。其独特之处在于提供了2,688个诊断性检查清单条目,从编辑意图、指令遵循度、保真度和真实性四个互补维度进行全面评估,并辅以跨模态、视觉和音频的自动质量指标。
使用方法
使用AVE-Compass时,需将每条编辑指令与对应源视频配对,源视频文件名由指令JSON文件中的video字段指定。评估过程中,每个编辑指令需与同名的检查清单JSON文件结合使用,检查清单包含原子化的极性判断题,用以衡量指令遵循和保真保持情况。模型的最终性能通过Overall Editing Intent这一主要指标进行排名,分数区间为0至100,分数越高代表编辑效果越佳。
背景与挑战
背景概述
随着多模态生成技术的迅猛发展,音视频编辑领域迎来了前所未有的机遇与挑战,如何精准评估模型在指令驱动下对视觉与音频流进行协同编辑的能力,成为当前研究的关键瓶颈。AVE-Compass数据集由 Wen 等研究人员于2026年创建,旨在系统性地评估指令式音视频编辑模型的能力。该基准聚焦于视觉与音频紧密耦合的真实编辑需求,例如同步更改可见事件及其声音、在视觉编辑中保留背景环境音,或在保持视听一致性的前提下编辑语音。数据集包含145个精心挑选的源视频、196条人工验证的编辑指令以及2688个细粒度检查项,覆盖联合视听编辑、语音编辑、仅视频编辑和仅音频编辑四大分支,为音视频编辑领域提供了首个标准化的评估框架,对推动多模态生成模型的实用化发展具有重要影响力。
当前挑战
AVE-Compass所面临的挑战主要体现在两个层面。在领域问题层面,音视频编辑任务要求模型同时理解并操作视觉与音频两个高度耦合的信息流,而现有生成模型往往在跨模态一致性、编辑后内容的自然度与保真度等方面表现不足,例如榜单领先模型AVE-Agent的整体编辑意图得分仅为59.8,远未达到实用水平。在数据集构建层面,挑战在于如何生成自然且可执行的编辑指令、如何设计细粒度且无歧义的检查项以覆盖多样化编辑操作类型,以及如何通过人工验证流程确保指令的真实性与评估的公平性。为此,构建过程采用了人在回路中的流水线,包括基于大模型的指令生成、批评模型过滤以及人工标注与精炼,以应对指令质量与评估维度复杂性的挑战。
常用场景
经典使用场景
AVE-Compass作为首个面向音视频联合编辑能力进行系统性评估的基准数据集,其经典使用场景聚焦于指令驱动的音视频编辑任务。研究者可利用该数据集中的145个源视频、196条人工审核编辑指令及2688个细粒度检测项,对模型在联合编辑、语音编辑、纯视频编辑与纯音频编辑四大分支上的表现进行诊断性评测。该数据集特别强调视觉与音频流之间紧密耦合的真实编辑需求,例如在改变可见事件的同时同步其声音、在视觉编辑中保留背景环境音、或编辑语音时维持音视频一致性,为评估跨模态编辑一致性提供了标准化基准。
衍生相关工作
围绕AVE-Compass数据集,学术界已衍生出一系列具有影响力的经典工作。例如排名首位的AVE-Agent(Wan)模型,通过在联合编辑任务上取得59.8的整体编辑意图得分,验证了该基准对跨模态编辑能力的有效区分。Wan2.7与HappyHorse等模型也依托该基准展示了其在视频主导编辑与音频保留任务中的差异化优势。此外,Gemini-Omni与Seedance等方法的参与,揭示了内容审查机制对语音编辑任务的潜在影响。这些工作共同推动了音视频编辑领域的研究进展,使AVE-Compass成为评估模型跨模态协同编辑能力的事实标准,并激励后续研究在联合编辑的真实性、保真度与指令跟随等核心问题上持续探索。
数据集最近研究
最新研究方向
AVE-Compass基准的提出标志着视听编辑领域迈入精细化、多模态协同评估的新阶段。前沿研究聚焦于构建联合音视频编辑模型,例如排名领先的AVE-Agent(Wan)通过统一的指令跟随框架实现了视觉与音频流的高度协调编辑。当前热点方向涵盖语音编辑中唇形与声纹的一致性保持、背景氛围音在视觉变换下的鲁棒保留,以及跨模态语义对齐的自动化诊断。该基准引入的2,688项细粒度检查清单与28种编辑操作类型,为模型在自然度、忠实度和语义连贯性上提供了系统性评测标准,其发布的多样性源视频和人验证指令集正推动可编辑生成内容从单一模态向复合感官体验转型,对智能视频后期、虚拟现实内容创作及人机交互界面等应用产生深远影响。
以上内容由遇见数据集搜集并总结生成



