VABench
收藏资源简介:
VABench是一个全面的多维基准测试框架,旨在系统评估同步音频-视频生成的能力。它涵盖三种主要任务类型:文本到音频-视频(T2AV)、图像到音频-视频(I2AV)和立体音频-视频生成。该框架建立了两个主要评估模块,覆盖15个维度,包括成对相似性(文本-视频、文本-音频、视频-音频)、音频-视频同步、唇语一致性以及精心策划的音频和视频问答(QA)对等。此外,VABench涵盖七个主要内容类别:动物、人类声音、音乐、环境声音、同步物理声音、复杂场景和虚拟世界。
VABench is a comprehensive multi-dimensional benchmark framework designed to systematically evaluate the capabilities of synchronized audio-visual generation. It covers three main task types: text-to-audio-visual (T2AV), image-to-audio-visual (I2AV), and stereoscopic audio-visual generation. The framework establishes two primary evaluation modules, covering 15 dimensions including pairwise similarity (text-video, text-audio, video-audio), audio-visual synchronization, lip-speech consistency, as well as carefully curated audio and visual question answering (QA) pairs, etc. Additionally, VABench encompasses seven main content categories: animals, human voices, music, environmental sounds, synchronized physical sounds, complex scenes, and virtual worlds.
VABench: 音频-视频生成综合基准数据集概述
数据集基本信息
- 数据集名称:VABench
- 核心定位:一个用于系统评估同步音频-视频生成模型能力的综合性、多维度基准框架。
主要任务类型
VABench 涵盖三种主要的音频-视频生成任务类型:
- 文本到音频-视频生成
- 图像到音频-视频生成
- 立体声音频-视频生成
评估维度与模块
数据集建立了两个主要的评估模块,共覆盖 15个评估维度,具体包括:
- 成对相似性评估:文本-视频、文本-音频、视频-音频。
- 音频-视频同步性评估。
- 唇语-语音一致性评估。
- 精心设计的音频和视频问答对评估。
内容覆盖范围
VABench 覆盖了七个主要的内容类别:
- 动物
- 人声
- 音乐
- 环境声音
- 同步物理声音
- 复杂场景
- 虚拟世界
数据集目标
- 为具备同步音频能力的视频生成模型建立新的评估标准。
- 通过提供系统性的结果分析和可视化,推动该领域的全面进步。
相关资源
- 论文:已发布于 arXiv,标题为《VABench: A Comprehensive Benchmark for Audio-Video Generation》。
- 论文地址:https://arxiv.org/abs/2512.09299
- 数据发布:测试数据已随论文发布。
- 代码状态:评估代码即将发布。
引用信息
若使用本数据集,请引用以下论文:
@article{hua2025vabench, title={VABench: A Comprehensive Benchmark for Audio-Video Generation}, author={Hua, Daili and Wang, Xizhi and Zeng, Bohan and Huang, Xinyi and Liang, Hao and Niu, Junbo and Chen, Xinlong and Xu, Quanqing and Zhang, Wentao}, journal={arXiv preprint arXiv:2512.09299}, year={2025} }




