Omni2Sound_Result
收藏资源简介:
Omni2Sound评估结果数据集旨在评估Omni2Sound模型在三个子任务上的表现:VT2A(视频+文本→音频)、V2A(视频→音频)和T2A(文本→音频)。所有结果均在VGGSound-Omni基准上进行评估,并以JSON文件形式存储以确保可复现性。评估使用了AV-Benchmark工具包,涵盖了四个维度的指标:分布匹配(FAD、FD、FD_PaSST、KL、KL_PaSST)、音频质量(IS、IS_PaSST、PQ)、语义对齐(CLAP、MS-CLAP、IB/ImageBind)和时间对齐(DS/Desynchronization Score)。数据集适用于音频生成、评估、视频到音频、文本到音频等任务,并遵循CC BY-NC 4.0许可,仅限非商业用途。
The Omni2Sound evaluation results dataset aims to evaluate the performance of the Omni2Sound model on three subtasks: VT2A (video+text→audio), V2A (video→audio), and T2A (text→audio). All results are evaluated on the VGGSound-Omni benchmark and stored in JSON files to ensure reproducibility. The evaluation uses the AV-Benchmark toolkit, covering four dimensions of metrics: distribution matching (FAD, FD, FD_PaSST, KL, KL_PaSST), audio quality (IS, IS_PaSST, PQ), semantic alignment (CLAP, MS-CLAP, IB/ImageBind), and temporal alignment (DS/Desynchronization Score). The dataset is suitable for tasks such as audio generation, evaluation, video-to-audio, text-to-audio, and follows the CC BY-NC 4.0 license for non-commercial use only.
数据集概述
Omni2Sound Evaluation Results 是 Omni2Sound 模型在三个子任务上的评估结果数据集,旨在为音频生成领域提供可复现的基准测试数据。
基本信息
- 许可证: CC BY-NC 4.0(仅限非商业用途)
- 语言: 英语
- 任务类别: 文本生成音频
- 标签: 音频生成、评估、视频转音频、文本转音频、基准测试结果
评估子任务
该数据集包含以下三个子任务的评估结果:
- VT2A: 视频 + 文本 → 音频
- V2A: 视频 → 音频
- T2A: 文本 → 音频
评估基准
所有结果均在 VGGSound-Omni 基准测试集 上进行评估,数据以 JSON 文件格式存储,确保可复现性。
评估设置
- 评估工具: AV-Benchmark(标准评估工具包)
- 剪辑长度: 8 秒
- 对比方法: 所有基线模型均使用官方检查点,在相同工具和条件下重新评估
评估指标
覆盖四个维度的全面指标:
| 评估维度 | 具体指标 |
|---|---|
| 分布匹配 | FAD, FD, FD_PaSST, KL, KL_PaSST |
| 音频质量 | IS, IS_PaSST, PQ(生产质量) |
| 语义对齐 | CLAP, MS-CLAP(文本-音频), IB / ImageBind(视频-音频) |
| 时间对齐 | DS / 去同步分数(Synchformer) |
相关资源
- 模型: Dalision/Omni2Sound
- 基准数据集: Dalision/Omni2Sound_Benchmark
- 评估工具: hkchengrex/av-benchmark
- 论文: arXiv:2601.02731
- 项目页面: omni2sound.github.io
- 代码: github.com/omni2sound/Omni2Sound




