vggsound-caps, V2M-caps
收藏资源简介:
vggsound-caps是基于VGGSound数据集构建的,包含19万个音频描述的caption数据;V2M-caps是基于V2M数据集构建的,包含600万个音乐描述的caption数据。这两个数据集为多模态音频和音乐生成任务提供了丰富的训练基础,支持文本、视频、图像等多种输入模态,可以生成不同类型的音频,包括声音效果和音乐。数据集的构建过程包括对现有数据集的注释和扩充,以及利用多模态掩码策略进行模型训练,以提升多模态表示学习和生成性能。
VGGsound-caps is constructed based on the VGGSound dataset, which contains 190,000 caption entries for audio descriptions. V2M-caps is built upon the V2M dataset, encompassing 6 million caption entries for music descriptions. These two datasets provide rich training foundations for multimodal audio and music generation tasks, supporting diverse input modalities such as text, video and images, and capable of generating various types of audio including sound effects and music. The construction process of these datasets includes annotating and expanding existing datasets, as well as adopting multimodal masking strategies for model training to enhance multimodal representation learning and generation performance.

- 1AudioX: Diffusion Transformer for Anything-to-Audio Generation香港科技大学 · 2025年



