MUSE-VA
收藏资源简介:
该数据集是一个多模态音乐-视觉数据集,包含1250个样本,划分为测试集(625个样本)和验证集(625个样本),总数据量约为41.75GB。每个样本包含音频和图像两种模态数据,并辅以丰富的元数据标注。音频方面标注了音乐流派、主奏乐器、伴奏乐器、速度、调性、作曲说明、主题、情感、效价值、唤醒度、创新性、音乐描述文本和音乐标签。视觉方面标注了视觉意象描述、视觉标签和视觉描述文本。此外,数据集还提供了跨模态一致性评估结果(布尔值)及其原因说明。该数据集适用于多模态学习、音乐信息检索、跨模态生成与检索、音乐情感分析、音乐属性识别等研究任务。
This dataset is a multimodal music-visual dataset containing 1250 samples, divided into a test set (625 samples) and a validation set (625 samples), with a total data volume of approximately 41.75GB. Each sample includes audio and image modal data, supplemented with rich metadata annotations. For audio, annotations include music genre, main instrument, accompaniment instrument, tempo, key, composition description, theme, emotion, valence, arousal, creativity, music description text, and music tags. For visual aspects, annotations include visual imagery description, visual tags, and visual description text. Additionally, the dataset provides cross-modal consistency evaluation results (Boolean values) and their reasoning. This dataset is suitable for research tasks such as multimodal learning, music information retrieval, cross-modal generation and retrieval, music emotion analysis, and music attribute recognition.
- 数据集名称: MUSE-VA
- 数据集地址: https://huggingface.co/datasets/jiahaomei/MUSE-VA
- 数据集简介: MUSE-VA是一个多模态情感与视觉意象数据集,包含音频和图像对,并配有丰富的文本标注,用于音乐情感分析、视听一致性评估等任务。
- 数据集大小: 总下载大小约41.71 GB,数据集总大小约41.75 GB。
- 数据划分:
- 测试集 (test): 625个样本,约21.01 GB。
- 验证集 (valid): 625个样本,约20.74 GB。
- 特征字段:
id(字符串): 样本唯一标识。audio(音频): 音频数据。image(图像): 图像数据。genre(字符串): 音乐流派。lead_instruments(字符串): 主奏乐器。supporting_instruments(字符串): 伴奏乐器。tempo(整数): 音乐速度(BPM)。key(字符串): 音乐调性。composition_notes(字符串): 作曲说明。theme(字符串): 音乐主题。emotion(字符串): 情感标注。valence(浮点数): 效价(情感维度)。arousal(浮点数): 唤醒度(情感维度)。innovation(字符串): 创新性标注。music_caption(字符串): 音乐描述文本。music_tags(字符串): 音乐标签。visual_imagery(字符串): 视觉意象文本。visual_tags(字符串): 视觉标签。visual_caption(字符串): 视觉描述文本。consistency_result(布尔值): 视听一致性判断结果。consistency_reason(字符串): 一致性判断原因。




