遇见数据集

moodwave-music-tagging

收藏
Hugging Face2026-07-31 更新2026-08-01 收录
官方服务:

资源简介:

MoodWave Music Tagging 是一个多语言音乐标注数据集,专注于印地语和尼泊尔语曲目,旨在弥补现有音乐模型对这些语言处理不佳的问题。数据集包含 6,624 首曲目,总计 625 小时音频,但本仓库仅提供元数据(不含音频),音频需通过 YouTube ID 自行下载。元数据包含丰富的字段:track_id、youtube_id、audio_sha256(去重键)、title(原始标题)、title_romanized(清洗后的歌曲名)、artist、composer、genre(20 个类别,分 A/B 层级)、tradition(子标签)、language(hi/ne/en 等)、origin_region、is_filmi、mood、vibes、vocal_gender、duration_s 等。目前标注状态为进行中:仅英语部分包含类型标签(1,539 首),其余 5,085 首未标注。语言分布中英语有 1,616 首,其余主要为未标注。类型体系采用两层结构:Tier A 为语言无关的声音类型(如 Pop、Rock、R&B 等),Tier B 为区域传统类型(如 Hindustani Classical、Lok Dohori 等),当前仅标注了 Tier A。数据集适用于音频分类、音乐信息检索、语言识别等任务。使用示例可通过 Hugging Face datasets 库加载,并支持基于 genre 的过滤。注意事项包括:标签不完整、无艺术家无关划分(随机划分会泄漏艺术家身份)、采样偏差(偏向 label 推广内容)、情绪标签较弱。许可证为非商业研究用途。

MoodWave Music Tagging is a multilingual music tagging dataset focusing on Hindi and Nepali tracks, aiming to address the poor performance of existing music models on these languages. The dataset contains 6,624 tracks totaling 625 hours of audio, but this repository only provides metadata (no audio); audio must be downloaded via YouTube IDs. The metadata includes rich fields: track_id, youtube_id, audio_sha256 (dedup key), title (original title), title_romanized (cleaned song name), artist, composer, genre (20 categories in A/B tiers), tradition (sub-tag), language (hi/ne/en etc.), origin_region, is_filmi, mood, vibes, vocal_gender, duration_s, etc. The annotation status is in progress: only English part has genre tags (1,539 tracks), the remaining 5,085 are untagged. Language distribution shows 1,616 English tracks, others mainly untagged. The genre system uses a two-tier structure: Tier A for language-agnostic sound types (e.g., Pop, Rock, R&B, etc.), Tier B for regional traditional types (e.g., Hindustani Classical, Lok Dohori, etc.), currently only Tier A is annotated. The dataset is suitable for tasks such as audio classification, music information retrieval, language identification, etc. Usage examples can be loaded via the Hugging Face datasets library, with filtering support based on genre. Caveats include incomplete labels, no artist-agnostic split (random split leaks artist identity), sampling bias (biased towards label promotion content), and weak mood labels. The license is for non-commercial research use.

创建时间:
2026-07-29
原始信息汇总

数据集概述

MoodWave Music Tagging 是一个面向印地语(Hindi)和尼泊尔语(Nepali)音乐的多语言音乐标签数据集,旨在解决现有音乐模型对这两种语言曲库处理不佳的问题。数据集共包含 6,624 首曲目,总计 625 小时音频。该仓库仅包含元数据,不提供音频文件。

数据集状态

  • 当前状态:开发中(Work in Progress)
  • 已标注流派:1,539 首(当前仅覆盖英语部分)
  • 未标注:5,085 首(等待标注)
  • 按语言分布:未标注(5,008 首)、英语(1,616 首)

流派标签体系

Tier A(语言无关的声音风格)

Pop、Rock、Hip-Hop、Electronic、Folk、Jazz、R&B、Classical、Country、Reggae

Tier B(具有独特声学特征的地域传统音乐)

Hindustani Classical、Sufi/Qawwali、Bhajan/Devotional、Ghazal、Bhangra/Punjabi Folk、Lok Dohori、Tamang Selo、Deuda、Nepali Lok Geet、Adhunik

特殊规则

  • Bollywood 不视为流派,仅作为电影音乐属性(is_filmi=true
  • Newa Dapha 和 Gunla Bajan 归类为 Nepali Lok Geet,而非 Bhajan/Devotional
  • genre=Deuda 不必然对应 language=ne

数据模式(Schema)

主要字段包括:

  • 标识track_idyoutube_idaudio_sha256(去重键)
  • 描述title(原始标题)、title_romanized(清理后的歌名)、artistcomposer
  • 标签genregenre_tiertradition(如 salaijo、jhyaure、teej、newa_dapha)、language(支持 hi、ne、en、pa、bho、new、mai、ur、other、instrumental)
  • 来源origin_region(NP/IN/PK/other)、source_channel_idsource_playlist_id
  • 属性is_filmifilm_titlefilm_industryrelease_yeardecademoodvibesvocal_genderis_liveis_instrumentalis_remixis_coverduration_s
  • 标注信息label_sourcelabel_confidencetaxonomy_version
  • 划分split(train/unlabelled)

数据收集方法

  1. 使用 yt-dlp --flat-playlist 枚举官方厂牌和艺人频道
  2. 过滤非音乐内容(时长限制 60–900 秒,首次通过时 19% 为非音乐内容)
  3. 下载并转码完整音频(Opus 48k 单声道 24 kHz)
  4. 标注过程:先进行检索(iTunes、Last.fm、MusicBrainz、频道来源),再使用 LLM 协调证据至固定分类体系,仅当 2 个以上独立来源一致时才接受标签

使用方式

python from datasets import load_dataset

ds = load_dataset("anujpaude1/moodwave-music-tagging", split="train") print(ds[0]["title_romanized"], "|", ds[0]["language"], "|", ds[0]["genre"])

仅标注子集

labelled = ds.filter(lambda r: r["genre"] != "")

尼泊尔民间音乐

dohori = ds.filter(lambda r: r["genre"] == "Lok Dohori")

可通过 SQL Console 或 DuckDB 直接查询:

sql SELECT language, genre, count() AS n FROM hf://datasets/anujpaude1/moodwave-music-tagging/data/manifest/train-.parquet WHERE genre != GROUP BY 1, 2 ORDER BY n DESC;

已知限制

  • 标签不完整:流派标签目前仅覆盖英语部分
  • 无艺人不相交划分:语料基于单一艺人播放列表构建,随机划分会泄露艺人身份信息,导致准确率虚高(Flexer 2007: 75.7% → 58.5%)
  • 采样偏差:偏向上传和推广的内容,印地语目录严重偏向 2000 年后的作品
  • 情绪标签较弱:仅基于音频的印地语情绪分类 F 值约为 58%
  • Romantic 是歌词层面的分类,在 valence-arousal 空间中无定位,在纯音频模型下会并入 Calm 和 Sad

许可协议

  • 标注数据:非商业研究用途
  • 底层作品和录音:归权利所有者所有
  • 仓库不分发任何音频文件
搜集汇总
数据集介绍
moodwave-music-tagging 数据集图片
构建方式
MoodWave Music Tagging数据集的构建遵循严谨的多阶段流程,初始阶段通过yt-dlp工具对官方厂牌及艺人频道进行扁平化枚举,随后依据时长(60至900秒)及内容性质(排除非音乐内容)进行筛选,并全量下载转码为统一格式。标注环节综合运用检索(如iTunes、Last.fm、MusicBrainz)与频道溯源,并借助大语言模型将多方证据协调至固定分类体系,仅当至少两个独立来源达成一致时才采纳标签。此方法确保了标签的高置信度与数据纯净性。
特点
该数据集的核心特色在于其多语言与细致的分类体系。其收录6,624首曲目,涵盖印地语、尼泊尔语及英语,总时长625小时,专为现有模型处理欠佳的南亚音乐设计。分类体系摒弃了将'宝莱坞'视为流派的传统做法,而是将其作为电影音乐属性(is_filmi),并明确区分语言与音乐风格,遵循Apple Music、Spotify等主流平台的分法。此外,数据集提供丰富的元数据,包括情绪、氛围、人声性别等,并采用分层标注(Tier A/B)及地区传统子标签,映射出南亚音乐的多样性。
使用方法
数据集通过HuggingFace datasets库易于加载,提供split='train'的parquet格式元数据,不含音频,需用户自行通过YouTube ID获取音频。用户可利用filter方法筛选已标注子集或特定流派(如Lok Dohori),亦可通过SQL控制台或DuckDB进行高效查询,而无需下载全量数据。训练或评估时,需注意遵循建议的Opus 48k mono 24 kHz转码规格,且鉴于艺术家不重叠划分的缺失,应避免使用随机划分进行评估,以防数据泄漏。
背景与挑战
背景概述
MoodWave音乐标注数据集(MoodWave Music Tagging)由研究者Anuj Paude等人于近期构建,旨在填补多语言音乐信息检索领域对印地语和尼泊尔语音乐曲库支持的空白。该数据集包含6,624首曲目、总计625小时的音频元数据,涵盖英语、印地语、尼泊尔语等多种语言,并设计了分层级的音乐流派体系(如Tier A的通用风格与Tier B的地区传统风格),以更精确地反映南亚音乐的多样性。其核心研究问题在于如何超越传统以英语为中心的音频标注范式,为低资源语言音乐提供可靠的标签体系,并强调避免将“宝莱坞”等非音乐性标签误设为流派。该数据集对多语言音乐信息检索、自动标注及跨文化音乐理解研究具有重要推动作用。
当前挑战
该数据集面临多方面的挑战。首先,领域问题在于多语言音乐标注的复杂性,尤其是印地语和尼泊尔语音乐在现有模型中表现不佳,需要更细致的流派划分和语言-流派解耦,以避免偏见。其次,构建过程中的挑战尤为显著:数据采集需从YouTube等平台枚举官方频道,并过滤大量非音乐内容(首次过滤中19%为非音乐),同时处理艺术家名称歧义和版权限制。标注环节依赖于多源证据(如iTunes、Last.fm等)的交叉验证,但尚未覆盖印地语和尼泊尔语部分,导致标签不完整。此外,数据集缺乏按艺术家分割的数据,随机分割会引入艺术家身份泄漏,影响评估可靠性。最后,情绪标签弱,音频-only模型对印地语情绪的F值最高仅58%,且“Romantic”等抒情性类别难以映射到情感空间,限制了情感分析的准确性。
常用场景
经典使用场景
MoodWave Music Tagging数据集以其多语种音乐标注为核心,为音频分类与音乐信息检索领域提供了独特的基准资源。其经典使用场景聚焦于训练与评估针对印地语、尼泊尔语及英语音乐流派的自动分类模型,尤其适用于解决现有系统对南亚音乐表现不佳的问题。研究者可借助其精细的标签体系(如Tier A的全球性风格与Tier B的区域传统类别)开展跨语言音乐理解研究,验证特征提取与迁移学习策略在异构音乐文化中的泛化能力。该数据集的元数据结构,包括YouTube标识与内容哈希,支持灵活的实验设计,如基于音频内容的去重与检索任务,成为多语种音乐标注研究的重要参考。
实际应用
实际应用中,MoodWave Music Tagging可用于构建音乐推荐系统与流媒体服务的个性化功能,尤其针对南亚用户群体,提升对本地音乐内容的识别与推荐精度。其标注体系支持按情绪、语言、起源区域等维度检索,助力音乐库的组织与发现。媒体平台可借此优化播放列表生成、音乐搜索排序及内容标签化流程,增强用户体验。由于仅发布元数据,该数据集也推动了基于YouTube等平台的大规模音频获取与处理的实践,为工业界在版权合规下的数据利用提供了范例。
衍生相关工作
该数据集的发布已催生多项衍生研究,如在多语种音乐分类中引入更鲁棒的特征表征学习,探索语言与流派解耦的模型架构。其独特的分类法启发了后续工作,如针对非西方音乐传统的专用标注体系构建,以及模糊边界(如Devotional与Lok Geet)的声学特征分析。未来可能的工作包括艺术家分离的数据划分方法,以缓解身份泄露,以及结合歌词的跨模态情感分析,克服纯音频在情绪标注上的局限。这些衍生方向共同拓展了音乐信息检索的边界,推动了面向多元文化背景的AI系统发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务