moodwave-music-tagging
收藏资源简介:
MoodWave Music Tagging 是一个多语言音乐标注数据集,专注于印地语和尼泊尔语曲目,旨在弥补现有音乐模型对这些语言处理不佳的问题。数据集包含 6,624 首曲目,总计 625 小时音频,但本仓库仅提供元数据(不含音频),音频需通过 YouTube ID 自行下载。元数据包含丰富的字段:track_id、youtube_id、audio_sha256(去重键)、title(原始标题)、title_romanized(清洗后的歌曲名)、artist、composer、genre(20 个类别,分 A/B 层级)、tradition(子标签)、language(hi/ne/en 等)、origin_region、is_filmi、mood、vibes、vocal_gender、duration_s 等。目前标注状态为进行中:仅英语部分包含类型标签(1,539 首),其余 5,085 首未标注。语言分布中英语有 1,616 首,其余主要为未标注。类型体系采用两层结构:Tier A 为语言无关的声音类型(如 Pop、Rock、R&B 等),Tier B 为区域传统类型(如 Hindustani Classical、Lok Dohori 等),当前仅标注了 Tier A。数据集适用于音频分类、音乐信息检索、语言识别等任务。使用示例可通过 Hugging Face datasets 库加载,并支持基于 genre 的过滤。注意事项包括:标签不完整、无艺术家无关划分(随机划分会泄漏艺术家身份)、采样偏差(偏向 label 推广内容)、情绪标签较弱。许可证为非商业研究用途。
MoodWave Music Tagging is a multilingual music tagging dataset focusing on Hindi and Nepali tracks, aiming to address the poor performance of existing music models on these languages. The dataset contains 6,624 tracks totaling 625 hours of audio, but this repository only provides metadata (no audio); audio must be downloaded via YouTube IDs. The metadata includes rich fields: track_id, youtube_id, audio_sha256 (dedup key), title (original title), title_romanized (cleaned song name), artist, composer, genre (20 categories in A/B tiers), tradition (sub-tag), language (hi/ne/en etc.), origin_region, is_filmi, mood, vibes, vocal_gender, duration_s, etc. The annotation status is in progress: only English part has genre tags (1,539 tracks), the remaining 5,085 are untagged. Language distribution shows 1,616 English tracks, others mainly untagged. The genre system uses a two-tier structure: Tier A for language-agnostic sound types (e.g., Pop, Rock, R&B, etc.), Tier B for regional traditional types (e.g., Hindustani Classical, Lok Dohori, etc.), currently only Tier A is annotated. The dataset is suitable for tasks such as audio classification, music information retrieval, language identification, etc. Usage examples can be loaded via the Hugging Face datasets library, with filtering support based on genre. Caveats include incomplete labels, no artist-agnostic split (random split leaks artist identity), sampling bias (biased towards label promotion content), and weak mood labels. The license is for non-commercial research use.
数据集概述
MoodWave Music Tagging 是一个面向印地语(Hindi)和尼泊尔语(Nepali)音乐的多语言音乐标签数据集,旨在解决现有音乐模型对这两种语言曲库处理不佳的问题。数据集共包含 6,624 首曲目,总计 625 小时音频。该仓库仅包含元数据,不提供音频文件。
数据集状态
- 当前状态:开发中(Work in Progress)
- 已标注流派:1,539 首(当前仅覆盖英语部分)
- 未标注:5,085 首(等待标注)
- 按语言分布:未标注(5,008 首)、英语(1,616 首)
流派标签体系
Tier A(语言无关的声音风格)
Pop、Rock、Hip-Hop、Electronic、Folk、Jazz、R&B、Classical、Country、Reggae
Tier B(具有独特声学特征的地域传统音乐)
Hindustani Classical、Sufi/Qawwali、Bhajan/Devotional、Ghazal、Bhangra/Punjabi Folk、Lok Dohori、Tamang Selo、Deuda、Nepali Lok Geet、Adhunik
特殊规则
- Bollywood 不视为流派,仅作为电影音乐属性(
is_filmi=true) - Newa Dapha 和 Gunla Bajan 归类为 Nepali Lok Geet,而非 Bhajan/Devotional
genre=Deuda不必然对应language=ne
数据模式(Schema)
主要字段包括:
- 标识:
track_id、youtube_id、audio_sha256(去重键) - 描述:
title(原始标题)、title_romanized(清理后的歌名)、artist、composer - 标签:
genre、genre_tier、tradition(如 salaijo、jhyaure、teej、newa_dapha)、language(支持 hi、ne、en、pa、bho、new、mai、ur、other、instrumental) - 来源:
origin_region(NP/IN/PK/other)、source_channel_id、source_playlist_id - 属性:
is_filmi、film_title、film_industry、release_year、decade、mood、vibes、vocal_gender、is_live、is_instrumental、is_remix、is_cover、duration_s - 标注信息:
label_source、label_confidence、taxonomy_version - 划分:
split(train/unlabelled)
数据收集方法
- 使用
yt-dlp --flat-playlist枚举官方厂牌和艺人频道 - 过滤非音乐内容(时长限制 60–900 秒,首次通过时 19% 为非音乐内容)
- 下载并转码完整音频(Opus 48k 单声道 24 kHz)
- 标注过程:先进行检索(iTunes、Last.fm、MusicBrainz、频道来源),再使用 LLM 协调证据至固定分类体系,仅当 2 个以上独立来源一致时才接受标签
使用方式
python from datasets import load_dataset
ds = load_dataset("anujpaude1/moodwave-music-tagging", split="train") print(ds[0]["title_romanized"], "|", ds[0]["language"], "|", ds[0]["genre"])
仅标注子集
labelled = ds.filter(lambda r: r["genre"] != "")
尼泊尔民间音乐
dohori = ds.filter(lambda r: r["genre"] == "Lok Dohori")
可通过 SQL Console 或 DuckDB 直接查询:
sql SELECT language, genre, count() AS n FROM hf://datasets/anujpaude1/moodwave-music-tagging/data/manifest/train-.parquet WHERE genre != GROUP BY 1, 2 ORDER BY n DESC;
已知限制
- 标签不完整:流派标签目前仅覆盖英语部分
- 无艺人不相交划分:语料基于单一艺人播放列表构建,随机划分会泄露艺人身份信息,导致准确率虚高(Flexer 2007: 75.7% → 58.5%)
- 采样偏差:偏向上传和推广的内容,印地语目录严重偏向 2000 年后的作品
- 情绪标签较弱:仅基于音频的印地语情绪分类 F 值约为 58%
Romantic是歌词层面的分类,在 valence-arousal 空间中无定位,在纯音频模型下会并入 Calm 和 Sad
许可协议
- 标注数据:非商业研究用途
- 底层作品和录音:归权利所有者所有
- 仓库不分发任何音频文件





