HaramMusic_Dataset
收藏资源简介:
HaramMusic Dataset v19 是一个用于二元音频分类的数据集,任务是将音频样本区分为音乐(标签为 1)和其他所有非音乐内容(标签为 0)。数据集包含 246,319 个音频样本,具体类别分布为:语音(speech)189,386 个,音效(sfx)56,681 个,音乐(music)252 个,而环境音(ambience)和人类声音(human)数量为 0。所有音频均以 16kHz 单声道 FLAC 格式提供,并采用 CC0/CC-BY 许可协议。该数据集适用于音乐检测、音频分类等任务,支持多语言场景。
The HaramMusic Dataset v19 is a dataset for binary audio classification, tasked with distinguishing audio samples as music (label 1) and all other non-music content (label 0). It contains 246,319 audio samples, with the following class distribution: speech (189,386), sfx (56,681), music (252), while ambience and human are 0. All audio is provided in 16kHz mono FLAC format and licensed under CC0/CC-BY. This dataset is suitable for music detection, audio classification, and other tasks, supporting multilingual scenarios.
数据集概述
HaramMusic Dataset v20 是一个用于二元音频分类任务的数据集,旨在区分音乐(标签为1)与非音乐内容(标签为0)。该数据集采用 CC-BY-4.0 许可协议,支持多语言,主要应用于音乐检测与音乐去除场景。
数据构成
数据集共包含 248,318 条音频样本,具体类别分布如下:
| 类别 | 标签 | 数量 |
|---|---|---|
| 语音 (speech) | 0 | 189,386 |
| 音乐 (music) | 1 | 2,251 |
| 音效 (sfx) | 0 | 56,681 |
| 环境声 (ambience) | 0 | 0 |
| 人声 (human) | 0 | 0 |
其中,非音乐样本(标签0)主要来自语音和音效类别,音乐样本(标签1)数量为 2,251 条,存在明显的类别不平衡现象。
音频规格
- 格式:16kHz 单声道 FLAC
- 来源许可:仅使用 CC0 或 CC-BY 许可的音频素材
使用方式
该数据集支持流式加载,可通过 Hugging Face datasets 库直接使用,示例代码如下:
python from datasets import load_dataset ds = load_dataset("doirty/HaramMusic_Dataset", split="train", streaming=True)




