遇见数据集

HaramMusic_Dataset

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

HaramMusic Dataset v19 是一个用于二元音频分类的数据集,任务是将音频样本区分为音乐(标签为 1)和其他所有非音乐内容(标签为 0)。数据集包含 246,319 个音频样本,具体类别分布为:语音(speech)189,386 个,音效(sfx)56,681 个,音乐(music)252 个,而环境音(ambience)和人类声音(human)数量为 0。所有音频均以 16kHz 单声道 FLAC 格式提供,并采用 CC0/CC-BY 许可协议。该数据集适用于音乐检测、音频分类等任务,支持多语言场景。

The HaramMusic Dataset v19 is a dataset for binary audio classification, tasked with distinguishing audio samples as music (label 1) and all other non-music content (label 0). It contains 246,319 audio samples, with the following class distribution: speech (189,386), sfx (56,681), music (252), while ambience and human are 0. All audio is provided in 16kHz mono FLAC format and licensed under CC0/CC-BY. This dataset is suitable for music detection, audio classification, and other tasks, supporting multilingual scenarios.

创建时间:
2026-08-10
原始信息汇总

数据集概述

HaramMusic Dataset v20 是一个用于二元音频分类任务的数据集,旨在区分音乐(标签为1)与非音乐内容(标签为0)。该数据集采用 CC-BY-4.0 许可协议,支持多语言,主要应用于音乐检测与音乐去除场景。

数据构成

数据集共包含 248,318 条音频样本,具体类别分布如下:

类别 标签 数量
语音 (speech) 0 189,386
音乐 (music) 1 2,251
音效 (sfx) 0 56,681
环境声 (ambience) 0 0
人声 (human) 0 0

其中,非音乐样本(标签0)主要来自语音和音效类别,音乐样本(标签1)数量为 2,251 条,存在明显的类别不平衡现象。

音频规格

  • 格式:16kHz 单声道 FLAC
  • 来源许可:仅使用 CC0 或 CC-BY 许可的音频素材

使用方式

该数据集支持流式加载,可通过 Hugging Face datasets 库直接使用,示例代码如下:

python from datasets import load_dataset ds = load_dataset("doirty/HaramMusic_Dataset", split="train", streaming=True)

搜集汇总
数据集介绍
HaramMusic_Dataset 数据集图片
构建方式
HaramMusic_Dataset是一套专为二元音频分类任务设计的数据集,旨在区分音乐信号与非音乐信号。该数据集汇聚了多元来源的音频样本,涵盖语音、音效、环境声及音乐等类别,其中音乐样本标注为1,其余类别统一标注为0。所有音频均经过标准化处理,统一为16kHz采样率的单声道FLAC格式,并严格筛选自CC0或CC-BY许可的公开资源,确保了数据使用的合规性与广泛性。通过精细的类别平衡策略,尽管音乐样本相对稀少,但整体数据规模达到248,318条,为模型训练提供了坚实的基础。
特点
该数据集的核心特点在于其清晰的二元分类架构与丰富的非音乐样本构成。具体而言,语音与音效类别占据了绝大多数非音乐样本,分别达189,386条与56,681条,而环境声与人类声音类别虽有预设但未包含实际样本。这种分布不仅强化了模型对语音与音乐差异的辨识能力,也适应了实际应用中常见的干扰场景。此外,数据集的许可策略与流式加载支持,使其兼具合法性与高效性,特别适合大规模音频分类模型的训练与评估,尤其在音乐检测与移除任务中展现出显著的实用价值。
使用方法
在运用该数据集时,研究者可通过HuggingFace的datasets库便捷地获取数据。推荐采用流式模式加载,以应对大规模数据带来的内存压力,示例代码为`load_dataset("doirty/HaramMusic_Dataset", split="train", streaming=True)`。加载后,数据集可直接用于训练音频分类模型,其中标签0代表非音乐(包括语音、音效等),标签1代表音乐。鉴于音乐样本占比相对较低,建议在使用时考虑类不平衡问题,可结合重采样或加权损失函数等措施优化模型性能,从而精准实现音频流中音乐片段的自动识别与剔除。
背景与挑战
背景概述
HaramMusic_Dataset,一个由doirty于近期构建的二元音频分类数据集,专为音乐检测任务而生。其核心研究问题在于精准区分音乐声与非音乐声,涵盖了语音、音效等多元音频环境。该数据集采用CC0/CC-BY许可,汇集了逾24.8万条16kHz单声道FLAC音频样本,其中音乐样本占比虽小,却为模型训练提供了宝贵的有标注数据。此数据集的问世,为音频分类领域注入了新的活力,尤其在宗教或文化敏感性考量下,对音乐内容的自动识别与过滤具有重要实践意义,推动了音频内容理解与管控技术的发展。
当前挑战
该数据集所面临的挑战颇具层次,首当其冲的便是领域问题的复杂性——音乐检测需应对多样化的音频特征、混音背景及跨语言普遍性,易与带节奏的语音或音乐化音效混淆,对分类模型的鲁棒性提出严苛要求。其次,构建过程中的难点在于数据的不平衡性,音乐样本仅占总数的0.9%,导致模型易偏向多数类,需借助过采样或加权损失策略予以缓解。再者,数据来源的版权限制确保了纯净性,却制约了采集规模,而标注质量的一致性亦是一大考验。综上,HaramMusic_Dataset在解决实际问题的同时,也为数据工程实践提供了深刻的经验与启示。
常用场景
经典使用场景
HaramMusic_Dataset作为二分类音频数据集,其核心应用场景聚焦于音乐与其余音频类别的鉴别。在音频模态理解领域,该数据集为训练鲁棒的音乐检测器提供了大规模、多样化的样本,涵盖语音、音效与环境声等负样本,使模型能够精准捕捉音乐信号的声学特征。其典型的任务包括基于音频帧或短片段判定是否存在音乐成分,广泛应用于自动内容审核、广播监测及多媒体检索中。
解决学术问题
该数据集有效解决了音乐检测任务中数据来源单一、规模不足及标注噪声的学术难题。通过汇集CC0/CC-BY许可的多语言音频,实现了正负样本的合理配比,并采用统一格式(16kHz单声道FLAC)降低预处理偏差。它为研究者提供了一个标准化基准,支持对比不同模型架构的性能,推动音频分类技术在限定资源下的效率与泛化能力研究,同时为音频事件检测的后续探索奠定数据基础。
衍生相关工作
该数据集的衍生工作多见于音乐分离、音频事件标记及教学研究。研究者常以其为基准训练前端检测器,进而驱动音乐源分离模型的迭代,如在混合音频中先定位音乐片段再执行分离。同时,该数据集也被用于对比研究不同特征提取方法(如MFCC、预训练音频嵌入)的优劣,并启发了针对长尾分布、类别不平衡的改进策略。部分工作将其与更大规模语料结合,探索半监督学习在音频分类中的应用,促进了领域内知识迁移与模型可解释性的探讨。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务