人工数据集
收藏资源简介:
该人工数据集是由剑桥大学音乐与科学中心的研究人员创建的,用于训练卷积神经网络识别Hip-Hop音乐中的样本。数据集通过从非商业音乐录音中提取人声、和声和打击乐元素,并对原始音频的变体进行训练。该数据集涵盖了从四个开放获取数据库中收集的35,000段音乐录音,经过音频源分离和一系列音频效果处理后,形成了989,184个训练窗口,用于模型的训练和验证。数据集的构建旨在解决Hip-Hop音乐中样本自动识别的问题,服务于音乐发现和理解。
This artificial dataset was developed by researchers at the Centre for Music and Science, University of Cambridge, to train convolutional neural networks for sample recognition in Hip-Hop music. The dataset extracts vocal, harmonic and percussion elements from non-commercial music recordings, and conducts training on variants of the original audio. It encompasses 35,000 music recordings collected from four open-access databases. After undergoing audio source separation and a series of audio effect processing steps, the dataset generates 989,184 training windows for model training and validation. The dataset is constructed to address the problem of automatic sample identification in Hip-Hop music, serving music discovery and understanding.
Panako Sample ID 数据集概述
数据集名称
Panako Sample ID
数据集简介
Panako Sample ID 是一个围绕 Panako 的轻量级包装器,用于计算 Sample ID 项目中使用的音轨的平均精度(mAP)。
数据集要求
- Python 3: 任何版本均可,无需额外依赖。
- Panako 安装: Panako 需要安装并可通过命令行访问,通过运行
panako命令进行测试。
使用说明
- 按照 Git 仓库中的说明安装 Panako(Panako Git 仓库)。
- 测试命令行是否可以访问 Panako,通过运行
panako命令,如果有输出则表示安装成功。 - 将 Sample ID 项目的音频文件放置在
audio目录中。这些文件应标记为T001.wav、T002.wav等(用于查询和候选音轨)或X001.wav、X002.wav等(用于噪声音轨)。文件命名必须遵循 Van Balen et al. (2011) 附录中给出的顺序。 - 确保安装了 Python(无需依赖)并运行
python runme.py。
数据集处理
脚本会将所有候选和噪声音轨存储在数据库中,然后查询所有查询音轨,并使用我们论文中提到的修改计算每个音轨的平均精度。

- 1Automatic Identification of Samples in Hip-Hop Music via Multi-Loss Training and an Artificial Dataset剑桥大学音乐与科学中心 · 2025年



