遇见数据集

Archit00/bbench-dep-djtransgan-pipeline

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

我们收集了两个数据集来训练我们提出的方法:从Livetracklist收集的DJ混音集和从MTG-Jamendo-Dataset收集的单个EDM曲目。具体来说,我们内部从Livetracklist收集了长的DJ混音集,并且只考虑带有混音标签的混音集以确保质量。此外,我们从MTG-Jamendo-Dataset中选择了单个EDM曲目,即在整个集合中带有EDM标签的曲目。关于使用这两个数据集训练模型的详细信息在第3.1节中描述;如果您感兴趣,请查看。不幸的是,由于许可问题,我们无法提供训练数据集以重现结果。但是,我们发布了训练代码和预训练模型供您尝试。

# DJtransGAN:基于可微音频效果与生成对抗网络(Generative Adversarial Networks, GAN)的自动DJ过渡(数据生成流水线) > 本仓库包含论文《基于可微音频效果与生成对抗网络的自动DJ过渡》的代码实现,该论文收录于2022年IEEE国际声学、语音与信号处理会议(ICASSP 2022),作者为Bo-Yu Chen、Wei-Han Hsu、Wei-Hsiang Liao、Marco A. Martínez-Ramírez、Yuki Mitsufuji、Yi-Hsuan Yang,论文链接:https://arxiv.org/abs/2110.06525 ## 概述 本仓库包含DJtransGAN的数据生成流水线代码,该流水线是DJtransGAN的核心组成部分。完成数据集生成后,请参考[DJtransGAN](https://github.com/ChenPaulYu/DJtransGAN)仓库进行模型训练或部署。完整的流水线包含三个用于生成可混音对的模块,以及一个独立的混音片段生成脚本: 1. 特征提取:节拍与强拍追踪(beat & downbeat tracking)、调性估计(key estimation)与结构边界检测(structure boundary detection) 2. 可混音性评估(mixability estimation):结合音乐规则与神经网络筛选可混音的音频片段对 3. 对齐处理:针对每分钟节拍数(Beats Per Minute, BPM)、调性与提示区域(cue region)进行对齐,确保片段可完美混音 此外,若需查看更多音频示例,请访问我们的演示页面:https://paulyuchen.com/djtransgan-icassp2022/ ## 数据集 我们收集了两个数据集用于训练所提出的方法:来自[Livetracklist](https://www.livetracklist.com/)的DJ混音集,以及来自[MTG-Jamendo-Dataset](https://github.com/MTG/mtg-jamendo-dataset)的独立电子舞曲(Electronic Dance Music, EDM)音频片段。 具体而言,我们从Livetracklist中自主收集长时长DJ混音集,并仅保留带有混音标签的数据集以保障混音集质量;同时从MTG-Jamendo-Dataset中筛选带有EDM标签的音频片段作为独立曲目。关于使用这两个数据集训练模型的详细细节,请参见论文3.1节。 遗憾的是,由于版权许可问题,我们无法公开用于复现实验结果的训练数据集。不过我们已开源训练代码与预训练模型供您试用。若有其他问题,请联系作者或提交拉取请求。 ## 环境配置 ### 安装依赖 pip install -r requirements.txt ### 配置外部依赖 我们使用[music puzzle game](https://github.com/remyhuang/music-puzzle-games)完成可混音性评估模块,因此请首先克隆该仓库并将其重命名为`music_puzzle_games`: git clone https://github.com/remyhuang/music-puzzle-games.git music_puzzle_games ### 配置文件 接下来,请在`pipeline/config/settings.py`中配置全局参数,其中最重要的是设置`TRACK_DIR`与`MIX_DIR`的路径: 1. `TRACK_DIR`:存放EDM音频片段集的目录,请将所有EDM曲目放置于`{TRACK_DIR}/audio`路径下。 2. `MIX_DIR`:存放DJ混音集及其提示点的目录,请将所有混音音频放置于`{MIX_DIR}/audio`路径下,并提供元数据文件`{MIX_DIR}/meta.json`,其中需包含各混音片段的提示点(仅需标注切换点,即cue out点)。本仓库提供了示例文件供您参考格式。 ## 使用方法 我们在`examples/`与`script/`目录中提供了多个用于数据生成与流水线单模块使用的示例脚本,若需使用或修改代码,请先查阅这些示例。 ### 可混音对生成 若要生成可混音对,需按顺序运行两个脚本。首先运行`script/create_segment.py`,该脚本将对EDM音频片段集进行分段并提取相关特征: python create_segment.py [--feature=(bool, 示例值: 1)] [--stem=(bool, 示例值: 1)] [--segment=(bool, 示例值:1)] [--n_core=(int, 示例值: 5)] [--n_gpu=(int, 示例值: 0)] - `--stem`:指定是否预先缓存音源分离结果以辅助乐器检测,加快后续训练速度。 - `--feature`:指定是否预先缓存特征提取结果,加快后续训练速度。 - `--n_core`:指定使用的多处理器核心数。 - `--n_gpu`:指定使用的GPU编号。 随后运行`script/create_pair.py`以筛选适配的可混音音频片段对: python create_pair.py [--match=(str, 可选值: None, all, nn, rule)] [--n_sample=(int, 示例值: 10)] [--n_core=(int, 示例值: 4)] - `--match`:指定可混音性评估的方法: - None:随机选取一个片段作为匹配结果 - rule:仅基于音乐规则筛选片段,并随机选取一个作为匹配结果 - nn:基于神经网络(取自[music puzzle game](https://github.com/remyhuang/music-puzzle-games)的SEN模型)选取匹配片段 - all:先基于音乐规则筛选片段,再通过神经网络选取匹配片段 - `--n_core`:指定使用的多处理器核心数。 - `--n_sample`:指定可混音性评估的最大采样数,以加快训练速度。 ### 混音片段生成 若要训练DJtransGAN,还需要专业DJ混音作为参考供GAN学习。此时可运行`script/create_mix.py`生成此类数据,请确保已向`MIX_DIR`提供必要的素材: python create_mix.py [--n_core=(int, 示例值: 4)] - `--n_core`:指定使用的多处理器核心数。 ## 引用 若您在工作中使用了本仓库的代码,请引用我们的论文: @inproceedings{chen2022djtransgan, title={"Automatic DJ Transitions with Differentiable Audio Effects and Generative Adversarial Networks"}, author={Chen, B. Y., Hsu, W. H., Liao, W. H., Ramírez, M. A. M., Mitsufuji, Y., & Yang, Y. H.}, booktitle={ICASSP}, year={2022}} ## 致谢 本仓库的工作完成于索尼集团(Sony Group Corporation)的实习期间,感谢索尼的导师Wei-Hsiang Liao、Marco A. Martínez-Ramírez与Yuki Mitsufuji的悉心指导,同时感谢同事Wei-Han Hsu与中央研究院的指导老师Yi-Hsuan Yang。本研究成果为索尼集团与中央研究院的合作成果。在此谨向所有提供支持的同仁致以诚挚谢意。此外,请访问索尼的优秀AI研究仓库:https://github.com/sony/ai-research-code,以及他们在ISMIR 2022上发表的最新工作《FxNorm-automix》与《distortionremoval》。 ## 许可证 Copyright © 2022 Bo-Yu Chen 本项目基于MIT许可证(以下简称“许可证”)分发。除非符合许可证要求,否则您不得使用本软件包。您可通过以下链接获取许可证副本: https://opensource.org/licenses/MIT 除非适用法律要求或书面同意,根据许可证分发的软件均按“按原样”基础提供,不附带任何明示或暗示的担保或条件。有关许可证下的具体权限与限制,请参阅许可证文本。

提供机构:
Archit00
搜集汇总
数据集介绍
Archit00/bbench-dep-djtransgan-pipeline 数据集图片
构建方式
该数据集的构建根植于自动DJ混音领域对可混音音乐对的需求,其流程整合了音乐信息检索与深度学习技术。首先从Livetracklist采集带有混音标签的长DJ混音集,并从MTG-Jamendo数据集中筛选出电子舞曲曲目,以确保数据质量与风格一致性。随后依次执行特征提取、可混音性估计与对齐三个核心步骤:特征提取涵盖节拍与强拍跟踪、调性估计及结构边界检测;可混音性估计结合音乐规则与神经网络筛选出适合混音的音乐片段对;对齐环节则对速度、调性与提示区域进行精确调整,以保障片段间的无缝衔接。
使用方法
使用该数据集需先配置环境,安装依赖并克隆music-puzzle-games外部包以支持可混音性估计。用户需在配置文件中设定TRACK_DIR与MIX_DIR路径,分别存放电子舞曲曲目和带有提示点的混音集。数据生成分为两步:首先运行create_segment.py脚本对曲目进行分段与特征缓存,随后运行create_pair.py脚本依据随机、规则、神经网络或组合策略匹配可混音片段对。若需训练DJtransGAN模型,还需运行create_mix.py脚本生成参考混音数据。所有脚本均支持多进程与GPU加速参数,便于用户根据计算资源灵活调整。
背景与挑战
背景概述
电子舞曲(EDM)的自动化混音过渡是音乐信息检索与生成领域的前沿课题。2022年,由台湾大学、中央研究院与索尼集团联合提出的DJtransGAN模型,发表于ICASSP会议,旨在利用可微分音频效果与生成对抗网络实现专业级DJ过渡。该数据集为DJtransGAN的数据生成流程,包含节拍跟踪、调性估计、结构边界检测及可混音性评估等模块,通过从Livetracklist和MTG-Jamendo-Dataset收集混音集与独立EDM曲目,构建了用于训练与评估的配对样本。该工作不仅推动了自动DJ混音技术的发展,也为音乐生成与音频效果的可微分建模提供了重要基准。
当前挑战
该数据集所应对的核心领域问题在于自动DJ过渡的复杂性与主观性:如何从任意两首EDM曲目中精准识别可混音片段,并生成流畅、富有创意的过渡效果。构建过程中面临多重挑战:首先,混音配对需满足节拍、调性、结构及能量等多维度音乐规则,传统方法难以量化;其次,由于版权限制,原始训练数据无法公开,导致结果复现困难;此外,数据生成流程依赖多步骤特征提取与神经网络评估,计算成本高昂,且需处理不同来源数据的格式与标注不一致问题。这些挑战共同构成了自动DJ混音系统研究与数据集构建的主要障碍。
常用场景
经典使用场景
在自动DJ混音与音乐生成研究领域,该数据集最经典的使用场景在于为基于生成对抗网络的DJ过渡生成模型提供系统化的训练数据。其核心流程涵盖节拍与强拍追踪、调性估计、结构边界检测等特征提取步骤,继而借助音乐规则与神经网络评估曲目间的可混音性,最终通过速度、调性与线索区域对齐实现无缝衔接。研究人员利用此管线批量生成可混音曲目对及专业混音参考,为模型学习真实的DJ过渡模式奠定数据基础。
解决学术问题
针对自动DJ混音研究中长期存在的训练数据匮乏与标注困难问题,该数据集通过自动化管线解决了可混音曲目对的高效构建与专业混音参考生成两大难题。其引入的可微分音频效果与对抗生成框架使得过渡参数能够端到端优化,突破了传统方法依赖手工规则与固定效果的局限。该工作为音乐信息检索与生成模型的交叉研究提供了标准化数据生成范式,推动了智能混音技术从理论探索向可复现实验的演进。
实际应用
在实际应用层面,该数据集支撑的管线可直接服务于智能DJ软件与音乐流媒体平台的自动混音功能开发。通过生成高质量的可混音曲目对与参考混音,系统能够辅助用户快速创建个性化混音集,降低专业DJ操作的技术门槛。同时,该管线亦可嵌入音乐制作工具中,为电子舞曲创作者提供智能过渡建议与效果参数推荐,提升创作效率与作品连贯性。
数据集最近研究
最新研究方向
在自动DJ混音领域,基于可微分音频效果与生成对抗网络(GAN)的端到端过渡生成正成为前沿方向。DJtransGAN数据集通过构建包含特征提取、可混音性估计与对齐的流水线,为训练模型提供了关键数据基础,推动了智能混音系统从规则驱动向数据驱动范式转变。其结合节拍、调性及结构边界信息,并利用神经网络筛选可混音对,显著提升了过渡的自然度与音乐性。该工作不仅为ICASSP等会议所关注,也激发了后续对可微分效果链与生成模型联合优化的研究,对音乐信息检索与生成式音频处理领域具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务