遇见数据集

Duet Dataset (基于DAMP-VSEP)

收藏
arXiv2026-08-15 更新2026-08-18 收录
官方服务:

资源简介:

该数据集基于DAMP-VSEP构建,专为多歌手混合场景下的目标歌手提取任务设计。通过DNSMOS质量过滤和语音活动检测,从原始录音中提取干净歌声片段,并剔除噪音和干扰。为解决真实二重唱样本不足问题,将不同歌手录音配对并与背景音乐混合,生成约5.6万条合成二重唱训练样本,同时保留559条原始二重唱作为测试集。数据集旨在评估歌手知情分离方法在多歌手场景下的性能,提升目标歌手提取的准确性和感知质量。

This dataset is built upon DAMP-VSEP, and is specifically designed for the target singer extraction task in multi-singer mixed scenarios. Clean singing voice segments are extracted from original recordings via DNSMOS quality filtering and Voice Activity Detection (VAD), while noise and interference are removed. To address the shortage of real duet samples, recordings from different singers are paired and mixed with background music to generate approximately 56,000 synthetic duet training samples, while 559 original duet samples are reserved as the test set. This dataset aims to evaluate the performance of singer-informed source separation methods in multi-singer scenarios, and enhance the accuracy and perceptual quality of target singer extraction.

创建时间:
2026-08-15
原始信息汇总

Singer-Informed Vocal Source Separation 数据集项目概述

项目简介

该项目是一个面向歌唱者感知的歌声源分离(Singer-Informed Vocal Source Separation)完整实验流程仓库,涵盖数据集构建、歌声活动过滤、歌唱者嵌入学习以及基于Open-Unmix的分离模型。

核心流程阶段

  1. 数据准备:从原始歌声录音构建独唱和合唱混合数据。
  2. 质量过滤与VAD:使用DNSMOS进行录音质量过滤,并基于能量的语音活动检测提取有效歌声片段。
  3. 歌唱者嵌入:训练歌唱者嵌入模型或使用预训练嵌入。
  4. 数据划分:将数据分为训练集、验证集和测试集。
  5. 嵌入预计算:预计算歌唱者嵌入,用于条件化分离模型。
  6. 分离模型训练与评估:训练歌唱者条件的Open-Unmix模型,或使用预训练检查点进行评估。

仓库结构

目录 功能
data_preparation/ 数据集构建(独唱和合唱生成)
VAD/ DNSMOS过滤与基于能量的VAD
singer_embedding/ 歌唱者嵌入模型及训练脚本
prepare_trainvalidtest_data/ 数据集划分工具
open-unmix-pytorch/scripts 修改后的Open-Unmix实现

预训练模型

歌唱者嵌入模型

  • Clean Embedding:在高质量过滤数据上训练
    • 下载链接:https://drive.google.com/file/d/1DTzLtKgtxBdwuOD5D4K8b9Ugj8PSN-EA/view?usp=drive_link
  • Noisy Embedding:在未过滤数据上训练
    • 下载链接:https://drive.google.com/file/d/1LXj0Af3beXb4sgcQL4iJ6QuitASixRiG/view?usp=drive_link

分离模型(Open-Unmix变体)

FiLM 条件化模型:

  • FiLM(无 λ):https://drive.google.com/drive/folders/1jrpADqXGYaeFwhDy-35bcHKq5MUHaidy?usp=drive_link
  • FiLM(λ=0.05):https://drive.google.com/drive/folders/18ZQs5OJDzcSDQviJdjKW45OxjJHtUTDo?usp=drive_link
  • FiLM(λ=0.1):https://drive.google.com/drive/folders/1Ie_yzfhz0VCFS4GC136Rq3YXnqYPHD7_?usp=drive_link
  • FiLM(λ=0.2):https://drive.google.com/drive/folders/1pzFy2GGWJNywCIIafwrj-tH8O7bBkG94?usp=drive_link

Concatenation 条件化模型:

  • Concatenation(无 λ):https://drive.google.com/drive/folders/183kVl-I_jRTlwCZC9aG3cGQkDdzIwPsT?usp=drive_link
  • Concatenation(λ=0.05):https://drive.google.com/drive/folders/1HnImboaTn7XREHJZ2fxHBnrrGY9Pf5EH?usp=drive_link
  • Concatenation(λ=0.1):https://drive.google.com/drive/folders/1ovJF41lq71FhCwD44qRHkrAr_bX3_ki3?usp=drive_link
  • Concatenation(λ=0.2):https://drive.google.com/drive/folders/1nQxKw8JM1teJa5ZS2WEw4oTFoAkes57F?usp=drive_link

技术特点

  • 基于Open-Unmix的修改版本(原始实现:https://github.com/sigsep/open-unmix-pytorch)
  • 新增歌唱者条件分离模型
  • 支持Concatenation和FiLM两种条件化变体
  • 提供SI-SDR训练脚本
  • 包含嵌入预计算脚本
搜集汇总
数据集介绍
Duet Dataset (基于DAMP-VSEP) 数据集图片
构建方式
Duet Dataset基于DAMP-VSEP构建,该原始数据集包含大量用户生成的歌唱录音,但缺乏干净的歌唱音轨和多歌手混合样本。构建流程首先利用DNSMOS非侵入式质量评估器对录音进行筛选,剔除含有背景音乐或失真的音轨,阈值设为3.0,得到14,381条独唱和6,389条二重唱录音。随后,采用基于能量的语音活动检测(VAD)提取歌唱片段,仅保留时长超过3秒的片段作为注册音频候选。为增加训练数据的多样性,通过将不同歌手的独唱录音与相同伴奏混合,生成额外的合成二重唱样本,每个锚歌手配对10位不同的伴唱歌手,共生成55,780个二重唱训练样本。数据集按8:1:1划分训练、验证和测试集,其中测试集仅包含原始真实的二重唱录音。
特点
该数据集的核心特点在于支持歌手身份感知的多歌手分离任务,解决了传统数据集中缺乏多歌手混合样本的问题。通过质量过滤和VAD处理,确保了注册音频的纯净性和歌唱片段的完整性。合成二重唱样本的引入显著扩充了训练数据,同时保持伴奏音量低于人声,以模拟真实场景中的混合比例。测试集采用真实二重唱录音,评估模型在真实世界条件下的泛化能力。此外,数据集提供了非重叠的注册音频和混合信号,确保注册信息与混合内容无交叉污染,为歌手嵌入学习提供了可靠条件。
使用方法
数据集的使用方法如下:在训练阶段,模型接收混合音频和注册音频作为输入,通过歌手嵌入网络提取身份向量,并利用该向量对分离模型进行条件调制。用户需预先训练一个歌手嵌入模型,用于从注册音频中提取固定维度的身份表示。在推理时,给定一个二重唱混合信号和目标歌手的注册音频,模型输出目标歌手的分离音轨。建议使用SI-SDR作为训练损失,并可选地加入残差重建损失以提升干扰抑制效果。评估时应同时使用SI-SDR和FAD指标,以全面衡量分离质量。代码与预训练模型已公开于GitHub仓库,便于复现实验。
背景与挑战
背景概述
Duet Dataset 是由美国伊利诺伊大学厄巴纳-香槟分校的 Jocelyn Xu 与 Minje Kim 于2026年构建的多歌手混合歌声分离数据集。该数据集基于 DAMP-VSEP 大规模用户生成歌唱录音,经 DNSMOS 质量筛选、语音活动检测及非重叠注册片段提取等流程,并配对生成合成二重唱样本,最终形成 55,780 个训练混合片段及真实场景测试集。其核心研究问题在于实现歌唱者感知的二重唱歌声分离,即利用目标歌手的短语音嵌入引导模型从混合信号中提取指定人声。该数据集填补了多歌手场景下条件化歌声分离研究的空白,为音乐源分离领域提供了首个支持身份条件化的二重唱基准,显著推动了相关方向的发展。
当前挑战
该数据集面临的挑战呈现多维性。从领域问题来看,传统歌声分离系统多假设单一歌手,难以应对多歌手在时频域的重叠,且歌声在不同音高、音色及表达方式上的高度变异性使得身份信息建模尤为困难。从数据集构建角度而言,DAMP-VSEP 虽规模宏大,但缺乏跨歌曲的歌手标识,且用户生成内容混有背景音乐噪声,需依赖 DNSMOS 严格阈值过滤,导致可用二重唱样本锐减至 6,389 首;同时,注册片段与混合片段的重叠污染风险要求精细的 VAD 分割与不重叠选取,加之原始二重唱素材有限,迫使研究者通过合成配对扩充数据,然而合成样本与真实录音间的分布差异仍对模型的泛化性能构成潜在制约。
常用场景
经典使用场景
该数据集主要服务于音乐源分离领域,尤其是多歌手混合场景下的目标歌手提取任务。通过提供包含注册片段的二重唱音频,研究者能够训练和评估歌手条件性分离模型,该模型利用短时注册音频学习歌手嵌入,从而在混合信号中精确分离指定歌手的声部。经典的实验设置包括单人独唱和双人合唱,评估指标采用SI-SDR和FAD,以全面衡量分离的准确性和感知质量。
实际应用
该数据集的实际应用前景广阔,其核心场景包括音乐混音编辑、卡拉OK伴唱生成、以及音乐内容个性化处理。在音乐制作中,音乐制作人可利用此技术从现有录音中提取并替换某位歌手的声部,而无需重新录制。此外,该技术还可用于歌曲翻唱创作,自动提取原唱歌手声部并替换为翻唱者声音,为数字音频工作站和在线音乐平台提供高效的自动化工具。
衍生相关工作
该数据集的构建流程和歌手条件性分离框架催生了多项衍生工作。其基于DAMP-VSEP的数据过滤与二重唱混合生成策略为后续研究提供了可靠的数据准备范式。同时,所提出的歌手嵌入与FiLM条件机制结合的模型架构,启发了后续关于多歌手分离的生成式方法探索,如基于扩散模型的零样本二重唱分离等。这些衍生工作共同推动着音乐源分离向更精细的歌手级分离方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务