遇见数据集

PC-Mix

收藏
Hugging Face2026-07-11 更新2026-07-12 收录
官方服务:

资源简介:

PC-Mix(部分伪造数据集,带语音-环境声音受控混合)是一个用于音频反欺骗研究的开源数据集,专注于部分伪造音频的检测。该数据集通过将来自PartialSpoof v1.2的语音样本与一个自建的部分伪造环境声音池进行受控混合,创建了具有不同语音和环境声音真实性组合的音频样本。原始的真实录音来源于VGGSound和SBCSAE数据集。数据集提供话语级和帧级双重标注:话语级包含5个类别,包括原始真实录音和四种构造混合类型(真实+真实、伪造+真实、真实+伪造、伪造+伪造);帧级标注针对构造混合样本,将每一帧划分为4类(两者均真实、仅语音伪造、仅环境声音伪造、两者均伪造)。数据规模方面,训练集包含25,380个混合样本和12,155个原始样本;评估集包含5个子集(E0-E4),总计约71,000个混合样本和17,809个原始样本,用于测试模型在不同分布外条件下的泛化能力。数据集文件组织为两个主要目录:Mixed_soundsV1.2包含混合音频文件及其标签,按训练/评估分割存储;Partialspoof_background包含源环境声音数据。每个分割都包括协议文件、WAV音频文件和分层标签。由于许可证限制,部分原始音频片段未直接分发,但提供了完整的重建脚本和协议。PC-Mix适用于音频分类、反欺骗、部分伪造检测、音频取证等任务,特别适合研究复杂声学场景中多成分真实性的细粒度分析。

PC-Mix (Partial Spoof Dataset with Controlled Speech–Environmental Sounds Mixing) is an open-source dataset for audio anti-spoofing research, focusing on the detection of partially spoofed audio. It is constructed by controlled mixing of speech samples from PartialSpoof v1.2 with a self-built partially spoofed environmental sound pool, creating audio samples with varying combinations of authenticity in speech and environmental sounds. The original genuine recordings are sourced from the VGGSound and SBCSAE datasets. The dataset provides dual-level annotations: utterance-level includes 5 categories, covering original genuine recordings and four constructed mixture types (genuine+genuine, spoofed+genuine, genuine+spoofed, spoofed+spoofed); frame-level annotations target constructed mixture samples, classifying each frame into 4 categories (both genuine, only speech spoofed, only environmental sound spoofed, both spoofed). In terms of data scale, the training set contains 25,380 mixture samples and 12,155 original samples; the evaluation set comprises 5 subsets (E0-E4), totaling approximately 71,000 mixture samples and 17,809 original samples, designed to test model generalization under various out-of-distribution conditions. The dataset files are organized into two main directories: Mixed_soundsV1.2 contains mixed audio files and their labels, stored by training/evaluation splits; Partialspoof_background contains source environmental sound data. Each split includes protocol files, WAV audio files, and hierarchical labels. Due to licensing restrictions, some original audio segments are not directly distributed, but complete reconstruction scripts and protocols are provided. PC-Mix is suitable for tasks such as audio classification, anti-spoofing, partial spoof detection, and audio forensics, particularly for fine-grained analysis of multi-component authenticity in complex acoustic scenarios.

创建时间:
2026-07-03
原始信息汇总

PC-Mix 数据集概述

基本信息

  • 名称: PC-Mix (Partial Spoof Dataset with Controlled Speech–Environmental Sounds Mixing)
  • 语言: 英语
  • 任务: 音频分类
  • 标签: 音频、反欺骗、部分欺骗音频、环境声音
  • 许可: 非商用研究目的

数据来源

组件 来源 描述
语音 PartialSpoof v1.2 带有部分欺骗标注的语音样本
环境音 自策部分欺骗环境音池 带有受控真实/欺骗组件标注的环境音
原始录音 VGGSound 和 SBCSAE 无人工语音-环境混合的自然录音

数据集划分

训练集

划分 混合样本数 原始样本数 环境音来源 事件来源 融合方式
Train 25,380 12,155 SONYC 60% AudioLDM2;40% UrbanSound8K (0-1秒) Ducking Overlay

评估集

子集 混合样本 原始样本 环境音 事件 融合方式
E0 Baseline 17,812 17,809 SONYC 60% AudioLDM2;40% FSD50K (0-1秒) Ducking Overlay
E1 Generator OOD 14,248 SONYC AudioGen Ducking Overlay
E2 Fusion OOD 14,248 SONYC AudioLDM2 Energy Matching + Crossfade (20-80毫秒)
E3 Environmental Sounds OOD 17,809 DEMAND AudioLDM2 Ducking Overlay
E4 Noise OOD 7,125 WHAM Noise AudioLDM2 Ducking Overlay

标注体系

话语级类别(5类)

类别 名称 语音 环境音 描述
0 Original 自然录音,无人工混合
1 Bona fide + Bona fide 真实 真实 语音和环境音均为真实
2 Spoofed + Bona fide 部分欺骗 真实 语音部分欺骗,环境音真实
3 Bona fide + Spoofed 真实 部分欺骗 语音真实,环境音部分欺骗
4 Spoofed + Spoofed 部分欺骗 部分欺骗 语音和环境音均含部分欺骗区域

帧级类别(4类)

类别 名称 语音 环境音 描述
0 Bona fide frame 真实 真实 两组件均未被欺骗
1 Speech-spoofed frame 欺骗 真实 仅语音组件被局部欺骗
2 Environmental-sound-spoofed frame 真实 欺骗 仅环境音组件被局部欺骗
3 Both-spoofed frame 欺骗 欺骗 两组件均被欺骗

数据结构

解压后数据集包含两个主目录:

  • Mixed_soundsV1.2: 混合语音+环境音音频,含train/eval划分,每个划分包含wav音频、protocol.txt协议文件和NumPy格式的标签文件夹(含speech、env、mix、original_vs_others_seglab子目录),以及PartialSpoof格式的文本标签
  • Partialspoof_background: 源环境音数据,含train/eval划分,包含wav音频、protocol.txt协议文件和标签文件

元数据

每个混合样本关联一个协议条目,记录混合音频ID、语音源、环境音源、混合时长、信噪比、增益/缩放信息和偏移信息。

许可证说明

数据集仅限非商用研究用途。包含多个上游数据集和模型的许可证(CC BY 4.0、CC BY-NC 4.0、CC BY-SA 3.0、CC BY-NC-SA 4.0、CC BY-ND 3.0 US等),用户须遵守所有上游许可条款。其中SBCSAE衍生音频因"禁止修改"条款不直接分发,仅提供重建脚本。

搜集汇总
数据集介绍
PC-Mix 数据集图片
构建方式
PC-Mix数据集以PartialSpoof v1.2中的语音片段为核心,结合自建的具备局部欺骗标签的环境声音池,通过受控的语音与环境声音混合策略构建而成。其中,环境声音来源涵盖SONYC-UST、UrbanSound8K、FSD50K等公开数据集,并借助AudioLDM2与AudioGen等生成模型合成部分事件音频。混合过程采用Ducking Overlay、Energy Matching与Crossfade等多种融合方法,从而生成具有精细粒度标注的局部欺骗音频样本。值得注意的是,源自SBCSAE的原始音频因许可证限制未直接分发,需用户依据提供的脚本与协议本地重建。
特点
该数据集在语音与环境的双重维度上定义了局部欺骗概念,提供语音级与帧级两种粒度的标注体系。语音级包含五个类别,涵盖真实录音与四种不同真实/欺骗组合的混合音频;帧级则进一步细分为四个类别,分别对应无欺骗、仅语音欺骗、仅环境欺骗及两者皆欺骗的帧片段。此外,数据集设计了五个评价子集,分别针对基线场景、生成器分布外、融合方法分布外、环境声音分布外及噪声分布外情境,系统性地评估模型在不同欺骗模式与域偏移下的泛化能力。
使用方法
用户可通过Hugging Face CLI、Git LFS或Python的snapshot_download接口获取数据集压缩包,经zstd解压后得到Mixed_soundsV1.2与Partialspoof_background两个目录。数据集遵循PartialSpoof风格的标签格式,提供文本协议文件与NumPy数组两种标注形式,便于直接用于音频分类或局部欺骗检测任务。由于SBCSAE衍生音频未包含在分发包中,用户需单独获取官方WAV数据,并运行buildSBCori.py与extract_orig_from_mixed_protocol.py脚本完成本地重建。详细的使用流程与脚本参数说明已在GitHub仓库中提供。
背景与挑战
背景概述
PC-Mix数据集由研究人员于2024年构建,旨在应对语音与背景环境声混合场景下的部分伪造音频检测挑战。该数据集创新性地将PartialSpoof v1.2中的部分伪造语音与自标注的环境声池进行受控混合,并引入VGGSound与SBCSAE中的真实录音作为原始样本。通过精细设计五类话语级标签与四类帧级标签,PC-Mix为细粒度伪造检测提供了标准化基准。其发布填补了现有数据集在复杂声学场景中联合检测语音与环境声伪造的空白,对推动音频反欺骗系统的鲁棒性研究具有重要价值。
当前挑战
PC-Mix数据集面临的核心挑战在于模拟真实世界中环境声与语音复合伪造的多样性。具体而言,领域问题方面,现有数据集多聚焦于纯语音或单一环境声伪造,难以应对真实场景中两者同步或交替被篡改的情况,亟需能够区分不同伪造源及其时序位置的数据支撑。构建过程中,研究人员需克服多源音频的标注一致性难题,例如SBCSAE的CC BY-ND许可证限制其派生音频直接分发,需设计协议与脚本供用户本地重建;同时,为确保评估的泛化性,需引入AudioLDM2、AudioGen等多种生成模型模拟环境声伪造,并控制混合方式、信噪比等参数,构建覆盖生成器、融合策略和环境声域外分布的多维度测试集。
常用场景
经典使用场景
PC-Mix数据集为语音与环境声混合的真实性检测任务提供了精细化的实验平台。该数据集将PartialSpoof v1.2中的部分伪造语音与自建的环境声池进行可控混合,构建了五种话语级类别(包括真实录音及四种不同真伪组合的混合音频)与四种帧级类别(分别标识语音、环境声或二者同时被伪造的帧)。研究者可借助其丰富的时序标注信息,开展从话语级别的音频真伪判别到帧级别的细粒度伪造区域定位等经典研究任务,为探究混合音频中多源真伪线索的交互机制奠定了数据基础。
解决学术问题
该数据集致力于解决现有反欺骗研究中普遍忽略环境声对语音真实性影响的学术困境。传统语音反欺骗数据集通常仅关注单一语音通道的伪造检测,而PC-Mix首次将环境声的真伪状态纳入建模框架,填补了部分伪造场景下多模态真实性联合判别的学术空白。通过构建涵盖不同生成模型和融合方式的域外泛化评测子集(如生成器域外、融合方式域外、噪声类型域外),数据集系统性地评估了模型在未见过伪造类型与背景噪声下的鲁棒性,有力推动了对混合音频中语音和环境声伪造交互机制的深入理解。
衍生相关工作
基于PC-Mix数据集的设计理念,一系列相关的学术工作正在或即将展开。在算法层面,研究者可基于其帧级双分量标签开发多任务学习框架,同步检测语音与环境声的局部伪造区域;在特征层面,双流网络或交叉注意力机制可用于捕捉语音与环境声之间的真伪一致性特征。此外,数据集划分的五个域外泛化评测子集(E0至E4)为评估模型对未知生成模型(如AudioGen)、不同混合策略(如能量匹配与交叉淡入淡出)及未见噪声类型(如DEMAND、WHAM!)的适应性提供了标准化基准,催生了面向鲁棒反欺骗的更多迁移学习与域适应方法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务