SPARCO-project/benchmark-noise_ablation
收藏资源简介:
该数据集包含从LibriSpeech test-clean干净语音和两种干扰类型生成的固定长度噪声语音混合:50% DEMAND环境背景噪声和50%生成的白噪声。数据集专为SPARCO噪声消融实验设计,包括基于AUROC的SAE噪声相关特征选择、二元噪声存在评分器训练、评分器阈值校准和最终保留基准评估。数据来源包括LibriSpeech ASR语料库(CC BY 4.0许可)和DEMAND噪声数据库(需验证许可)。生成配置:采样率16000 Hz,剪辑长度4.0秒,DEMAND/白噪声比例约为50%/50%,SNR选择为5、10、15、20 dB,并在每个分割内按噪声类型×SNR分层平衡。数据集分为三个部分:feature_scorer_train用于特征选择和评分器训练,scorer_val用于阈值校准,benchmark_test仅用于最终评估。文件包括metadata.csv、scorer_examples.csv、mixtures/音频混合和clean/干净目标音频。
许可证:其他 语言: - 英语 标签: - 音频 - 降噪 - 噪声消融 - LibriSpeech - DEMAND - 白噪声 - SPARCO 任务类别: - 音频到音频 - 音频分类 展示名称:benchmark-noise_ablation 样本规模类别: - 1K<n<10K # 噪声消融基准数据集 本数据集包含从LibriSpeech `test-clean` 清洁语音中生成的定长带噪语音混合样本,共涵盖两类干扰源: - 50%的DEMAND环境背景噪声 - 50%的人工生成白噪声 本数据集专为SPARCO噪声消融实验设计,可用于以下任务: - 基于AUROC的SAE噪声相关特征选择 - 二元语音存在评分器训练 - 评分器阈值校准 - 最终留出基准评估 ## 数据来源 ### 清洁语音 - LibriSpeech自动语音识别语料库test-clean划分集 - 来源:https://www.openslr.org/12 - 许可证:根据OpenSLR声明,采用CC BY 4.0协议 ### 背景噪声 - DEMAND:多样环境多通道声学噪声数据库(Diverse Environments Multichannel Acoustic Noise Database) - 作者:Joachim Thiemann、Nobutaka Ito、Emmanuel Vincent - DOI:10.5281/zenodo.1227121 - 来源:https://zenodo.org/records/1227121 ### 白噪声 - 通过固定随机种子编程生成。 ## 重要许可证声明 本数据集为衍生数据集,包含LibriSpeech与DEMAND音频的混合样本。 LibriSpeech由OpenSLR发布,采用CC BY 4.0协议。DEMAND的许可证信息需从其原始Zenodo页面及相关文档中核实。DEMAND的元数据或文档可能采用知识共享署名4.0(CC BY 4.0)和/或知识共享署名-相同方式共享3.0未移植(CC BY-SA 3.0)协议。鉴于此类协议歧义,本数据集卡片保守采用如下设置: yaml license: other 用户在进行重新分发、商业使用或发布修改后的衍生作品前,应核实适用的许可证条款。若DEMAND衍生音频需遵循共享相似(ShareAlike)协议,则衍生混合样本需遵循兼容的ShareAlike条款。 ## 生成配置 - 清洁语音来源:仅采用LibriSpeech test-clean划分集 - 采样率:16000 Hz - 片段长度:4.0秒 - 各划分集的DEMAND/白噪声占比:约50% / 50% - 信噪比(SNR)可选值(dB):5、10、15、20 - 信噪比分配:各划分集内按噪声类型×信噪比进行分层平衡 - 清洁语音划分:按说话人互不重叠划分 - DEMAND噪声划分:继承自`benchmark_DEMAND_noise`数据集 针对推荐的信噪比集合`[5, 10, 15, 20]`,各划分集在8个单元格上实现平衡: | 噪声类型 | 5 dB | 10 dB | 15 dB | 20 dB | |---|---:|---:|---:|---:| | DEMAND | 平衡分布 | 平衡分布 | 平衡分布 | 平衡分布 | | 白噪声 | 平衡分布 | 平衡分布 | 平衡分布 | 平衡分布 | ## 数据集划分 | 划分名称 | 用途 | |---|---| | feature_scorer_train | AUROC特征选择+语音存在评分器训练 | | scorer_val | 评分器阈值校准/模型检查点选择 | | benchmark_test | 仅用于最终留出基准评估 | 请勿将`benchmark_test`划分集用于特征选择、评分器训练、阈值调优、K值选择或干预强度选择。 ## 文件说明 - `metadata.csv`:每条混合样本对应一行元数据 - `scorer_examples.csv`:二元语音存在评分器示例样本 - `mixtures/`:带噪语音混合样本文件夹 - `clean/`:清洁语音目标文件夹,采用与混合样本一致的4秒窗口进行裁剪或填充 ### 重要元数据列 - `file_name`:混合音频的相对路径 - `clean_file_name`:清洁语音目标音频的相对路径 - `split`:数据集划分类型,可选`feature_scorer_train`、`scorer_val`或`benchmark_test` - `noise_type`:噪声类型,可选`demand`或`white` - `snr_db`:目标信噪比(dB) - `speaker_id`:LibriSpeech说话人ID - `noise_env`:DEMAND噪声对应的环境类型,白噪声则为`white` - `noise_segment_id`:DEMAND噪声对应的片段ID,白噪声则为生成的随机ID ## 本地加载方法 python from datasets import load_dataset ds = load_dataset("audiofolder", data_dir="./benchmark_noise_ablation_librispeech_demand_white") print(ds) ## 从Hugging Face加载方法 python from datasets import load_dataset ds = load_dataset("SPARCO-project/benchmark-noise_ablation") print(ds) ## 引用声明 若使用本数据集,请引用LibriSpeech与DEMAND相关文献: - LibriSpeech:Vassil Panayotov、Guoguo Chen、Daniel Povey与Sanjeev Khudanpur,2015年。 - DEMAND:Thiemann, J., Ito, N., & Vincent, E. (2013). DEMAND: a collection of multi-channel recordings of acoustic noise in diverse environments. Zenodo. https://doi.org/10.5281/zenodo.1227121



