遇见数据集

PolyBirdMix

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

该数据集是一个专注于鸟类声音的音频数据集,包含多个配置版本,旨在支持鸟类声音识别、声音事件检测、多声部分离和声景分析等机器学习任务。数据集主要包含以下内容:1) HSN_noise配置:包含3303个测试样本(5秒片段),提供音频、文件路径、时间戳、频率范围、鸟类物种代码(21种北美鸟类)、属名(20个属)、物种组(13组)、目名(4个目)等多层次标签,以及地理位置、录音设备、许可证等元数据。2) HSN_polyphonic配置:包含5813个训练样本、727个验证样本和727个测试样本,专门用于多声部鸟类声音研究,提供原始音频、无噪声音频、噪声音频以及最多8个独立声源的分离音频,包含多标签鸟类ID、信噪比、混合增益等声学参数。3) HSN_segments配置:包含4852个训练样本、607个验证样本和607个测试样本,提供鸟类声音片段及其时间-频率边界、鸟类学信息(eBird代码、学名、俗名)。4) HSN_soundscape_test配置:包含8689个测试样本(5秒片段),结构与HSN_noise类似但规模更大。5) NES_noise配置:包含88种中美洲鸟类物种代码的噪声数据,提供类似的音频和元数据字段。数据集特征丰富,包括音频波形、时间-频率边界、鸟类分类标签(物种、属、组、目)、地理位置、录音元数据、事件检测标注等,适用于监督学习、半监督学习和音频合成任务。

This dataset is an audio dataset focused on bird sounds, containing multiple configurations designed to support machine learning tasks such as bird sound recognition, sound event detection, polyphonic sound separation, and soundscape analysis. The dataset primarily includes the following contents: 1) HSN_noise configuration: Contains 3303 test samples (5-second segments), providing audio, file paths, timestamps, frequency ranges, multi-level labels such as bird species codes (21 North American bird species), genus names (20 genera), species groups (13 groups), order names (4 orders), as well as metadata like geographic location, recording equipment, and licenses. 2) HSN_polyphonic configuration: Contains 5813 training samples, 727 validation samples, and 727 test samples, specifically designed for polyphonic bird sound research, providing raw audio, noise-free audio, noisy audio, and separated audio for up to 8 independent sound sources, including multi-label bird IDs, signal-to-noise ratios, mixing gains, and other acoustic parameters. 3) HSN_segments configuration: Contains 4852 training samples, 607 validation samples, and 607 test samples, providing bird sound segments along with their time-frequency boundaries and ornithological information (eBird codes, scientific names, common names). 4) HSN_soundscape_test configuration: Contains 8689 test samples (5-second segments), with a structure similar to HSN_noise but larger in scale. 5) NES_noise configuration: Contains noise data with 88 Central American bird species codes, providing similar audio and metadata fields. The dataset is rich in features, including audio waveforms, time-frequency boundaries, bird classification labels (species, genus, group, order), geographic locations, recording metadata, event detection annotations, etc., and is suitable for supervised learning, semi-supervised learning, and audio synthesis tasks.

创建时间:
2026-07-03
原始信息汇总

数据集 PolyBirdMix 概述

数据集基本信息

  • 数据集名称:PolyBirdMix
  • 数据集链接:https://huggingface.co/datasets/mcht67/PolyBirdMix
  • 数据集配置:包含5个子配置(config_name),分别为 HSN_noise、HSN_polyphonic、HSN_segments、HSN_soundscape_test、NES_noise。

子配置详情

1. HSN_noise

  • 用途:HSN(High Sierra Nevada)区域的带噪声鸟类音频数据集。
  • 数据特征:包含 audio、filepath、start_time、end_time、low_freq、high_freq、ebird_code(21个类别)、ebird_code_multilabel、ebird_code_secondary、call_type、sex、lat、long、length、microphone、license、source、local_time、detected_events、event_cluster、peaks、quality、recordist、genus(20个类别)、species_group(14个类别)、order(4个类别)、genus_multilabel、species_group_multilabel、order_multilabel。
  • 数据划分:仅包含 test_5s 划分,共 3,303 个样本,数据集大小为 135,611,159 字节。
  • 标注信息:提供鸟类物种(ebird_code)、属(genus)、物种组(species_group)、目(order)的多标签分类标注,以及时间频率边界、事件聚类、峰值、质量等信息。

2. HSN_polyphonic

  • 用途:HSN区域的多声部混合鸟类音频数据集,包含原始音频和混合过程信息。
  • 数据特征:包含 id、audio(采样率22050Hz)、no_noise_audio、noise_audio、segment_duration_s、polyphony_degree(多声部程度)、birdset_id_multilabel、snr_dB(信噪比)、orig_noise_file、noise_norm_gain、noise_gain、relative_mix_level_dB、mix_gain、source_0_audio 至 source_7_audio 共8个声源音频、sources_audio、sources_time_freq_bounds、sources_birdset_id、sources_ebird_code、sources_scientific_name、sources_common_name、sources_original_birdset_subset、sources_original_file、sources_segment_duration_s、sources_norm_gain、sources_relative_level_dB、sources_gain、sources_time_shift_s。
  • 数据划分
    • train:5,813 个样本,数据集大小 1,026,699,093.41 字节
    • validation:727 个样本,数据集大小 126,248,151 字节
    • test:727 个样本,数据集大小 129,200,410 字节
  • 标注信息:包含每个声源的鸟类代码、学名、通用名、原始子集、原始文件、持续时间、归一化增益、相对电平、增益、时间偏移等详细信息。

3. HSN_segments

  • 用途:HSN区域的鸟类音频片段数据集。
  • 数据特征:包含 audio(二进制格式)、time_freq_bounds、birdset_id、ebird_code、scientific_name、common_name、original_birdset_subset、original_file、segment_duration_s。
  • 数据划分
    • train:4,852 个样本,数据集大小 44,169,831 字节
    • validation:607 个样本,数据集大小 5,286,297 字节
    • test:607 个样本,数据集大小 5,596,710 字节
  • 标注信息:提供鸟类物种标识、科学名称、通用名称、来源子集、原始文件路径、片段持续时间等。

4. HSN_soundscape_test

  • 用途:HSN区域的声音景观测试数据集。
  • 数据特征:与 HSN_noise 特征结构相同,包含 audio(采样率32000Hz)、filepath、start_time、end_time、low_freq、high_freq、ebird_code(21个类别)、ebird_code_multilabel、ebird_code_secondary、call_type、sex、lat、long、length、microphone、license、source、local_time、detected_events、event_cluster、peaks、quality、recordist、genus(20个类别)、species_group(14个类别)、order(4个类别)、genus_multilabel、species_group_multilabel、order_multilabel。
  • 数据划分:仅包含 test_5s 划分,共 8,689 个样本,数据集大小 357,332,944 字节。

5. NES_noise

  • 用途:NES(Neotropical Ecosystem Soundscapes)区域的带噪声鸟类音频数据集。
  • 数据特征:与 HSN_noise 特征结构类似,但 ebird_code 类别不同,包含 89 个鸟类物种类别(ebird_code 名称如 littin1、grhcha1 等),genus 包含 72 个属类别。
  • 数据划分:仅提供特征定义,未在描述中列出具体划分信息。
  • 标注信息:提供物种、属、物种组、目的多标签分类,以及时间频率边界、事件聚类、峰值、质量等信息。
搜集汇总
数据集介绍
PolyBirdMix 数据集图片
构建方式
PolyBirdMix数据集通过整合来自北美及新热带区的多种鸟类声学记录构建而成,包括HSN(北美鸣禽)和NES(新热带区雀形目鸟类)等子集。该数据集采用精细化的音频处理流程,将原始野外录音分割为短时片段,并人工标注其起止时间、频率范围及鸟种EBird代码。特别地,数据集提供了多声部混合的合成样本,通过将纯净鸟鸣信号与背景噪声以设定的信噪比进行数字化叠加,生成了不同多声性等级的训练实例,从而模拟真实环境中的复杂声学场景。
特点
PolyBirdMix具有显著的层次化与多标签特性,每个音频片段不仅关联单一的鸟种标签,还提供同一声景下的次要鸟种、属级分类及物种类群的多标签标注。数据集涵盖21种北美鸟种与89种新热带区鸟种,并细分为鸦科、鹪鹩科、森莺科等多个生态类群。其独特之处在于提供原始单源音频与混合后音频的配对样本,且详细记录了各声源的时频边界、增益系数及时间偏移等声学参数,为研究鸟类声学信号分离与多标签识别提供了理想基准。
使用方法
研究人员可通过HuggingFace Datasets库直接加载PolyBirdMix,支持按HSN_noise、HSN_polyphonic、NES_noise等不同配置名称获取特定子集。对于深度学习任务,建议使用HSN_polyphonic配置中的多声部混合音频及其源分离标注,可结合spec-augment等数据增强技术进行鸟种识别模型训练。数据集已预先划分好训练集、验证集与测试集,其中HSN_segments配置提供了纯净的鸟鸣片段,适合作为声学特征提取与单标签分类的基础数据源。
背景与挑战
背景概述
PolyBirdMix数据集由加拿大蒙特利尔大学等机构的研究人员创建,旨在解决鸟类声音识别领域的多声部复杂场景问题。该数据集通过模拟不同信噪比和重叠程度的鸟类多声部混合音频,为评估声学事件检测与分类算法提供了标准化的基准平台。其核心研究问题聚焦于在自然噪声和多种鸟类同时鸣叫条件下,如何提升模型对特定鸟种声音的鲁棒性识别能力。该数据集的发布推动了生物声学领域中多标签分类与语音分离技术的发展,尤其为深度学习模型在真实环境噪声下的性能验证提供了重要支撑。
当前挑战
鸟类声音识别面临的首要挑战是自然声景中频繁出现的多声部重叠现象,传统单标签分类模型难以处理同一时间窗口内多种鸟类同时发声的复杂场景。构建过程需精心设计不同信噪比(-6dB至20dB)和多声部程度(2至8重唱)的混合策略,同时确保每个独立声源的起始时间、频率边界和增益系数等参数可精确控制。数据增强中的噪声匹配(如HSN与NES环境噪声)与声源归一化处理需平衡振幅差异,避免因预处理引入的伪影干扰模型对原始声学特征的提取。此外,涵盖近90种鸟类的多层级分类体系要求在属、种、群体等多个粒度上保持标注的一致性与完整性。
常用场景
经典使用场景
在生态声学与生物多样性监测领域,PolyBirdMix数据集为多物种鸟类鸣声的识别与分离研究提供了理想的基准平台。该数据集精心设计了多组配置,涵盖嘈杂环境下的单一声源切片、可控信噪比的复调混合音频,以及源自不同地理区域的完整声景片段,尤其适用于评估模型在复杂声学环境中对同域鸣唱鸟类的辨识能力。研究者可借助其精细标注的物种标签、时间-频率边界及源分离信号,深入探索多标签分类、事件检测与声源分离等核心任务的性能边界。
实际应用
在实际生态保护与林业管理中,PolyBirdMix数据集所支撑的技术可直接部署于长期自动化监测站。基于该数据训练的模型能够从海量野外录音中自动识别并追踪珍稀或指示物种的种群动态,极大降低了人工巡护与专家听判的成本。此外,该数据服务于城市噪声影响评估、栖息地质量指示物种的声学调查,以及候鸟迁徙路线的被动式追踪,为制定精细化生物多样性保护策略提供了可量化、可复现的数据驱动工具。
衍生相关工作
PolyBirdMix衍生了一系列极具影响力的科研工作,覆盖音频表示学习与生物声学自监督预训练等领域。例如,基于其多源分离配置,研究人员提出了分层注意力机制与复调解耦网络,显著提升了多标签声学事件检测的精度;同时,该数据集启发了弱监督语义分割框架在声谱图上的迁移应用。更广泛地,它作为BirdSet生态基准的一部分,催生了首个面向鸟类声学大数据集的标准化评估套件,为跨模型、跨国度的可重复对比研究树立了新标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务