Polyphonic-BirdSet-train
收藏官方服务:
资源简介:
该数据集是一个多配置的鸟类音频数据集,专门用于鸟类声音检测、分类和声景分析研究。数据集包含多个子集,主要涵盖北美地区鸟类物种的音频录音。每个样本包含音频数据(采样率多为22050Hz或32000Hz)以及丰富的元数据标注,包括鸟类学分类信息(eBird代码、科学名称、通用名称、属、物种组、目)、音频片段的时间频率边界、地理坐标(经纬度)、录音时间、设备信息、许可证和录音者等。部分配置专门设计用于多音源混合(polyphony)场景,模拟自然界中多种鸟类同时鸣叫的复杂声景,并包含噪声添加和信噪比控制,适用于鲁棒性音频识别研究。数据集提供了训练、验证和测试分割,规模从数千到数万音频样本不等。适用于机器学习任务,如音频事件检测、多标签鸟类声音分类、声源分离和生态声学分析。
创建时间:
2026-05-19
原始信息汇总
数据集 Polyphonic-BirdSet-train 详情
数据集概述
该数据集包含多个配置(config_name),主要围绕鸟类声音识别、多声部混合音频和声音景观测试等任务设计。
配置与子集
1. HSN_noise
- 用途:包含噪声标注的音频数据,用于单标签和多标签分类。
- 划分:仅包含
test_5s测试集,共 3303 个样本。 - 数据集大小:约 135.6 MB。
- 主要特征:
audio:音频数据。ebird_code:单标签分类,含 21 种鸟类代码。ebird_code_multilabel:多标签分类,支持同一音频包含多种鸟类。- 元数据:包括时间、频率、位置(
lat,long)、录音设备(microphone)、许可证(license)等。
2. HSN_polyphonic_6
- 用途:6声部多声部混合音频,适用于多声部分离与识别。
- 划分:
train:7821 个样本validation:975 个样本test:975 个样本
- 数据集大小:约 1.54 GB。
- 主要特征:
audio、no_noise_audio、noise_audio:混合、纯净及噪声音频。polyphony_degree:多声部度数(固定为6)。source_0_audio至source_5_audio:6个独立声源音频。sources_birdset_code、sources_ebird_code、sources_scientific_name、sources_common_name:各个声源的鸟类编码与名称。snr_dB:信噪比。- 音频率采样率:22050 Hz。
3. HSN_polyphonic_8
- 用途:8声部多声部混合音频,扩展至8个声源。
- 划分:
train:5813 个样本validation:727 个样本test:727 个样本
- 数据集大小:约 103.5 GB。
- 主要特征:
- 与 HSN_polyphonic_6 类似,但具有8个声源(
source_0_audio至source_7_audio)。 - 包含预提取的嵌入向量:来自多个模型的音频嵌入,如:
- BirdNet V2.3
- VGGish
- Perch 8
- YAMNet
- Beans Baseline
- EfficientNet-B1-BirdSet-XCL
- Bird-MAE-Huge
- AudioProtoPNet-20-BirdSet-XCL
- AST-Birdset-XCL
- Wav2Vec2-Base-BirdSet-XCL
- 每个模型均提供
audio_spatial_embeddings和audio_pooled_embeddings。
- 与 HSN_polyphonic_6 类似,但具有8个声源(
4. HSN_segments
- 用途:音频片段数据,用于单标签分类。
- 划分:
train:4852 个样本validation:607 个样本test:607 个样本
- 数据集大小:约 52.4 MB。
- 主要特征:
audio:音频数据(bytes,path,sampling_rate)。time_freq_bounds:音频片段时间-频率边界。birdset_code、ebird_code、scientific_name、common_name:鸟类标识。segment_duration_s:片段时长。
5. HSN_soundscape_test
- 用途:声音景观测试数据,用于评估模型在真实环境中的表现。
- 划分:仅包含
test_5s测试集,共 8689 个样本。 - 数据集大小:约 357.3 MB。
- 主要特征:
audio:音频数据(采样率 32000 Hz)。- 与 HSN_noise 类似的多标签分类(
ebird_code_multilabel)、元数据(位置、录音设备等)。 - 包含
genus(属)、species_group(种类群)、order(目)等分类标签。
6. NES_noise
- 用途:包含噪声标注的音频,覆盖不同鸟类种类。
- 主要特征:
ebird_code:单标签分类,含 35 种鸟类代码。genus、species_group、order等分类标签。
分类标签体系
- 鸟类代码(ebird_code):常见鸟类代码,如
gcrfin(灰冠红雀)、whcspa(白冠麻雀)等。 - 属(genus):包括 20 个属,如
anas(鸭属)、catharus(夜鸫属)。 - 种类群(species_group):分为 14 个组,如
finches, euphonias, and allies(雀类及盟友)、wood-warblers(林莺类)。 - 目(order):分为 4 个目:
anseriformes(雁形目)、charadriiformes(鸻形目)、passeriformes(雀形目)、piciformes(鴷形目)。
数据用途
- 多声部分离与识别:使用 HSN_polyphonic_6 和 HSN_polyphonic_8 进行多源音频分离。
- 单标签分类:使用 HSN_segments 和噪声子集进行鸟类种类识别。
- 多标签分类:使用 HSN_noise 和 HSN_soundscape_test 进行场景中的多物种识别。
- 声音场景分析:使用 HSN_soundscape_test 评估模型在真实环境中的泛化能力。
- 嵌入学习:HSN_polyphonic_8 提供多种预训练模型的嵌入特征,便于迁移学习或特征提取。
搜集汇总
数据集介绍

构建方式
Polyphonic-BirdSet-train数据集旨在解决鸟类鸣声多标签分类与多声部分离的挑战,其构建源于对自然声景中复杂声学场景的模拟。该数据集以HSN(Heterogeneous Soundscape Noise)和NES(Noise Events)等配置为基础,通过从原始BirdSet数据中提取纯净的鸟类声音片段,并依据预设的多声部程度(如6声部或8声部),将其与背景噪声进行可控的混合。构建过程中,每个样本均保留了源音频、噪声音频、混合音频及其对应的声学参数,包括信噪比、增益、时频边界等,同时为每条源音频标注了鸟类物种代码与分类学信息,从而形成了一个高度可控且信息完备的多声部数据集。
使用方法
使用Polyphonic-BirdSet-train数据集时,研究人员可通过HuggingFace Datasets库直接加载不同配置(如HSN_polyphonic_6或HSN_polyphonic_8),并利用其预分词的结构快速访问音频和元数据。针对多标签分类任务,可直接使用birdset_code_multilabel字段作为训练目标;对于源分离任务,则可借助sources_audio字段获取各个独立声源的波形。数据集的训练、验证与测试划分已明确给出,便于进行标准化评估。预提取的声学嵌入(如VGGish、EfficientNet-B1等)可直接用于迁移学习或特征分析,无需重新计算,从而显著降低计算开销并加速实验流程。
背景与挑战
背景概述
Polyphonic-BirdSet-train数据集由国际鸟类声学与生态研究团队创建,旨在解决复杂声学场景中多物种鸟类声音识别这一核心研究问题。该数据集通过精密的音频处理技术,从自然录音中分离并合成多音轨鸟声片段,涵盖21种鸟类,并提供了丰富的元数据,如声谱图边界、信噪比及环境噪声等。自发布以来,该数据集为鸟鸣声学生态监测、生物多样性评估及机器学习模型评估提供了标准化基准,推动了下游任务如多标签分类与声源分离的快速发展,显著提升了自动化生态监测系统的鲁棒性与精度。
当前挑战
该数据集面临的核心挑战在于构建过程中需解决真实野外录音中多物种声音重叠、环境噪声干扰及信噪比动态变化等复杂声学难题。具体而言,数据集的创建需精确合成具有可控复音度的混合音频,同时保留原始声源的时间-频率结构,这对声源分离技术与噪声建模能力提出严苛要求。此外,规范化评估框架的设计需兼顾多标签标注的歧义性、类间分布不均衡及声学特征的可迁移性,确保模型在跨地域、跨季节应用时保持一致性性能,从而为生态学长期监测提供可靠技术支撑。
常用场景
经典使用场景
在生态声学与生物多样性监测领域,Polyphonic-BirdSet-train数据集被广泛用于多标签鸟鸣事件检测与物种识别任务。该数据集精心构建了包含不同信噪比及多至八种鸟类同时鸣叫的复杂声景片段,为模型在噪声环境下从多源重叠音频中精准分离并识别特定鸟种提供了理想的训练与评测基准。其经典使用方式涵盖多标签分类、声音事件检测以及源分离等子任务,尤其适合评估深度学习模型在模拟真实野外混响与背景干扰条件下的泛化能力。
解决学术问题
该数据集直面传统鸟声识别研究中的两大瓶颈:一是真实声景中多种鸟类鸣叫重叠导致的标注困难与模型混淆,二是环境噪声对识别精度的显著干扰。通过提供精心混合的多声源音频及其对应的精确时频边界、物种标签与信噪比参数,Polyphonic-BirdSet-train使得研究者能够量化计算模型在复杂多标签场景下的表现,进而推动声音事件检测与多源分离技术向更契合野外生态监测需求的方向演进。它填补了高水平噪声条件下多物种同时识别的标准评测空白。
实际应用
在实际应用中,Polyphonic-BirdSet-train训练的模型可直接用于部署在野外自动录音设备上,实现对大范围鸟类种群的实时远程监测。这类系统能够从录制的连续声景中自动解析出不同鸟种的鸣叫时段与频次,支持生态学家高效完成种群密度估算、迁徙规律追踪以及栖息地利用分析。此外,该数据集也为智能农业中的害虫鸟类驱赶、机场附近鸟群预警、以及城市生物多样性评估等跨领域需求提供了坚实的算法基础。
数据集最近研究
最新研究方向
在生态声学与生物多样性监测领域,Polyphonic-BirdSet-train数据集正引领着多物种重叠鸣声识别的前沿探索。该数据集精心构建了从简单到高度复杂的多声部鸟鸣场景,尤其关注嘈杂环境下的源分离与多标签分类任务,为突破传统单物种检测的局限提供了关键性基准。当前研究热点聚焦于利用深度神经网络,如Transformer与对比学习架构,在HSN_polyphonic配置上实现精准的声源解混与物种共现建模。这一方向直接呼应了全球生物多样性监测自动化与实时化的迫切需求,其意义在于推动被动声学监测系统从实验室走向真实的复杂野外环境,为生态保护决策提供可靠的声学指纹数据支撑。
以上内容由遇见数据集搜集并总结生成



