遇见数据集

mcht67/Polyphonic-BirdSet-train

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个综合性的鸟类声音音频数据集,包含多个配置变体,主要用于鸟类声音识别、分类和声景分析。数据集包含以下主要配置:1. HSN_noise:包含带噪声的鸟类声音片段,用于测试噪声环境下的识别性能;2. HSN_polyphonic_6和HSN_polyphonic_8:模拟多只鸟类同时发声的多音场景,支持最多6或8个声源,包含噪声和无噪声版本,并提供了多种预训练音频模型的嵌入特征(如BirdNET、VGGish、YAMNet、Perch等);3. HSN_segments:提供鸟类声音的原始片段,用于基础训练和评估;4. HSN_soundscape_test:用于声景测试的鸟类声音数据;5. NES_noise:包含来自NES(可能指北美鸟类声音)的噪声数据。数据集特征包括音频文件、鸟类物种标签(使用eBird代码、属、物种组、目分类)、多标签支持、地理坐标(经纬度)、时间戳、音频技术参数(频率范围、信噪比、增益等)、录音设备信息和许可证信息。数据集已划分为训练集、验证集和测试集,适用于机器学习模型训练和评估,特别是在生物声学和生态监测领域。

This dataset is a comprehensive collection of bird sound audio data with multiple configuration variants, primarily designed for bird sound recognition, classification, and soundscape analysis. The dataset includes the following main configurations: 1. HSN_noise: Contains bird sound clips with noise for testing recognition performance in noisy environments; 2. HSN_polyphonic_6 and HSN_polyphonic_8: Simulate polyphonic scenarios with multiple birds vocalizing simultaneously, supporting up to 6 or 8 sound sources, including noisy and noise-free versions, and providing embeddings from various pre-trained audio models (e.g., BirdNET, VGGish, YAMNet, Perch); 3. HSN_segments: Provides raw bird sound segments for basic training and evaluation; 4. HSN_soundscape_test: Bird sound data for soundscape testing; 5. NES_noise: Includes noise data from NES (likely referring to North American bird sounds). Dataset features include audio files, bird species labels (using eBird codes, genus, species group, order classification), multi-label support, geographic coordinates (latitude and longitude), timestamps, audio technical parameters (frequency range, SNR, gain, etc.), recording device information, and license details. The dataset is split into training, validation, and test sets, making it suitable for machine learning model training and evaluation, particularly in bioacoustics and ecological monitoring applications.

提供机构:
mcht67
搜集汇总
数据集介绍
mcht67/Polyphonic-BirdSet-train 数据集图片
构建方式
Polyphonic-BirdSet-train数据集源自HSN与NES两大生态声学监测项目,旨在为鸟鸣多标签分类与声场景分析提供标准化训练资源。其构建流程首先从原始长录音中提取5秒片段,通过人工标注与算法过滤获取干净的单源鸟鸣事件,随后基于时频边界与信噪比参数,将不同物种的叫声片段在数字音频工作站中按预设的多声部等级(如6声部或8声部)进行混合,并叠加真实环境噪声,最终生成具有精确标注的复调音频样本。
特点
该数据集的核心特色在于其精细的层级化标注体系,每个样本不仅包含物种级别的ebird_code多标签,还提供属、科、目等分类学元数据,以及声谱图的时频边界坐标。尤为突出的是,对于复调配置下的每个声源,数据集均保留了原始音频、归一化增益、相对电平与时间偏移等参数,使得声源分离与信号级分析成为可能。此外,数据划分严格遵循训练、验证与测试集分离的原则,确保模型评估的客观性。
使用方法
研究人员可通过HuggingFace Datasets库加载特定配置(如'HSN_polyphonic_6'或'HSN_polyphonic_8')以获取不同复杂度的复调数据。使用时,可直接访问'audio'字段获取混合音频波形,通过'birdset_code_multilabel'获取全局多标签,或利用'sources_audio'与'sources_time_freq_bounds'进行声源分离任务。数据集还预计算了多种主流音频嵌入(如VGGish、YAMNet、Perch等),方便用户直接进行特征提取或迁移学习。
背景与挑战
背景概述
Polyphonic-BirdSet-train数据集是鸟类声学监测领域的重要资源,由相关研究团队构建,旨在解决多声部鸟类鸣叫的自动识别问题。该数据集基于HSN和NES等子集创建,整合了音频、时间频率边界、多标签分类信息(如ebird_code_multilabel)及多种环境噪声配置,为研究复杂声学场景下的鸟类物种识别提供了标准化基准。自发布以来,该数据集推动了生物声学与机器学习交叉领域的发展,尤其在多标签分类、声音事件检测及噪声鲁棒性研究方面产生了深远影响,成为评估模型在真实野外环境中泛化能力的关键工具。
当前挑战
该数据集面临的核心挑战包括:1)领域问题层面,多声部鸟鸣信号在时频域高度重叠,背景噪声(如风声、虫鸣)常淹没目标声音,使得精确检测与分类极具难度,传统单标签方法难以应对这种多源混合场景;2)构建过程中,需从海量野外录音中人工标注并合成不同信噪比(SNR)与多声部程度的样本(如polyphony_degree参数),确保数据真实性与多样性,同时平衡类别分布和噪声类型,这对标注成本和质量控制提出了严峻考验。
常用场景
经典使用场景
Polyphonic-BirdSet-train 数据集在生态声学与计算鸟类学领域占据重要地位,其核心用途在于训练和评估多标签鸟鸣识别模型。该数据集包含了精心标注的音频片段,每个片段可能同时包含多种鸟类的鸣叫声,且提供了丰富的元数据如物种、鸣叫类型及声学特征边界。研究者利用其在嘈杂自然环境中进行多声源鸟种分类,这是单标签数据集难以企及的挑战。经典的使用方式是将音频特征提取后输入深度学习架构,以预测同时出现的鸟类种类,从而推动复杂声学场景下的物种自动监测技术发展。
解决学术问题
该数据集针对性地解决了自然声景中多物种共存时鸟鸣重叠检测与识别的学术难题。在传统研究中,鸟鸣识别多局限于纯净或单源音频,而现实生态录音常表现出高度的多声源混杂特性。Polyphonic-BirdSet-train 通过提供已知混合程度的多标签标注数据,使研究者能够探索声源分离、多标签分类以及弱监督学习等前沿技术。其意义在于促进了对复杂声学环境理解的理论深化,例如量化环境噪声对识别鲁棒性的影响,同时为生态学中的生物多样性评估提供了更可靠的自动化工具,极大地提升了大规模声学监测的科学价值。
衍生相关工作
围绕 Polyphonic-BirdSet-train 衍生出一系列具有影响力的研究成果。其中,多标签鸟鸣识别模型如基于卷积神经网络和变换器架构的分类器成为基准方法;声源分离工作如利用 U-Net 或时间-频率掩码技术从混合音频中提取单个鸟种的鸣叫,极大增强了训练数据的可解释性。此外,包括 BirdNet 在内的预训练模型在该数据集上微调后,展现出跨物种和跨地域迁移的强大能力。后续研究中,该数据集也被用作评估弱监督学习算法的平台,催生了如自监督表示学习和多任务学习策略在环境声学领域的创新应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务