遇见数据集

PolyBirdMix-new

收藏
Hugging Face2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

该数据集是一个多配置的鸟类声学数据集,专门用于鸟类声音识别与分析任务。数据集包含五个独立配置:HSN_noise、HSN_polyphonic、HSN_segments、HSN_soundscape_test 和 NES_noise。每个配置针对不同的研究场景设计,例如噪声环境下的鸟类检测、多物种重叠鸣叫(polyphonic)合成、纯净鸣叫片段提取以及声景测试。数据核心为音频文件(采样率包括22050 Hz和32000 Hz),并附有丰富的元数据标注,包括鸟类物种代码(ebird_code)、科学名(scientific_name)、通用名(common_name)、时间频率边界(time_freq_bounds)、地理位置(lat, long)、录音设备(microphone)、录音师(recordist)、许可信息(license)以及鸟类分类学信息(属、种组、目)。部分配置支持多标签分类(multilabel字段),适用于同时检测多个物种。数据集规模各异,最大配置(HSN_soundscape_test)包含12000个5秒测试样本,其他配置提供训练、验证和测试分割。该数据集适用于鸟类声音自动识别、声学场景分类、多标签音频事件检测以及生态声学研究。

创建时间:
2026-07-08
原始信息汇总

PolyBirdMix-new 数据集详情

数据集概述

PolyBirdMix-new 是一个多配置的鸟类鸣声数据集,包含五个子配置,分别服务于不同的研究目的,如噪声环境下的鸟声识别、多声部鸟声混合、鸟声分割及声景分析。

数据集配置

1. HSN_noise (HSN噪声子集)

  • 用途:包含带噪声标注的鸟类鸣声片段
  • 数据规模:测试集 3303 个样本,总大小约 135.6 MB
  • 主要特征:音频、文件路径、起止时间、频率范围、鸟类 eBird 代码(21 种)、多标签 eBird 代码、辅助 eBird 代码、叫声类型、性别、地理位置、录音设备、许可证、时间戳、检测事件、聚类信息、峰值、质量、录音师、属、物种组、目
  • 鸟类物种数:21 种,包括 gcrfin(灰冠红雀)、whcspa(白冠麻雀)、amepip(美洲鹨)、sposan(斑唧鹀)、rocwre(岩鹪鹩)、brebla(红翅黑鹂)、daejun(暗眼灯草鹀)、foxspa(狐色麻雀)、clanut(暗冠蓝鸦)、moublu(山蓝鸲)、casfin(卡氏朱雀)、mallar3(绿头鸭)、herthr(隐士夜鸫)、amerob(旅鸫)、yerwar(黄喉地莺)、yelwar(黄林莺)、dusfly(暗纹霸鹟)、mouchi(黑顶山雀)、orcwar(橙冠莺)、warvir(红眼绿鹃)、norfli(普通拟八哥)
  • 属分类:20 个属,如 actitis、anas、anthus、catharus、colaptes、empidonax 等
  • 物种组:14 个物种组,包括 blackbirds、finches、new world sparrows、shorebirds、thrushes、tits、tyrant flycatchers、vireos、wagtails、waterfowl、wood-warblers、woodpeckers、wrens
  • 鸟目:4 个目,包括 anseriformes(雁形目)、charadriiformes(鸻形目)、passeriformes(雀形目)、piciformes(鴷形目)

2. HSN_polyphonic (HSN多声部混合子集)

  • 用途:用于多声部鸟声分离与识别研究,包含混合音频及多个分离源音频
  • 采样率:所有音频均为 22050 Hz
  • 数据划分:训练集 3825 个样本(~768.3 MB)、验证集 478 个样本(~94.7 MB)、测试集 478 个样本(~96.4 MB),总大小约 959.4 MB
  • 主要特征:ID、混合音频、无噪声音频、噪声音频、片段时长、多声部数量(polyphony)、物种多声部分布、多标签 eBird 代码(21 种)、信噪比(snr_dB)、原始噪声文件、噪声归一化增益、噪声增益、相对混合电平、混合增益、12 个源音频(source_0_audio 至 source_11_audio)、源音频序列、源时间频率边界、源数据集 ID、源 eBird 代码、源学名、源通用名、源原始子集、源原始文件、源片段时长、源归一化增益、源相对电平、源增益、源时间偏移
  • 支持最多 12 个源音频:每个样本可包含最多 12 个分离的鸟声源

3. HSN_segments (HSN片段子集)

  • 用途:提供经过分割的干净鸟声片段,适合用于鸟声检测或分类模型训练
  • 数据划分:训练集 4852 个样本(~44.2 MB)、验证集 607 个样本(~5.3 MB)、测试集 607 个样本(~5.6 MB),总大小约 55.1 MB
  • 主要特征:音频、时间频率边界、鸟类数据集 ID、eBird 代码、学名、通用名、原始子集、原始文件、片段时长

4. HSN_soundscape_test (HSN声景测试子集)

  • 用途:用于评估声景场景下的鸟声检测与分类性能
  • 数据规模:测试集 12000 个样本,总大小约 3.84 GB
  • 采样率:32000 Hz
  • 主要特征:文件路径、片段起止时间、音频、多个起止时间序列、低/高频序列、多标签 eBird 代码(21 种)、最小/最大多声部数量

5. NES_noise (NES噪声子集)

  • 用途:另一种噪声环境下的鸟类鸣声数据集,覆盖更广泛的物种
  • 数据规模:测试集,具体样本数未明确,但数据集大小较大
  • 鸟类物种数:89 种,包括 littin1(小蜂鸟)、grhcha1(大尾拟八哥)、colcha1(栗翅鹞)、compau(普通潜鸭)、compot1(普通水鸡)、buvhum1(紫辉尾蜂鸟)、stvhum2(紫冠蜂鸟)、rtlhum(红喉蜂鸟)、andeme1(安第斯鸻)、squcuc1(鳞翅杜鹃)、rebpig1(红嘴鹟)、whtdov(白翅鸽)、gycwor1(灰颈林秧鸡)、roahaw(红尾鵟)、gryhaw2(灰鵟)、trsowl(点斑林鸮)、rinkin1(环翠鸟)、bucmot2(棕翠鴗)、higmot1(高山翠鴗)、rehbar1(红尾鹦鹉)、kebtou1(关键巨嘴鸟)、acowoo(橡树啄木鸟)、hofwoo1(霍夫曼啄木鸟)、linwoo1(线纹啄木鸟)、yehcar1(黄头红鹳)、laufal1(笑隼)、orcpar(橙翅亚马逊鹦鹉)、whcpar(白冠鹦鹉)、brwpar1(褐翅鹦鹉)、whfpar1(白额鹦鹉)、orfpar(橙额鹦鹉)、crfpar(红顶鹦鹉)、oliwoo1(橄榄色啄木鸟)、sthwoo1(南美啄木鸟)、azaspi1(阿扎拉棘雀)、yebela1(黄腹小霸鹟)、goftyr1(金顶小霸鹟)、cotfly1(棉尾霸鹟)、wewpew(西方绿霸鹟)、rumfly1(锈纹霸鹟)、socfly1(社交霸鹟)、grekis(绿鹟)、bobfly1(波霸鹟)、trokin(王鹟)、ducfly(杜氏霸鹟)、lotman1(洛氏霸鹟)、mastit1(大山雀)、rotbec(红嘴绿莺雀)、yetvir(黄喉绿鹃)、blcjay1(黑冠松鸦)、grnjay(绿松鸦)、brnjay(棕松鸦)、melwar1(杂色林莺)、runwre1(棕鹪鹩)、whiwre1(白鹪鹩)、rubwre1(红鹪鹩)、rawwre1(裸眼鹪鹩)、plawre1(平原鹪鹩)、houwre(家鹪鹩)、andsol1(安第斯鸫)、clcrob(黑嘴鸫)、yeceup1(黄冠鹀)、yeteup1(黄喉鹀)、ccbfin(黑头蜡嘴雀)、rucspa1(棕冠麻雀)、wegspa1(草麻雀)、pregrs2(草原雀)、ruboro1(红黄鹂)、monoro1(山黄鹂)、yebori1(黄嘴黄鹂)、melbla1(黑鹂)、grtgra(大鹩哥)、tenwar(鸣莺)、yelwar(黄林莺)、rucwar1(棕冠林莺)、rucwar(棕林莺)、sltred(灰喉蚁鸫)、rcatan1(红冠蚁唐纳雀)、strsal1(条纹盐沼雀)、butsal1(短嘴盐沼雀)、blhsal1(黑头盐沼雀)、banana(香蕉食雀)、yefgra1(黄额裸鼻雀)、flrtan1(火冠唐纳雀)、sibtan2(西蓝唐纳雀)、bugtan(紫唐纳雀)、blctan1(黑冠唐纳雀)、scrtan1(猩冠唐纳雀)、obnthr1(赭胸鸫)
  • 属分类:74 个属,涵盖 amazilia、amazona、aramides、arremon、basileuterus、brotogeris、buteo、campylorhynchus、cantorchilus、catharus 等
  • 物种组:33 个物种组,包括 barbets and toucans、becards、blackbirds、cardinals、chachalacas、cuckoos、falcons、finches、hummingbirds、jays、kingfishers、manakins、motmots、new world sparrows、nightjars、ovenbirds、owls、parrots、pigeons、potoos、rails、reed warblers、tanagers、thrushes、tinamous、tyrant flycatchers (elaenias)、tyrant flycatchers (pewees)、vireos、vultures、wood-warblers、woodcreepers、woodpeckers、wrens
  • 鸟目:13 个目,包括 accipitriformes(鹰形目)、caprimulgiformes(夜鹰目)、columbiformes(鸽形目)、coraciiformes(佛法僧目)、cuculiformes(鹃形目)、falconiformes(隼形目)、galliformes(鸡形目)、gruiformes(鹤形目)、passeriformes(雀形目)、piciformes(鴷形目)、psittaciformes(鹦形目)、strigiformes(鸮形目)、tinamiformes(䳍形目)

数据集总结

PolyBirdMix-new 是一个全面的鸟类鸣声数据集,包含五个不同配置的子集,总数据量超过 4.8 GB。数据集覆盖了从单一噪声场景到多声部混合、从片段分割到完整声景测试的多种任务场景,支持鸟声分类、检测、分离和声景分析等研究。HSN 系列(High Sierra Nevada)共有 21 种鸟类,主要分布在北美西部;NES 系列(Neotropical)共有 89 种鸟类,覆盖新热带区的丰富物种多样性。所有子集均包含丰富的元数据,包括地理位置、录音设备、时间信息、音频特征及多标签分类信息。

搜集汇总
数据集介绍
PolyBirdMix-new 数据集图片
构建方式
PolyBirdMix-new数据集是针对鸟类声学监测与生物多样性研究构建的高质量音频资源。其构建过程涵盖了两种核心场景:一是由原始录音经人工标注后形成的噪声片段与声景测试集,确保数据包含真实野外环境中的背景噪声与多物种共存特征;二是通过可控的音频混合技术,从纯净的鸟鸣片段中生成具有精确信噪比与多声部层次的多源混合音频。具体而言,从HSN和NES两个源中提取带有时频边界、物种标签及生态注释的鸟鸣事件,依据声学兼容性筛选后叠加至背景噪声上,并保留每个独立声源及其增益参数,从而模拟出复杂的自然界多物种合唱情境。
特点
该数据集最为突出的特点在于其精细的多层级标注体系与高度可定制的复音环境模拟能力。每个样本均包含单标签与多标签的鸟类物种代码、属级与科级分类、生态学上的物种群组及目级信息,辅以录音者的地理坐标、录制时间与设备参数,为生态声学分析提供了丰富的维度。同时,复音子集精确记录了各声源的时间偏移、相对增益及混合水平,使得研究者能够独立调整每个物种的音量或频段。此外,数据集中整合了从5秒短片段至完整声景序列的多种时长配置,覆盖了鸟类从雀形目到鸻形目的广泛类群,展现了极高的生物多样性代表性。
使用方法
研究者可通过HuggingFace Datasets库便捷地加载该数据集,并依据任务需求选择不同的配置子集。针对单物种识别任务,推荐使用HSN_noise或NES_noise配置,利用其中丰富的单标签鸟类代码与声学事件边界进行监督学习;而对于多物种共存下的声源分离或弱监督检测研究,HSN_polyphonic配置提供了理想的训练原材料,其清晰的混合参数与独立声源轨道允许用户构建任意信噪比下的混合音频。此外,HSN_soundscape_test配置适用于评估模型在真实声景中的泛化性能,用户只需调用标准的音频加载接口即可获取完整的波形数据及其对应的物种多标签与声学事件时间轴。
背景与挑战
背景概述
PolyBirdMix-new数据集由Helmholtz Munich等研究机构在近期构建,专注于生物声学领域中的多物种鸟鸣识别与分离。该数据集系统性地整合了北美与热带鸟类声学数据,通过精细的时空标注和复调混合技术,为研究复杂声学场景下的鸟类物种识别提供了标准化基准。其核心研究问题在于解决真实野外环境中多鸟种同时鸣叫时的声学源分离与分类难题,对于推动生态声学监测自动化和保护生物学研究具有重要价值。
当前挑战
该数据集所面对的领域核心挑战在于真实声景中多物种鸣叫的高度重叠与背景噪声干扰,导致传统单标签分类方法失效。构建过程中,研究团队需克服鸣叫事件的时间-频率边界精确标注难题,以及不同录音设备、地理环境和信噪比带来的声学特征变异。此外,构建复调混合数据时需确保合成样本的生态真实性,平衡各物种出现频率以避免类别失衡,同时维持声学质量与多样性的统一,这些技术障碍显著提升了数据集的研发难度。
常用场景
经典使用场景
PolyBirdMix-new数据集在生物声学领域扮演着至关重要的角色,尤其适用于多物种鸟鸣的自动识别与分离研究。该数据集精心设计了包含多种噪声背景和复调配置的音频片段,为训练和评估深度学习模型提供了标准化的基准。其经典使用场景包括单标签与多标签的鸟类物种分类任务,以及基于混合音频的源分离任务。研究者能够利用其中丰富的鸟鸣片段和环境噪声混合样本,系统性地探究模型在不同信噪比、复调程度及噪声类型下的鲁棒性能。通过提供带有精确时空频率边界和物种标签的声学事件,该数据集为构建高精度的被动声学监测系统奠定了数据基础,推动了生态学研究中自动识别的技术边界。
衍生相关工作
基于PolyBirdMix-new数据集衍生出多项具有奠基意义的经典研究,推动了生物声学深度学习领域的快速发展。其中,基于该数据集的复调特性,研究者开拓了多标签鸟鸣分类任务,并提出了融合注意力机制的卷积循环网络和Transformer架构,极大地提升了对重叠声学事件的辨识精度。音频源分离方向也涌现了大量工作,例如利用U-Net和扩散模型实现端到端的鸟鸣分离,显著超越了传统非负矩阵分解方法的性能。此外,该数据集还催生了自监督预训练和跨物种迁移学习等前沿范式的探索,使得模型能够在数据稀少的鸟类监测任务中快速适应,为低资源生态声学应用提供了有效解决方案。
数据集最近研究
最新研究方向
PolyBirdMix-new数据集依托其精细标注的多标签层级分类体系(涵盖物种、属、类群及目级分类阶元),为生物声学领域的前沿研究提供了极具价值的实验基底。当前,该数据集正被广泛用于推进复杂自然声景中的多物种重叠鸣声分离与识别任务,尤其聚焦于嘈杂环境下的鲁棒性模型训练及多声源盲源分离算法的发展。这一方向与全球生物多样性监测的自动化趋势紧密相关,通过提升被动声学监测对混叠信号的处理能力,显著增强了对鸟类群落动态及栖息地健康评估的时空分辨率,为生态保护决策提供了可量化、可复现的数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务