遇见数据集

PolyBirdMix-restart

收藏
Hugging Face2026-07-12 更新2026-07-13 收录
官方服务:

资源简介:

该数据集是一个用于鸟类声音检测与分类的多配置音频数据集,包含来自不同地理区域(如HSN和NES)的鸟类鸣叫录音。它提供四种配置格式:1) 带环境噪声的音频片段(noise配置);2) 多音混合音频(polyphonic配置),包含多个物种同时发声的合成混合音频及独立的源音频;3) 原始音频片段(segments配置),包含单个物种的鸣叫片段;4) 声景测试数据(soundscape_test配置),用于评估声景分析模型。每个样本包括音频数据(采样率为22.05kHz或32kHz)、时间-频率边界框、鸟类物种标签(使用eBird代码系统)和多音性指标(如最小/大多音性、物种多音性)。数据规模方面:HSN配置包含3,397至8,585个样本,NES配置包含7,167至21,215个样本,PER配置部分列出。该数据集适用于机器学习任务,如鸟类声音识别、多物种检测、声景分析和音频事件检测。

This dataset is a multi-configuration audio dataset for bird sound detection and classification, containing recordings of bird vocalizations from different geographic regions (e.g., HSN and NES). It offers four configuration formats: 1) audio clips with environmental noise (noise configuration); 2) polyphonic mixed audio (polyphonic configuration), including synthetic mixtures of multiple species vocalizing simultaneously and separate source audio; 3) raw audio clips (segments configuration), containing vocalization segments of individual species; 4) soundscape test data (soundscape_test configuration) for evaluating soundscape analysis models. Each sample includes audio data (sampled at 22.05kHz or 32kHz), time-frequency bounding boxes, bird species labels (using the eBird code system), and polyphony metrics (such as min/max polyphony and species polyphony). In terms of data scale: the HSN configuration contains 3,397 to 8,585 samples, the NES configuration contains 7,167 to 21,215 samples, and the PER configuration is partially listed. The dataset is suitable for machine learning tasks such as bird sound recognition, multi-species detection, soundscape analysis, and audio event detection.

创建时间:
2026-07-10
原始信息汇总

数据集 PolyBirdMix-restart 概述

该数据集是一个用于鸟鸣声音频处理的多配置数据集,主要包含声景(soundscape)数据、多声部(polyphonic)混合数据以及音频片段(segments)数据,涵盖多个地理区域(HSN、NES、PER)的鸟类物种。

数据集配置

数据集包含以下 8 个配置(config):

1. HSN_noise(声景噪声数据)

  • 用途:提供带有噪声标注的声景音频片段。
  • 特征:包含音频文件路径(filepath)、片段起止时间、音频数据、时间频率边界、多声部范围、物种多声部范围以及多标签鸟类代码(ebird_code_multilabel,共21种鸟类)。
  • 数据划分
    • train:3397 个样本
    • test_5s:3397 个样本
  • 数据集大小:2.18 GB

2. HSN_polyphonic(多声部混合数据)

  • 用途:提供由多个鸟鸣声源混合而成的多声部音频,包含原始音频、无噪声音频和噪声音频。
  • 特征:包含音频ID、原始音频、无噪声音频、噪声音频、片段时长、多声部数、物种多声部数、信噪比(snr_dB)、混合增益参数,以及多达12个独立声源音频(source_0_audio 至 source_11_audio)及其详细元数据(时间频率边界、鸟类代码、学名、俗名、原始文件来源等)。
  • 数据划分
    • train:3825 个样本
    • validation:478 个样本
    • test:478 个样本
  • 采样率:22050 Hz
  • 数据集大小:959.30 MB

3. HSN_segments(音频片段数据)

  • 用途:提供独立的鸟鸣声片段,用于训练或识别。
  • 特征:包含音频数据、时间频率边界、鸟类ID、eBird代码、学名、俗名、原始子集、原始文件名及片段时长。
  • 数据划分
    • train:4852 个样本
    • validation:607 个样本
    • test:607 个样本
  • 数据集大小:55.05 MB

4. HSN_soundscape_test(声景测试数据)

  • 用途:用于评估的声景音频片段。
  • 特征:包含文件路径、片段起止时间、音频数据(采样率 32000 Hz)、时间频率边界、多声部范围及多标签鸟类代码(21种鸟类)。
  • 数据划分
    • test_5s:8585 个样本
  • 数据集大小:2.75 GB

5. NES_noise(声景噪声数据)

  • 用途:与 HSN_noise 类似,但覆盖东北部(NES)区域的鸟类物种。
  • 特征:特征结构与 HSN_noise 相同,但鸟类代码包含 89 种不同物种。
  • 数据划分
    • train:7167 个样本
    • test_5s:7167 个样本
  • 数据集大小:4.61 GB

6. NES_polyphonic(多声部混合数据)

  • 用途:与 HSN_polyphonic 类似,但针对 NES 区域鸟类。
  • 特征:特征结构与 HSN_polyphonic 相同,鸟类代码包含 89 种物种。
  • 数据划分
    • train:16728 个样本
    • validation:2090 个样本
    • test:2090 个样本
  • 采样率:22050 Hz
  • 数据集大小:4.42 GB

7. NES_segments(音频片段数据)

  • 用途:NES 区域的独立鸟鸣声片段。
  • 特征:与 HSN_segments 相同。
  • 数据划分
    • train:21215 个样本
    • validation:2652 个样本
    • test:2652 个样本
  • 数据集大小:291.02 MB

8. NES_soundscape_test(声景测试数据)

  • 用途:NES 区域的声景测试数据。
  • 特征:与 HSN_soundscape_test 相同,但鸟类代码包含 89 种物种。
  • 数据划分
    • test_5s:17305 个样本
  • 采样率:32000 Hz
  • 数据集大小:5.57 GB

关键特点

  • 地理区域:数据集按区域分为 HSN(可能为山区或特定栖息地)和 NES(东北部)两大类别,每个区域下都有噪声、多声部和片段子配置。
  • 物种覆盖:HSN 区域涵盖 21 种鸟类(如灰冠朱雀、白冠麻雀等),NES 区域涵盖 89 种鸟类(如小犀鸟、大犀鸟、蜂鸟、鹦鹉等)。
  • 多声部合成:polyphonic 配置提供了人工合成的多声部音频,每个样本最多包含 12 个独立声源,并包含详细的混合参数(信噪比、增益、相对电平、时间偏移等),适用于声源分离和音频混合研究。
  • 声景数据:noise 和 soundscape_test 配置提供真实或合成的声景音频,包含时间频率边界和多标签标注,适用于多标签分类和事件检测任务。
  • 片段数据:segments 配置提供干净的单个鸟鸣声片段,适用于单标签分类或预训练。
搜集汇总
数据集介绍
PolyBirdMix-restart 数据集图片
构建方式
PolyBirdMix-restart数据集旨在为生物声学领域提供高质量的鸣鸟多声部混合音频,其构建过程精心且繁复。该数据集主要基于HSN(夏威夷)和NES(新英格兰?)两地的鸟类纯净鸣声片段(segments)作为声音源,通过模拟真实自然声景中鸟类鸣叫的重叠与噪声干扰。具体而言,构建方式包含两大核心流程:其一为“噪声场景”构建,将纯净的鸟鸣片段与对应地域的自然背景噪声以可控的信噪比(SNR)进行混合,从而生成包含单一声源背景噪声的音频;其二为“多声部(polyphonic)场景”构建,则更是复杂,通过将最多12个不同个体或物种的纯净鸟鸣片段在时域和频域上进行精心编排与增益调整,模拟出高度真实的鸟类合唱场景,并包含了逐一声源的详细属性记录,形成了一个完整且精细的模拟声景体系。
特点
该数据集最显著的特点在于其高度的结构化和丰富的标注信息,尤其体现在其精细的多声部模拟能力上。每个多声部音频样本均配备了多达12个独立声源的音频文件及其对应的时频边界、物种身份(包括ebird_code、学名及俗名)、归一化增益和相对电平。此外,数据集不仅提供了原始无噪声的多声部音频,还保留了与之对应的纯噪声音频和最终混合音频,使得研究者能够对模型进行严格的分离分析。数据覆盖了包括夏威夷和(推测)新英格兰地区在内的数百种常见鸣禽物种,每个物种均有详细的分类标签。数据集的配置名(config)划分清晰,分为noise(含噪声背景的单源/多源音频)、polyphonic(模拟多声部)、segments(纯净片段)和soundscape_test(真实声景测试集)四大类,为不同侧重点的研究任务提供了坚实的数据基础。
使用方法
使用PolyBirdMix-restart数据集时,研究者可通过Hugging Face Datasets库便捷加载。该数据集提供了多个配置名,可根据特定研究目标灵活选用。例如,进行鸟鸣声源分离任务时,可以加载"HSN_polyphonic"或"NES_polyphonic"配置,其提供的多个独立声源音频和混合音频可直接用于训练和评估分离模型;进行鸟种识别或声学场景分类时,可以选用"HSN_noise"或"NES_soundscape_test"等配置,利用其提供的多标签标注进行模型训练;对于纯净鸟鸣片段分析与数据增强,可直接使用"HSN_segments"或"NES_segments"。所有配置均提供标准的训练、验证和测试集划分,其中polyphonic和soundscape_test配置的采样率固定为22050 Hz或32000 Hz,便于与标准音频处理流水线集成。加载时通过指定config_name和split参数即可获取所需子集,数据以音频路径、时间戳及类别标签等结构化字段形式返回,极大地方便了后续的数据流水线构建。
背景与挑战
背景概述
PolyBirdMix-restart是一个面向鸟鸣声场景中多标签音频事件检测与复调分析的专用数据集,由研究者基于HSN(北美山地森林)、NES(新热带低地森林)和PER(秘鲁亚马逊)等多个高生物多样性区域的实地录音构建而成。该数据集的核心研究问题在于精准刻画复杂自然声景中的多重鸟种鸣叫重叠现象,旨在推动生物声学领域从简单分类迈向对多源、时频交叠声学事件的细粒度解析。自发布以来,PolyBirdMix-restart凭借其标注精度、物种覆盖度及对真实环境噪声的模拟能力,显著提升了相关模型在生态监测中的鲁棒性,成为评估自动声学识别算法在复调条件下性能的关键基准。
当前挑战
PolyBirdMix-restart所应对的核心领域挑战在于声景中高密度鸟鸣引发的复调混淆与信噪比退化问题——多只个体在不同频段同时发声时,传统分类器难以在时频域中准确分离和识别各鸣叫事件。构建过程中,团队需克服大规模连续录音的精细分割瓶颈,为每段音频精确标注语音起始点、结束点、频率范围、复调程度及物种标签,并在噪声环境中控制混合增益以维持生态真实性。此外,跨地域数据集(北美、新热带、秘鲁)面临声学环境迥异、物种库差异巨大、标注一致性难以统一的挑战,制约了模型向未见过区域的高效迁移。
常用场景
经典使用场景
PolyBirdMix-restart数据集专为复杂声学场景下的多标签鸟类鸣声识别而构建,通过精细控制的多源混合技术,合成了包含不同复调层次和信噪比的多物种共唱音频。其经典使用场景聚焦于评估和提升深度学习模型在嘈杂自然环境中辨别多种鸟类同时鸣叫的能力,尤其适用于多标签分类任务和声源分离的前沿探索。
解决学术问题
该数据集精准回应了生态声学领域长期存在的核心挑战——如何在声学重疊和背景噪声干扰下,实现鸟类群落的高精度自动监测。它首次提供了大规模、带精细标注的复调鸟鸣数据,使研究人员得以系统性地探究多物种同时发声时的特征混淆与分离难题。其意义在于突破了传统单标签分类的局限,为发展鲁棒性更强的生物声学智能监测系统奠定了数据基石。
衍生相关工作
该数据集催生了一系列具有深远影响的经典工作,其中包括探索时间-频率域注意力机制的多标签鸟鸣分类网络、结合多任务学习的复调声源分离模型,以及为提升跨地域迁移能力而设计的域自适应方法。这些衍生工作不仅在声学领域的顶级会议与期刊上发表,还反向推动了诸如Perch和BirdNET等生态音频分析工具在复杂声学环境下的性能迭代与鲁棒性增强。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务