遇见数据集

iNaturalist Sounds Dataset (iNatSounds)

收藏
arXiv2025-06-03 更新2025-11-19 收录
官方服务:

资源简介:

iNaturalist Sounds Dataset是由马萨诸塞大学阿默斯特分校与iNaturalist平台联合创建的大规模生物声学数据集,收录全球27,000位记录者提供的23万条音频,总时长约1,200小时,涵盖鸟类、哺乳动物、昆虫等5,500余种生物声纹。该数据集源自iNaturalist公民科学平台的观测记录,通过专业筛选和标准化处理构建而成,主要应用于生态保护、物种识别和生物多样性研究领域,旨在解决细粒度声学分类数据匮乏的问题,推动生物声学与人工智能的交叉研究。

The iNaturalist Sounds Dataset is a large-scale bioacoustic dataset jointly created by the University of Massachusetts Amherst and the iNaturalist platform. It contains 230,000 audio recordings submitted by 27,000 contributors worldwide, with a total duration of approximately 1,200 hours, covering acoustic signatures of over 5,500 species including birds, mammals, insects and other taxa. Derived from observation records on the iNaturalist citizen science platform, this dataset is constructed through professional screening and standardized processing. It is primarily applied in the fields of ecological conservation, species identification and biodiversity research, aiming to address the shortage of fine-grained acoustic classification data and promote interdisciplinary research between bioacoustics and artificial intelligence.

创建时间:
2025-05-31
搜集汇总
数据集介绍
iNaturalist Sounds Dataset (iNatSounds) 数据集图片
构建方式
iNatSounds数据集源自全球公民科学平台iNaturalist,通过筛选2024年2月1日前的科研级观测记录,仅保留包含音频媒体且已鉴定至物种级别的条目。研究聚焦于五大生物声学类群:鸟类、昆虫、爬行类、哺乳类和两栖类。为统一格式,将采样率超过48kHz的音频剔除,并重采样至22.05kHz的单声道WAV文件。数据集按年份划分训练、验证与测试集,确保物种在三个集合中至少有5条观测记录,最终涵盖5,569个物种的137,012条训练音频。
特点
该数据集以大规模、细粒度与弱标注为显著特征,囊括约1.2万小时、23万条音频,覆盖5,500余个物种,由全球超过2.7万名记录者贡献。每段音频仅包含单一物种标签,呈现弱监督特性。物种分布呈现显著的长尾效应,部分类别仅有少量样本,而常见类则拥有丰富数据。此外,数据集融合了地理先验信息,通过空间隐式神经表示(SINR)模型预测物种分布范围,有效提升分类精度,尤其在爬行类等群体中表现突出。
使用方法
研究者可将音频通过短时傅里叶变换转换为梅尔频谱图,并采用基于图像的神经网络(如MobileNet、ResNet、ViT)进行分类。推荐使用多标签学习策略,结合假设负样本损失与师生框架进行半监督训练,以提升对强标注下游数据集的迁移能力。评估时,需对3秒窗口进行滑动预测并平均得分,同时可引入地理先验掩码过滤地理上不可能的物种。数据集以单一压缩包形式免费提供,便于下载与研究社区复现和扩展实验。
背景与挑战
背景概述
在生物声学领域,大规模、细粒度的物种声音数据集长期处于匮乏状态,制约了机器学习方法在生态监测与保护中的深度应用。为填补这一空白,马萨诸塞大学阿默斯特分校与iNaturalist平台的研究人员于2025年推出了iNaturalist Sounds Dataset(iNatSounds)。该数据集汇聚了全球超过27,000名记录者贡献的230,000段音频,涵盖5,500余物种,总时长约1,200小时,覆盖鸟类、哺乳动物、昆虫、爬行动物和两栖动物五大类群。iNatSounds基于iNaturalist公民科学平台的观测数据构建,采用弱监督标注方式,旨在推动细粒度声音识别研究,为生态学家和土地管理者提供可扩展的声学分析工具,并对后续模型预训练与迁移学习产生深远影响。
当前挑战
iNatSounds面临的主要挑战体现在领域问题与构建过程两个层面。在领域问题方面,其核心任务是实现大规模、细粒度的物种声音分类,但物种间声学特征高度相似(如鸣禽与蛙类的近缘种),且数据呈现典型的长尾分布,少量常见物种占据绝大多数样本,稀有物种的识别精度极低。在构建过程中,数据源自公民科学平台,标注仅为单物种弱标签,无法准确标注同一录音中可能存在的多物种重叠声音,导致训练信号模糊;此外,录音时长不一、采样率多样,需统一预处理流程,且地理分布存在显著偏差(集中于北美与欧洲),限制了模型的全球泛化能力。
常用场景
经典使用场景
在生物声学与生态监测领域,iNaturalist Sounds Dataset (iNatSounds) 被广泛用作大规模细粒度物种声音分类的基准数据集。该数据集汇聚了来自全球超过27,000名记录者贡献的230,000段音频,涵盖5,500余种物种,包括鸟类、哺乳动物、昆虫、爬行动物和两栖动物。研究者常利用其丰富的声学特征和物种标签,训练和评估基于深度学习的音频识别模型,特别是在弱监督学习框架下,探索从频谱图到物种标签的映射关系。数据集提供的清晰训练-验证-测试划分(基于年份),使得模型性能的纵向比较和跨物种泛化能力的研究成为可能,从而推动了细粒度声学分类技术的进步。
实际应用
在实际应用中,iNatSounds 驱动的声学模型被部署于生物多样性监测与生态保护领域。例如,基于该数据集训练的轻量级模型(如MobileNet-V3)可集成到移动端应用程序中,助力公民科学家实时识别鸟类、蛙类等物种的叫声,提升公众参与自然观察的体验。在科研与保护实践中,这些模型被用于处理大规模被动声学监测数据,自动分析录音中的物种组成,辅助生态学家和土地管理者评估栖息地质量、追踪濒危物种分布,并为森林修复、保护区规划等决策提供量化依据。此外,模型在带宽受限的远程监测场景中展现出优势,音频分类仅需极低的数据传输量即可实现有效物种识别。
衍生相关工作
iNatSounds 的发布催生了一系列衍生的经典研究工作。在模型架构方面,研究者基于该数据集比较了MobileNet-V3、ResNet-50与ViT-B-16等骨干网络在弱监督多标签分类下的性能,并提出了结合学生-教师框架的半监督学习策略,有效提升了跨数据集迁移能力。在地理先验融合上,空间隐式神经表示(SINR)被用于推断物种分布范围,从而在推理阶段过滤地理上不可能的物种,显著提高分类准确率。此外,该数据集被用作预训练资源,在下游基准如SSW60、Powdermill、SWAMP和AnuraSet上验证了其泛化性能,并推动了多模态融合(如音频与视频联合分类)的研究,为构建下一代通用生物声学基础模型奠定了重要基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务