遇见数据集

inatspectro-bioacoustics

收藏
Hugging Face2026-06-16 更新2026-06-17 收录
官方服务:

资源简介:

iNatSpectro Bioacoustics是一个由社区贡献的生物声学频谱图数据集,数据来源于研究级的iNaturalist音频观测记录。数据集通过iNatSpectro浏览器扩展创建,该工具可在浏览器中直接渲染频谱图,并允许用户提交底层的浮点数据用于机器学习训练。每个数据条目对应一个iNaturalist音频文件,包含由iNatSpectro在浏览器中计算得到的频谱图原始浮点数据以及观测元数据。条目可能包含两种标签类型:强标签(标注了物种叫声出现的时间/频率边界框)或弱标签(已知物种存在于音频中,但未标注具体位置)。数据集采用追加式存储,每个贡献存储为一个独立的NDJSON文件。数据集结构包含丰富的字段,如观测ID、文件ID、物种通用名和学名、分类群组、原始音频URL、音频采样率和时长、频谱图分析参数(如使用的分析配置文件、FFT大小、频率范围、缩放模式、动态范围归一化参数)、固定的频谱图维度(256个时间列×128个频率仓)、频谱图数据数组(32,768个浮点数,以列主序存储)、标注信息(时间起始/结束、频率低/高边界)、贡献者iNaturalist用户名(可选)以及贡献时间戳。数据集适用于音频分类、物种识别、生物声学事件检测等机器学习任务,特别适合用于训练和评估基于频谱图的生物声学模型。

iNatSpectro Bioacoustics is a community-contributed bioacoustic spectrogram dataset sourced from research-grade iNaturalist audio observations. The dataset is created via the iNatSpectro browser extension, which renders spectrograms directly in the browser and allows users to submit underlying floating-point data for machine learning training. Each data entry corresponds to an iNaturalist audio file and includes raw spectrogram floating-point data computed in-browser by iNatSpectro, along with observation metadata. Entries may contain two types of labels: strong labels (with time/frequency bounding boxes annotating species vocalizations) or weak labels (where species are known to be present in the audio but without specific location annotations). The dataset is stored in an append-only manner, with each contribution saved as a separate NDJSON file. The dataset structure includes rich fields such as observation ID, file ID, species common and scientific names, taxon group, original audio URL, audio sample rate and duration, spectrogram analysis parameters (e.g., analysis profile used, FFT size, frequency range, scaling mode, dynamic range normalization parameters), fixed spectrogram dimensions (256 time columns × 128 frequency bins), spectrogram data array (32,768 floating-point numbers stored in column-major order), annotation information (time start/end, frequency low/high bounds), contributor iNaturalist username (optional), and contribution timestamp. The dataset is suitable for machine learning tasks like audio classification, species identification, and bioacoustic event detection, particularly for training and evaluating spectrogram-based bioacoustic models.

创建时间:
2026-06-14
原始信息汇总

数据集概要

  • 数据集名称: iNatSpectro Bioacoustics
  • 许可证: CC BY 4.0
  • 任务类别: 音频分类
  • 标签: 生物声学、声谱图、野生动物、公民科学、iNaturalist
  • 数据集大小: 少于 1000 条(n<1K)
  • 配置: 默认配置(default),数据以 NDJSON 格式存储在 data/*.ndjson 路径下

数据来源

数据源自 iNaturalist 全球公民科学平台上的研究级(research-grade)音频观察记录。贡献者通过 iNatSpectro 浏览器扩展在本地浏览器中生成声谱图,并将浮点数据与观察元数据提交至该数据集。

数据集结构

每条记录对应一个 iNaturalist 音频文件,存储为独立的 NDJSON 文件,文件命名格式为 data/{observation_id}_{file_id}_{unix_timestamp_ms}.ndjson。文件内容为单个 JSON 对象,包含以下字段:

字段 类型 描述
observation_id string iNaturalist 观察 ID
file_id string null
common_name string null
scientific_name string null
iconic_taxon_name string null
audio_url string iNaturalist 上的源音频 URL
sample_rate number 源音频采样率(Hz)
duration number 源音频时长(秒)
profile string iNatSpectro 分析配置文件(如 "Bat"
nfft number null
min_freq number 显示的最低频率(Hz)
max_freq number 显示的最高频率(Hz)
scale_mode string 频率轴刻度:"mel""log""linear"
dyn_min number 归一化下限(dB)
dyn_max number 归一化上限(dB)
spec_columns number 时间列数(固定为 256)
spec_bins number 频率箱数(固定为 128)
spec_data number[] 32,768 个浮点数组成的声谱图数据(列主序存储)
annotation object null
inat_username string null
contributed_at string ISO 8601 格式的贡献时间戳

声谱图数据(spec_data)布局

  • spec_data 是一维展平数组,包含 32,768 个原始 FFT 幅度值(dB 刻度),按列主序(时间 × 频率)排列。
    • 时间列数:256,频率箱数:128。
    • 索引方式:i = col * 128 + bin,其中 bin=0 对应最高频率(max_freq),bin=127 对应最低频率(min_freq)。
  • 可通过 dyn_mindyn_max 将值归一化到 [0, 1] 区间。

重构为二维数组(Python 示例): python import numpy as np spec = np.array(entry["spec_data"]).reshape(256, 128) # shape: (time, freq)

归一化到 [0, 1]: python spec_norm = (spec - entry["dyn_min"]) / (entry["dyn_max"] - entry["dyn_min"]) spec_norm = np.clip(spec_norm, 0, 1)

标签类型

  • 强标签(Strong label)annotation 字段非 null,包含一个时间/频率边界框,精确标示物种叫声出现的位置。字段结构如下: json { "time_start": 1.2, "time_end": 2.8, "freq_low": 15000, "freq_high": 80000 }

    • 时间值单位为秒,频率值单位为 Hz。
  • 弱标签(Weak label)annotation 字段为 null,表示物种确认存在于音频中但未标注具体位置。

使用示例

加载数据集: python from datasets import load_dataset ds = load_dataset("japht/inatspectro-bioacoustics", split="train")

按记录去重(保留每个观察+音频文件的最新贡献): python import pandas as pd df = ds.to_pandas() df = df.sort_values("contributed_at").drop_duplicates(subset=["observation_id", "file_id"], keep="last")

仅筛选强标签数据: python strong = ds.filter(lambda x: x["annotation"] is not None)

贡献方式

通过 iNatSpectro 浏览器扩展进行贡献。打开任意包含音频的研究级 iNaturalist 观察记录,渲染声谱图后点击 Contribute 即可提交。数据集为仅追加模式。

搜集汇总
数据集介绍
inatspectro-bioacoustics 数据集图片
构建方式
iNatSpectro Bioacoustics数据集源自全球公民科学平台iNaturalist上研究级(research-grade)的音频观测记录。贡献者通过iNatSpectro浏览器扩展程序,在浏览器中直接渲染语谱图(spectrogram),并将原始浮点数据与观测元数据一并提交。每一条目对应一个iNaturalist音频文件,存储为独立的NDJSON文件,文件名包含观测ID、音频文件ID及时间戳,以确保唯一性。数据集采用追加式(append-only)构建方式,支持包含时间-频率边界框的强标签(strong label)或仅标注物种存在性的弱标签(weak label),为生物声学机器学习模型训练提供了灵活且可扩展的数据基础。
使用方法
用户可通过Hugging Face Datasets库便捷加载数据集:`load_dataset("japht/inatspectro-bioacoustics", split="train")`。语谱图数据需从一维数组重塑为256×128的二维矩阵,并利用dyn_min与dyn_max参数进行归一化。实用操作包括:按观测ID与音频ID去重(保留最新贡献)、过滤仅含强标签的条目以用于精确检测任务。数据因以NDJSON格式存储,亦支持直接解析或转换为Pandas DataFrame进行批量处理。此数据集适用于弱监督或强监督的音频分类、物种识别及声学事件检测等下游任务。
背景与挑战
背景概述
iNatSpectro Bioacoustics数据集诞生于公民科学与机器学习交融的前沿地带,由iNatSpectro浏览器扩展项目于近年创建,依托全球知名公民科学平台iNaturalist的研究级音频观测。其核心研究问题在于,如何将分散的、非结构化的大规模野外音频数据转化为机器可读的频谱图张量,并附以物种标签,从而推动生物声学领域的自动物种识别研究。该数据集通过社区贡献机制,汇聚了来自不同生态类群的音频片段,不仅为声学分类任务提供了宝贵的弱监督与强监督样本,亦开创了从网页端直接贡献机器学习训练数据的先河,对降低生物声学数据获取门槛、加速生态监测智能化具有里程碑意义。
当前挑战
该数据集面临的首要领域挑战在于生物声学数据的稀疏性与高噪声环境,野外录音中目标物种叫声常被背景声或无关生物活动掩盖,使得基于频谱图的细粒度分类极其困难。构建层面,依赖公民科学家的手动标注引入了显著的不一致性与主观偏差,弱标签虽降低了参与门槛,却无法提供精确时间-频率边界,削弱了监督信号的有效性。此外,音频来源的多样性导致采样率、持续时间、FFT参数不统一,虽经标准化处理,仍需应对跨物种间声学特性差异带来的谱图表征泛化难题。最后,数据集的增量、仅追加特性使得版本控制与重复数据清理成为维护挑战,需谨慎处理同一录音的多次贡献以避免训练集污染。
常用场景
经典使用场景
iNatSpectro Bioacoustics数据集汇集了来自全球公民科学平台iNaturalist的研究级音频观测数据,通过iNatSpectro浏览器扩展生成并贡献了声谱图浮点数据。该数据集在生物声学领域被经典用于训练音频分类模型,以自动识别野生动物的声音信号。研究人员可利用其提供的256×128像素声谱图矩阵,结合强标签(包含呼叫的时间-频率边界框)或弱标签(确认物种存在但未标注精确位置),开展监督学习任务,例如鸟鸣、哺乳动物叫声或蝙蝠回声定位信号的分类与检测。
解决学术问题
该数据集有效解决了生物声学研究中高质量标注数据稀缺的核心难题。通过整合iNaturalist社区的研究级观察记录,并利用浏览器端声谱图渲染技术实现众包标注,iNatSpectro Bioacoustics为大规模野生动物声学监测提供了标准化数据源。它支持弱监督学习下的物种存在性检测与强监督学习下的精确呼叫定位,推动了从原始音频到声学生态指标的自动化转化,显著降低了生态学家手动标注声谱图的时间成本,加速了生物多样性动态评估与濒危物种声学监测的研究进程。
实际应用
在实际应用中,iNatSpectro Bioacoustics数据集被广泛用于部署野生动物声学监测系统。生态保护机构可基于该数据集训练的模型,从野外部署的录音设备中实时或离线识别特定物种的叫声,用于追踪候鸟迁徙路线、评估蝙蝠种群健康度或监测入侵物种的扩散。此外,公民科学家通过iNatSpectro扩展的持续贡献机制,使得数据集能够动态更新,为长期生态观测项目(如季节性声景变化分析)提供了可持续的数据支持,促进了公众参与科学研究的实践。
数据集最近研究
最新研究方向
iNatSpectro Bioacoustics 数据集的核心研究方向聚焦于利用公民科学平台与浏览器端频谱图渲染技术,构建大规模、社区驱动的生物声学弱监督与强监督标注资源,从而推动野生动物声学监测与物种识别的前沿探索。该数据集通过 iNaturalist 社区收集研究级音频观测,并借助 iNatSpectro 浏览器扩展在客户端直接生成频谱图浮点数据,实现了从众包贡献到机器学习训练的无缝衔接。这一创新路径不仅降低了声学生态学研究的数据采集门槛,还为跨物种声学分类、时间-频率边界框标注的精细化建模以及弱标签学习策略的优化提供了高质量基础,尤其在蝙蝠、鸟类等类群的自动识别领域具有高度应用价值。随着全球公民科学运动的蓬勃发展,该数据集的出现为生物多样性监测与保护决策提供了可扩展、可复现的数据支撑,预示了声学人工智能与生态大数据融合的新纪元。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务