遇见数据集

academic-datasets/InsectSet459

收藏
Hugging Face2025-03-21 更新2025-04-26 收录
官方服务:

资源简介:

InsectSet459是一个为自动昆虫识别的机器学习算法开发和测试而设计的综合昆虫声音数据集。它包含了来自459种直翅目(蟋蟀、蝗虫、蝈蝈)和蝉科(蝉)的26,399个音频文件,提供了9.5天的音频材料。数据集覆盖全球范围,重点关注欧洲和北美地区。数据集遵循知识共享授权(CC-BY-4.0或CC0)。数据集分为训练集、验证集和测试集,比例为60/20/20。音频记录来自三个主要来源:xeno-canto、iNaturalist和BioAcoustica。数据整理过程中进行了去重、格式标准化和统一物种命名等操作。

InsectSet459 is a comprehensive dataset of insect sounds designed for developing and testing machine learning algorithms for automatic insect identification. It contains 26,399 audio files from 459 species of Orthoptera (crickets, grasshoppers, katydids) and Cicadidae (cicadas), providing 9.5 days of audio material. The dataset covers worldwide geographic areas with a focus on Europe and North America and is licensed under Creative Commons (CC-BY-4.0 or CC0). The dataset is split into training, validation, and test sets with a 60/20/20 ratio. Audio recordings are sourced from xeno-canto, iNaturalist, and BioAcoustica. The curation process includes deduplication, format standardization, and taxonomic unification.

提供机构:
academic-datasets
搜集汇总
数据集介绍
构建方式
在生物声学与机器学习交叉领域,数据集的构建质量直接决定模型泛化能力。InsectSet459数据集源自xeno-canto、iNaturalist与BioAcoustica三大公开声学资源库,收录直翅目与蝉科昆虫鸣声。构建过程遵循严格筛选流程:仅采用iNaturalist中研究级观测记录,对同一观测的多音频附件仅保留一份;基于MD5校验码去除重复文件,并依据用户名、物种、地点、日期与时间对录音进行聚合,确保同一小时内仅选一份样本;每个物种至少包含10个声学示例。音频经立体声转单声道、统一WAV与MP3格式、自动裁剪超长录音(>2分钟)等标准化处理,物种命名法统一采用COL24.4分类体系,最终形成包含459个物种、26399个音频文件、总计9.5天时长的优质数据集。
特点
InsectSet459数据集在规模与多样性上具有显著优势。其覆盖310种直翅目与149种蝉科昆虫,采样率横跨8至500 kHz,能够捕捉从低频鸣声到超声信号的完整频谱。地理分布以欧洲与北美为主,兼顾全球代表性。数据集采用60/20/20比例划分为训练集(15873文件,137.3小时)、验证集(5307文件,46.2小时)与测试集(5219文件,43.7小时),为模型训练、调参与评估提供统一基准。所有音频均采用CC-BY-4.0或CC0开放许可,确保可复现性与学术共享。这一设计使其特别适用于开发高变频率声学表征方法及被动声学监测系统。
使用方法
该数据集主要面向音频分类任务,可通过HuggingFace Datasets库直接加载。用户指定配置名为'default',即可按需获取训练与验证分片(路径为data/train-*与data/validation-*)。每个样本包含file_name、species_name、group等元数据字段,以及原生audio张量。在2025年BioDCASE挑战赛期间,测试集暂未公开,完整版将于赛后以v1.0发布。研究者可利用该数据集训练昆虫自动识别模型,评估不同音频表征(如频谱图、梅尔倒谱系数)对分类性能的影响,或结合被动声学监测数据进行生态学研究。推荐引用原始论文(Faiß等,2025)以保障学术规范。
背景与挑战
背景概述
昆虫作为地球上物种多样性最为丰富的类群,其种群动态与生态系统健康息息相关。传统昆虫监测依赖形态学鉴定与人工采集,耗时耗力且难以规模化。近年来,生物声学与机器学习技术的融合为昆虫自动识别开辟了新路径,然而高质量标注数据集的匮乏始终是制约该领域发展的瓶颈。在此背景下,由德国马克斯·普朗克动物行为研究所的Marius Faiß、荷兰自然生物多样性中心的Burooj Ghani以及蒂尔堡大学的Dan Stowell于2025年联合发布了InsectSet459数据集。该数据集汇集了来自全球459种直翅目与蝉科昆虫的26,399条音频记录,总时长约9.5天,覆盖欧洲与北美等地区。其核心研究问题在于构建一个开放、标准化且物种覆盖广泛的声音数据集,以推动基于被动声学监测的昆虫自动识别算法发展。InsectSet459的发布为生物声学机器学习研究提供了重要的基准资源,显著提升了昆虫声学识别的物种多样性与数据规模。
当前挑战
InsectSet459所解决的核心领域挑战在于昆虫声学自动识别的数据稀缺性与物种多样性不足。传统数据集多局限于少数常见物种或单一地理区域,难以支撑模型在复杂自然场景下的泛化能力。该数据集通过整合xeno-canto、iNaturalist与BioAcoustica三大公开声库,并经过严格的去重、格式标准化及物种命名统一(COL24.4分类体系)等构建流程,力图克服数据异质性与标注不一致问题。然而,构建过程中仍面临多重挑战:首先,不同来源的音频采样率差异巨大(8至500 kHz),需设计鲁棒的音频表示方法以兼容高频与低频信号;其次,录音背景噪声复杂,野外环境中的风噪、交通声等非目标声学干扰显著;此外,物种类别的不平衡分布(部分物种样本仅达最低10条门槛)可能诱发模型偏差。这些因素共同构成了InsectSet459在推动自动声学监测实用化进程中的关键技术瓶颈。
常用场景
经典使用场景
InsectSet459数据集专为基于音频的昆虫自动识别任务而设计,其核心应用场景在于利用深度学习模型对直翅目(如蟋蟀、蚱蜢、螽斯)和蝉科昆虫的发声进行物种级分类。该数据集包含459个物种、逾26,000条音频记录,覆盖9.5天的声学素材,采样率横跨8至500 kHz,能够充分支撑研究人员在高度异质性的声学特征下训练鲁棒的分类器,尤其适用于被动声学监测(PAM)中多物种同时识别的经典研究范式。
解决学术问题
该数据集系统性地解决了生物声学领域中缺乏大规模、多物种、标准化昆虫声音标注数据集的学术瓶颈。此前,昆虫声学识别研究多受限于物种数量少、地理覆盖窄、音频格式不统一等问题,难以推动通用模型的泛化能力。InsectSet459通过对来自xeno-canto、iNaturalist和BioAcoustica三大来源的录音进行严格的去重、格式统一、元数据清洗和分类学对齐,为训练高精度、跨区域的昆虫自动识别模型提供了可靠基准,显著促进了生态监测与计算生物声学的交叉融合。
衍生相关工作
InsectSet459的出现催生了多项经典衍生工作,包括2025年BioDCASE数据挑战赛,该赛事以该数据集的测试集为基准,推动音频表示学习与弱监督分类方法的创新。此外,基于该数据集,研究者已探索了对比学习、自监督特征提取以及跨域迁移学习在昆虫声学识别中的应用,相关成果为构建更通用的生物声学基础模型(如BirdSet的昆虫扩展版)奠定了数据与算法基础,进一步拓展了计算生态学的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务