Merlin L48Spectrogram Dataset
收藏资源简介:
Merlin L48Spectrogram数据集是一个包含美国鸟类录音的精细粒度、真实世界的多标签数据集,每个录音都关联着一个目标物种,同时包含背景物种,从而形成了一个自然的单正、多标签(SPML)任务。数据集覆盖了美国全境,全年记录,包含10万条录音,共110小时,142,000个边界框,为鸟类识别工作流程提供了密集的物种标签。数据集的创建过程包括专家对录音的密集标注,以及通过目标物种元数据采样资产。该数据集旨在解决现实世界中的SPML场景,如物种范围图估计和声学检测等问题。
The Merlin L48Spectrogram Dataset is a fine-grained, real-world multi-label dataset containing bird recordings across the United States. Each recording is associated with one target species while also including background species, thus forming a natural single-positive multi-label (SPML) task. The dataset covers the entire United States, with year-round recordings, comprising 100,000 audio recordings totaling 110 hours of audio and 142,000 bounding boxes, providing dense species labels for bird recognition workflows. Its creation process involves dense manual annotation of recordings by experts, as well as asset sampling leveraging target species metadata. This dataset is intended to address real-world SPML scenarios such as species range map estimation and acoustic detection.
ML48S 数据集概述
数据集基本信息
- 数据集名称:ML48S
- 论文链接:https://arxiv.org/abs/2511.00252
- 数据下载地址:https://msid-ml48s.s3.amazonaws.com/v0/ml48s.tar.gz
数据集组织架构
图像目录结构
- 图像存储路径:
images/[asset_id]/[clip_num].jpg - 每个资产有独立目录,按时间顺序枚举片段
资产元数据
资产包含以下元数据字段:
| 字段 | 取值范围 | 描述 |
|---|---|---|
| id | [0, 9999] | 资产的唯一标识符 |
| split | train, test | 训练集或测试集划分 |
| target_species_code | 6字母代码 | 该资产的目标物种 |
| possible_species_codes | [6字母代码] | 基于地理范围的可能物种列表 |
| observed_species_codes | [6字母代码] | 关联检查表中的物种列表 |
| present_species_codes | [6字母代码] | 正标签物种列表 |
| unknown_species_codes | [6字母代码] | 既不在正标签也不在负标签中的物种列表 |
| absent_species_codes | [6字母代码] | 负标签物种列表 |
片段元数据
片段包含以下元数据字段:
| 字段 | 取值范围 | 描述 |
|---|---|---|
| id | [0, 416534] | 片段的唯一标识符 |
| asset_id | [0, 9999] | 来源资产的ID |
| clip_order | [0, 1449] | 在资产中的位置顺序 |
| file_path | 相对文件路径 | 片段图像文件路径 |
| width | 750 | 图像宽度 |
| height | 236 | 图像高度 |
| present_species_codes | [6字母代码] | 正标签物种列表 |
| unknown_species_codes | [6字母代码] | 未知标签物种列表 |
| absent_species_codes | [6字母代码] | 负标签物种列表 |
| boxes | [字典] | 边界框标注信息 |
边界框标注
边界框包含以下元数据:
| 字段 | 取值范围 | 描述 |
|---|---|---|
| id | 整数 | 片段内唯一的边界框ID |
| species_code | 6字母代码 | 鸣叫所属物种 |
| status | "passive", "active", "ignore" | 物种在片段中的普遍性 |
| bbox | [0, 1]^4 | 边界框坐标[xmin, ymin, xmax, ymax] |
数据集统计特征
- 资产总数:10,000个(ID 0-9999)
- 测试资产:ID ≥ 8000的资产
- 训练验证划分:每个物种80个训练资产,20个测试资产,其中10个训练资产用作验证
- 片段数量范围:每个资产包含11-1450个片段
- 图像尺寸:750×236像素
标签类型
- 完全标注:所有物种都有明确标签
- 目标物种标注:仅标注目标物种
- 地理先验标注:基于地理范围提供弱监督
- 检查表标注:基于关联检查表提供弱监督
分类信息
- 物种分类信息:存储在
taxa.csv文件中 - 物种编码:使用6字母代码标识物种



