SoundingEarth
收藏资源简介:
该数据集是一个多模态数据集,包含音频、图像和文本数据。主要特征包括音频文件(采样率为32kHz)、谷歌地球图像、音频字幕及其来源、梅尔频谱特征(形状为5x1x1001x64的浮点数组)、基于LLaVA模型的谷歌地球图像字幕、经纬度坐标以及录制日期。数据集分为训练集(40,241个样本)、验证集(3,242个样本)和测试集(5,801个样本),总大小约为498GB。该数据集适用于多模态学习任务,如音频-图像关联分析、地理空间音频识别等。
SoundingEarth 数据集概述
SoundingEarth 是一个地理参考声景数据集,将 Google Earth 影像与地理标记的环境音频记录配对,最初由 Heidler 等人收集,用于自监督视听表示学习。
数据集规模与划分
数据集采用基于空间单元的划分策略,将地球表面划分为空间单元,整个单元分配给单一划分,防止地理泄漏。
| 划分 | 样本数 |
|---|---|
| 训练集 (train) | 40,241 |
| 验证集 (val) | 3,242 |
| 测试集 (test) | 5,801 |
数据模式 (Schema)
| 字段 | 类型 | 描述 |
|---|---|---|
sample_id |
字符串 | 样本唯一标识符 |
short_id |
字符串 | 原始 SoundingEarth 版本中的简短标识符 |
audio |
音频 (32 kHz) | 原始波形 |
googleearth_image |
图像 | 记录位置的 Google Earth 瓦片 |
audio_caption |
字符串 | 描述音频的文本标题 |
audio_caption_source |
字符串 | 标题来源(如模型、人工) |
mel_features |
float32 四维数组 (5,1,1001,64) | 预计算的对数梅尔频谱图特征(5个增强视图) |
llava_caption_googleearth_zl1 |
字符串 | LLaVA 为缩放级别1的 Google Earth 瓦片生成的标题 |
latitude |
float32 | 记录纬度 |
longitude |
float32 | 记录经度 |
date_recorded |
字符串 | 记录日期 |
使用许可
采用 CC-BY-4.0 许可证。
加载示例
python from datasets import load_dataset
加载完整数据集(建议流式加载)
ds = load_dataset("MVRL/SoundingEarth", split="train", streaming=True)
row = next(iter(ds)) audio = row["audio"]["array"] # np.ndarray, 32 kHz image = row["googleearth_image"] # PIL Image caption = row["audio_caption"] lat, lon = row["latitude"], row["longitude"]
预计算梅尔特征:形状 (5, 1, 1001, 64) — 选择5个片段之一
import numpy as np mel = np.asarray(row["mel_features"], dtype="float32")[0]
引用信息
使用本数据集时,请引用原始 SoundingEarth 论文以及基于空间单元划分方法的 PSM 论文。原始数据的所有版本也可通过 Zenodo 概念 DOI 进行引用。




