noisemap
收藏资源简介:
NoiseMap数据集是一个基于全球众包噪声测量平台NoiseCapture数据构建的地理空间噪声数据集。其核心目的是整合带有地理坐标的噪声测量值、多模态嵌入特征以及多标签声源分类信息,用于支持环境声学、城市计算和地理空间人工智能相关研究。数据集包含来自NoiseCapture用户的实地噪声测量记录,每条记录关联了精确的地理位置(经纬度)、测量时间、噪声水平(分贝值)以及丰富的上下文信息。数据内容结构清晰,主要包含以下几类字段:1) 位置与测量信息:如样本ID、数据分割、经纬度、噪声分贝值、增益校准、测量时长、模态、来源指示器、轨迹ID和愉悦度评分。2) 时间信息:包括纪元时间、UTC与本地时间戳、时区、本地小时、星期几和年内周数。3) 地理信息:包括国家代码和基于H3地理索引系统(分辨率6)的单元格ID,该ID用于确保训练、验证和测试集在空间上是单元格原子性的,避免了数据泄漏。4) 标签信息:包含用户提供的噪声标签(tags)以及从OpenStreetMap(OSM)提取的100米范围内的地点标签(osm_tags),并标注了标签来源(OSM、用户、两者或无)。5) 声源标签:提供了一个多标签分类体系,包含七个声源类别:机动交通、工业机械、建筑施工、人类社交、音乐休闲、水文和自然声音。数据以`source_labels`(类别ID列表)和`src_<class>`(每个类别的多热布尔值)两种形式表示,并附有来源和存在性标识。6) 多模态嵌入向量:包含三种预计算的嵌入特征:`clay_emb`(256维浮点向量,基于地理位置)、`aef_emb`(AlphaEarth芯片嵌入,int8类型,需重塑为64x64x64的三维张量)和`tessera_emb`(Tessera芯片嵌入,int8类型,需与`tessera_scale`缩放因子结合并重塑为64x64x128的三维张量)。数据集总大小约为254 GB,被预先分割为训练集(324,723条)、验证集(9,922条)和测试集(19,811条),确保了空间上的泄漏安全性。数据以Parquet格式存储,可通过HuggingFace Datasets库方便地加载,支持全量加载、按分割加载、切片加载和流式加载。该数据集适用于多种任务,包括但不限于:城市噪声地图绘制、声源识别与分类、地理空间表征学习、环境噪声对健康或行为影响的分析,以及多模态(测量值、地理、标签、嵌入)联合建模。




