遇见数据集

noisemap

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

NoiseMap数据集是一个基于全球众包噪声测量平台NoiseCapture数据构建的地理空间噪声数据集。其核心目的是整合带有地理坐标的噪声测量值、多模态嵌入特征以及多标签声源分类信息,用于支持环境声学、城市计算和地理空间人工智能相关研究。数据集包含来自NoiseCapture用户的实地噪声测量记录,每条记录关联了精确的地理位置(经纬度)、测量时间、噪声水平(分贝值)以及丰富的上下文信息。数据内容结构清晰,主要包含以下几类字段:1) 位置与测量信息:如样本ID、数据分割、经纬度、噪声分贝值、增益校准、测量时长、模态、来源指示器、轨迹ID和愉悦度评分。2) 时间信息:包括纪元时间、UTC与本地时间戳、时区、本地小时、星期几和年内周数。3) 地理信息:包括国家代码和基于H3地理索引系统(分辨率6)的单元格ID,该ID用于确保训练、验证和测试集在空间上是单元格原子性的,避免了数据泄漏。4) 标签信息:包含用户提供的噪声标签(tags)以及从OpenStreetMap(OSM)提取的100米范围内的地点标签(osm_tags),并标注了标签来源(OSM、用户、两者或无)。5) 声源标签:提供了一个多标签分类体系,包含七个声源类别:机动交通、工业机械、建筑施工、人类社交、音乐休闲、水文和自然声音。数据以`source_labels`(类别ID列表)和`src_<class>`(每个类别的多热布尔值)两种形式表示,并附有来源和存在性标识。6) 多模态嵌入向量:包含三种预计算的嵌入特征:`clay_emb`(256维浮点向量,基于地理位置)、`aef_emb`(AlphaEarth芯片嵌入,int8类型,需重塑为64x64x64的三维张量)和`tessera_emb`(Tessera芯片嵌入,int8类型,需与`tessera_scale`缩放因子结合并重塑为64x64x128的三维张量)。数据集总大小约为254 GB,被预先分割为训练集(324,723条)、验证集(9,922条)和测试集(19,811条),确保了空间上的泄漏安全性。数据以Parquet格式存储,可通过HuggingFace Datasets库方便地加载,支持全量加载、按分割加载、切片加载和流式加载。该数据集适用于多种任务,包括但不限于:城市噪声地图绘制、声源识别与分类、地理空间表征学习、环境噪声对健康或行为影响的分析,以及多模态(测量值、地理、标签、嵌入)联合建模。

创建时间:
2026-07-25
搜集汇总
数据集介绍
noisemap 数据集图片
构建方式
NoiseMap数据集的构建基于全球众包噪声测量数据(NoiseCapture),融合了地理空间基础嵌入与多标签声源标注。其数据划分采用了防泄漏策略,以H3索引的第6级分辨率作为最小原子单元,确保同一地理单元的数据不会被分割至不同子集,从而有效避免了空间自相关带来的信息泄露问题。数据集共包含训练样本324,723条、验证样本9,922条以及测试样本19,811条。在标签生成上,该数据集将OpenStreetMap(OSM)的允许列表与用户自定义标签进行联合处理,通过并集操作确定声源标签的存在与否,实现了OSM结构化标签与用户非结构化标签的有机融合。
使用方法
NoiseMap数据集可通过HuggingFace Datasets库便捷加载。用户可使用`load_dataset`函数直接获取包含训练、验证和测试所有分片的DatasetDict对象,亦可指定`split`参数单独加载某一子集。为适应不同计算资源需求,数据集支持惰性流式加载模式(`streaming=True`),无需完全下载约254GB的完整数据即可迭代访问。此外,用户还可通过Parquet文件的直连方式,将外部计算框架与特定数据分片对接。对于嵌入字段,AEF和Tessera的量化数据需按64×64×64和64×64×128的维度重塑解码,且Tessera特征需乘以对应的缩放因子以实现反量化操作。
背景与挑战
背景概述
噪声污染作为现代城市环境中的主要公害之一,其精细化监测与治理依赖于高时空分辨率的声景数据。NoiseMap数据集由MVRL研究团队构建,旨在融合全球众包噪声测量数据与地理空间基础模型嵌入,为城市声环境研究提供多模态基准。该数据集依托NoiseCapture众包平台,汇聚了自2022年以来的大规模噪声观测记录,涵盖324,723条训练样本、9,922条验证样本及19,811条测试样本。其核心创新在于引入H3六边形网格分辨率6级进行泄露安全的划分,并整合了Clay、AlphaEarth与Tessera三种地理空间嵌入,同时提供了七类声源多标签标注(如机动交通、工业机械、人类社交等)。NoiseMap的出现填补了城市声景分析中大规模、多源异构数据融合的空白,显著推动了噪声制图、声源识别与城市感知等研究方向的发展。
当前挑战
NoiseMap数据集面临的核心领域挑战在于噪声源的多源异质性:用户标签与开放街景数据之间的语义鸿沟使得标签融合成为难题,需通过联合规则与统计方法实现类别对齐,但标注噪声与缺失问题仍难以根除。构建过程中,坐标隐私泄露风险要求对测量位置进行网格化脱敏,但H3分辨率的选择需权衡空间精度与数据密度。嵌入层的存储与计算挑战显著,特别是AlphaEarth与Tessera的量化int8格式需进行反量化与形状重塑,增加了预处理流水线的复杂度。此外,众包数据的质量参差不齐,时间跨度与设备差异导致测量模态不一致,校准增益与时长校正虽能部分缓解,但系统性偏差的消除仍依赖精细的后处理策略。轻量化的流失式加载虽支持大文件迭代,但254GB的总体量对网络带宽与内存管理提出了较高要求。
常用场景
经典使用场景
NoiseMap数据集的核心应用在于城市声环境智能感知与建模。科研人员通常利用其海量的众包噪声测量记录与地理空间基础嵌入特征,训练多标签声音源分类模型,以自动识别交通、工业、施工、社交活动等声源类别。该数据集的泄漏安全划分策略确保了模型评估的可靠性,使其成为声学场景分类、城市噪声图谱构建以及环境暴露评估研究中的标杆性数据集。
解决学术问题
该数据集有效解决了城市噪声监测中稀疏采样与先验标签不足的学术难题。通过融合众包噪声数据、多模态地理嵌入和结构化声音源标签,NoiseMap支持了声源分离与噪声水平预测的联合建模,推动了城市环境感知从单一分贝测量向语义化声景理解的范式转变。其跨区域、跨时间的系统性标注体系为可泛化的噪声暴露风险评估模型奠定了数据基础。
实际应用
在实际应用中,NoiseMap数据集赋能了智慧城市噪声精准管控系统的开发。城市规划者借助其训练出的模型可动态绘制高分辨率城市噪声地图,为交通规划、声屏障设计及居住区选址提供数据支撑;环保机构则利用该数据集构建的声源识别工具链,实现对社会活动噪声与施工扰民的实时监测与预警。
数据集最近研究
最新研究方向
在全球城市化进程加速与噪声污染日益严峻的背景下,NoiseMap数据集凭借其全球众包噪声测量特性,融合多标签声源标注与高精度地理空间基础嵌入(如Clay、AlphaEarth及Tessera),为城市声环境智能感知与噪声源解析提供了前沿研究基础。该数据集的泄露安全保障设计(基于H3六边形网格的单元原子分割)和丰富的时空属性(包含本地时间、OSM兴趣点标签等),使其在跨区域噪声暴露评估、声景观分类与城市可持续发展目标监测等热点方向展现出巨大潜力。相关研究可借助其多模态嵌入特征,构建噪声源识别与时空动态建模的深度学习框架,推动智慧城市在环境健康监测与公共空间规划领域的实证分析,为政策制定者提供精细化的声环境治理数据驱动支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务