遇见数据集

noamundi-rockfall-simulation-dataset

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

Noamundi岩石崩塌模拟数据集是一个物理信息模拟数据集,旨在模拟岩石崩塌前兆条件。该数据集结合了印度Noamundi矿区真实地形和天气数据与合成的物联网传感器读数及岩石崩塌事件标签。数据集包含393,855行每小时读数,覆盖2021年1月至2023年12月期间15个模拟监测位置,共标记75个岩石崩塌事件。数据字段包括时间戳、位置ID、模拟地面位移速率、模拟地面振动读数、岩石崩塌事件二元标签、安全系数(基于无限边坡稳定性模型计算)、真实地形特征(崎岖度、粗糙度、坡向、坡度)以及真实天气特征(最高温度、降水量、最大风速、短波辐射总和)和工程降雨总和特征。地形数据来自OpenTopography的数字高程模型,天气数据来自Open-Meteo API历史记录。传感器读数和事件标签为模拟生成,但位移速率受安全系数驱动,振动包含物理缩放的事件峰值,事件发生时间80%偏向低安全系数时段。该数据集专为岩石崩塌早期预警系统、前兆检测、异常检测和灾害分类研究设计,适用于二元分类、异常检测、前兆研究、跨位置泛化测试、特征消融研究以及不平衡罕见事件分类的方法基准测试。数据集为合成数据,不包含真实岩石崩塌事件记录,使用时需注意其模拟性质和已知局限性。

The Noamundi rockfall simulation dataset is a physics-informed simulation dataset designed to simulate precursor conditions for rockfalls. It integrates real terrain and weather data from the Noamundi mining area in India with synthetic IoT sensor readings and rockfall event labels. The dataset contains 393,855 rows of hourly readings, covering 15 simulated monitoring locations from January 2021 to December 2023, with 75 labeled rockfall events. Data fields include timestamp, location ID, simulated ground displacement rate, simulated ground vibration readings, binary rockfall event labels, safety factor (calculated based on an infinite slope stability model), real terrain features (ruggedness, roughness, aspect, slope), real weather features (maximum temperature, precipitation, maximum wind speed, sum of shortwave radiation), and engineered rainfall sum features. Terrain data is sourced from OpenTopographys digital elevation model, and weather data comes from the Open-Meteo API historical records. Sensor readings and event labels are synthetically generated, but the displacement rate is driven by the safety factor, vibrations include physically scaled event peaks, and event timing is biased 80% towards periods of low safety factor. This dataset is specifically designed for research on rockfall early warning systems, precursor detection, anomaly detection, and hazard classification, and is suitable for binary classification, anomaly detection, precursor studies, cross-location generalization tests, feature ablation studies, and benchmarking methods for imbalanced rare event classification. The dataset is synthetic and does not contain real rockfall event records; users should be aware of its simulated nature and known limitations.

创建时间:
2026-07-26
原始信息汇总

Noamundi 岩石崩塌仿真数据集概述

基本信息

  • 许可证:CC-BY-4.0
  • 任务类别:表格分类、时间序列预测
  • 数据集规模:100K 至 1M 行
  • 标签:岩石崩塌、地质灾害、传感器仿真、合成数据、异常检测、物联网、物理信息驱动

数据内容

数据集包含 393,855 行 小时级记录,覆盖 15 个仿真监测点,时间跨度为 2021 年 1 月至 2023 年 12 月。共标注 75 次岩石崩塌事件,反映真实崩塌事件的极端稀有性。

核心列说明

列名 描述
Timestamp 小时级时间戳
Location_ID 仿真监测站标识(LOC_1 至 LOC_15)
Displacement_Rate_mm_h 模拟地面位移速率,由安全系数(FS)驱动的蠕变控制
Vibration_mm_s 模拟地面振动读数,含物理缩放的事件峰值
Rockfall_Event 二元标签,1 表示该时刻发生岩石崩塌事件
FS 安全系数,基于无限边坡稳定性模型逐位置每小时计算
Ruggedness, Roughness, Aspect, Slope 静态真实地形特征(来自数字高程模型)
temperature_2m_max, precipitation_sum, windspeed_10m_max, shortwave_radiation_sum 真实逐日天气特征
3_day_rainfall, 7_day_rainfall 滚动降雨量总和(真实数据)

真实与仿真成分

成分 状态 来源
地形特征(坡度、坡向、崎岖度、粗糙度) 真实 来自 OpenTopography 的 DEM,经 QGIS 处理
天气特征(温度、降水、风、辐射、滚动降雨量) 真实 来自 Open-Meteo API 的历史天气数据
安全系数(FS) 物理推导 基于无限边坡稳定性模型,结合真实坡度和降雨孔隙水压力代理
传感器读数(位移率、振动) 仿真(物理信息驱动) 位移由 FS 驱动的蠕变生成,振动含物理缩放的事件峰值
岩石崩塌事件(标签与时间) 仿真(物理加权) 事件数量遵循泊松过程,80% 权重倾向低 FS 时刻

仿真构建流程

  1. 地形层:从 OpenTopography 获取 DEM,经 QGIS 提取坡度、坡向、崎岖度、粗糙度,每个位置为静态值。
  2. 天气层:从 Open-Meteo API 获取历史天气数据,并构建 3 天和 7 天滚动降雨量总和。
  3. 物理层(FS):使用无限边坡稳定性模型计算每个位置每小时的安全系数。干条件下基线 FS 在 1.5-2.5 之间,持续降雨时 FS 可降至 1.0 以下。
  4. 传感器层:位移由背景噪声和 FS 驱动的蠕变项构成;振动含背景噪声和事件触发峰值(按坡度和假设破坏质量缩放)。
  5. 事件层:每个位置事件数量服从泊松分布(λ=5),80% 事件位于低 FS 时刻(FS≤1.3),20% 随机分布。
  6. 整合层:所有层级合并为小时级主数据集。

已知局限

  • 事件标签和传感器读数并非真实观测结果,模型需经真实数据验证。
  • FS 计算使用单点无限边坡模型,忽略 3D 应力、空间地下水和裂隙力学效应。
  • 事件总数受泊松过程控制,FS 与 Rockfall_Event 标签的直接相关性较弱。
  • 75 个正例分布于近 400,000 行数据,类别严重不平衡。
  • 各位置事件数量为 2 至 10 不等,生成具有随机性。
  • 约 1% 的传感器读数缺失,模拟现实传感器故障。

建议用途

  • 二元分类:基于地形、天气、传感器和 FS 特征预测岩石崩塌风险。
  • 异常检测:利用严重类别不平衡模拟真实部署场景。
  • 前兆/预警研究:通过 FS 驱动的位移蠕变研究事件前的提前检测窗口。
  • 跨位置泛化测试:评估模型在 15 个不同地形和 FS 基线位置的表现。
  • 特征消融研究:比较仅使用地形、天气、传感器或 FS 输入的相对价值。
  • 方法论基准测试:在半合成但物理驱动条件下进行不平衡稀有事件分类。

代码与可复现性

完整生成流水线已开源,包含 QGIS 地形提取工作流、Open-Meteo 天气获取脚本、基于 FS 的物理信息传感器仿真脚本、合并脚本及验证与绘图脚本。代码仓库:https://github.com/kaizen105/Rockfall_dataset

引用与许可

使用本数据集时请注明作者并说明其合成性质。数据集采用 CC-BY-4.0 许可发布。

搜集汇总
数据集介绍
noamundi-rockfall-simulation-dataset 数据集图片
构建方式
本数据集依托物理信息驱动的模拟框架构建,融合了印度Noamundi矿区真实地形与气象数据。地形特征源于OpenTopography的数字高程模型,经QGIS处理提取坡度、坡向、粗糙度等静态属性;气象数据通过Open-Meteo API获取历史温度、降水、风速及辐射信息,并衍生出三日与七日滚动降雨量。物理核心采用无限斜坡稳定性模型逐小时逐点位计算安全系数,该系数基于真实坡角与降雨驱动的孔隙水压力动态耦合,进而驱动模拟传感器读数(位移速率与振动幅度)及岩崩事件的生成。事件数量遵循泊松过程以保障数据可用性,但80%的事件被加权分配至低安全系数时段,余下20%则随机分布以模拟非降雨触发机制。所有层级最终合并为包含393,855条记录、15个模拟监测点、覆盖2021至2023年逐小时快照的综合性数据集。
特点
该数据集兼具物理真实性与设计合成性双重特质,为岩崩预警研究提供了稀缺的数据基础。地形与气象层锚定真实地理环境,而安全系数层基于可引用的经典岩土力学公式,使位移蠕变与事件时序具备可解释的物理因果链。数据集高度模拟真实场景中的极端类别不平衡,75次正例事件散布于近40万条记录中,迫使模型在严苛条件下学习前兆信号。此外,15个监测点的地形与安全系数基线存在显著差异,为跨位置泛化测试提供了天然实验场。约1%的传感器缺失值进一步复现了真实物联网环境中的数据中断挑战,使模型训练更贴近实际部署需求。
使用方法
该数据集适用于多类机器学习任务,尤其聚焦于岩崩早期预警与异常检测范畴。研究者可直接使用文本特征进行二分类建模,以时间戳、位置标识、地形静态属性、气象动态变量、安全系数及传感器读数为输入,预测岩崩事件标签。鉴于严重的类别不平衡,异常检测算法如孤立森林或自编码器可有效探索非正常数据模式。关注前兆识别的研究者可聚焦安全系数驱动的位移蠕变序列,分析事件前的时序特征变化。跨位置泛化评估允许按监测点划分训练与测试集,检验模型对非均匀地形条件的适应能力。特征消融实验有助于量化不同输入维度(如纯气象、纯传感器或纯物理特征)的预测贡献。代码管线已开源,支持用户复现或调整参数扩展模拟。
背景与挑战
背景概述
Noamundi Rockfall Simulation Dataset由独立研究者Kaizen于2024年创建,旨在通过物理信息驱动的合成数据,推动岩崩早期预警系统的研究。该数据集融合了印度诺阿蒙迪矿区真实的地形与气象数据,并结合无限边坡稳定性模型(Skempton and DeLory公式)模拟传感器读数和岩崩事件标签,为岩崩前兆检测、异常识别及灾害分类提供了标准化基准。其核心研究问题在于如何利用实时地形、天气及力学参数预测极度稀有的岩崩事件。由于真实岩崩数据稀缺且获取困难,该数据集通过模拟填补了领域空白,成为评估跨位置泛化能力、特征消融及不平衡分类方法的重要资源,已对地球灾害智能监测领域产生显著影响。
当前挑战
该数据集面临的核心挑战在于模拟与现实之间的鸿沟。首先,岩崩事件天然极其稀有且机制复杂,传统模型难以覆盖三维应力效应、裂隙力学及非降雨触发因素(如热循环或爆破),导致约20%的事件随机分布而非完全由物理模型驱动,削弱了因子安全度与标签的直接相关性。其次,构建过程中采用泊松过程控制事件数量以保持数据可用性,但造成了类别极端不平衡(75个正样本分布于近40万行数据)和位置间事件计数差异,使统计推断不确定性较高。此外,传感器模拟引入约1%的随机缺失以模拟真实故障,进一步加剧了模型在实际部署前的验证难度。
常用场景
经典使用场景
该数据集最经典的使用场景在于对滑坡前兆的二元分类任务,通过结合真实地形、气象数据与物理信息驱动的合成传感器读数,构建了一个高度类不平衡的罕见事件预测问题。研究者可利用该数据集训练模型,区分潜在的滑坡风险时刻与安全时刻,从而验证分类算法在极端稀疏正样本下的鲁棒性。同时,异常检测也是其核心应用方向,由于正样本占比极低(约0.02%),该数据集完美复现了现实世界中滑坡监测数据的长尾分布特性,为开发对罕见事件敏感的异常检测方法提供了可靠的基准测试环境。
衍生相关工作
该数据集催生了多个方向的经典衍生研究工作,包括特征消融研究,系统比较仅用地形特征、气象特征、传感器特征或安全系数特征时的预测性能差异,从而揭示各模态数据对滑坡预警的贡献权重;跨位置泛化测试,探索由15个异质性监测位置组成的多源时空数据集上域自适应迁移学习方法的有效性;以及时序前兆检测研究,利用安全系数驱动的蠕变位移序列开发具有提前预警时间的事件预测模型,这类工作通常引入注意力机制或序列到序列架构来捕捉故障前的非线性信号演化规律。
数据集最近研究
最新研究方向
在岩崩地质灾害预警领域,该数据集通过融合真实地形与气象数据与物理信息驱动模拟,开创了基于无限边坡稳定性模型的人工智能训练范式。其前沿价值体现在利用稀缺事件模拟与极端类别不平衡,推动面向早期预警的异常检测、前兆识别和跨地点泛化研究。结合IoT传感器仿真与泊松过程事件标注,该数据集为构建物理可解释的岩崩预测模型提供了坚实基准,显著促进了矿山边坡稳定性量化评估与灾害智能化管理的工程实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务