遇见数据集

OpenSWI

收藏
arXiv2025-08-14 更新2025-11-27 收录
官方服务:

资源简介:

OpenSWI是一个用于表面波频散曲线反演的综合性基准数据集,由表面波反演数据准备(SWIDP)流程生成。OpenSWI包含两个合成数据集,分别为OpenSWI-shallow和OpenSWI-deep,以及一个用于评估模型泛化能力的OpenSWI-real真实世界数据集。OpenSWI-shallow基于2D地质模型数据集OpenFWI,包含超过2200万个1D速度剖面及其对应的基本模式相速度和群速度频散曲线,涵盖了广泛的浅层地质结构。OpenSWI-deep由14个全球和区域3D地质模型组成,包含约126万个高保真的1D速度-频散数据对,适用于深层地球研究。OpenSWI-real从开源项目中编译,包含两组观测频散曲线及其对应的1D参考模型,用于评估深度学习模型的泛化能力。

OpenSWI is a comprehensive benchmark dataset for surface wave dispersion curve inversion, generated by the Surface Wave Inversion Data Preparation (SWIDP) workflow. It includes two synthetic datasets, namely OpenSWI-shallow and OpenSWI-deep, as well as an OpenSWI-real real-world dataset for evaluating model generalization capability. OpenSWI-shallow is based on the 2D geological model dataset OpenFWI, containing over 22 million 1D velocity profiles and their corresponding fundamental-mode phase and group velocity dispersion curves, covering a wide range of shallow geological structures. OpenSWI-deep consists of 14 global and regional 3D geological models, containing approximately 1.26 million high-fidelity 1D velocity-dispersion data pairs, suitable for deep Earth research. OpenSWI-real is compiled from open-source projects, including two sets of observed dispersion curves and their corresponding 1D reference models, which is used to evaluate the generalization ability of deep learning models.

创建时间:
2025-08-14
搜集汇总
数据集介绍
OpenSWI 数据集图片
构建方式
OpenSWI的构建依托于一套名为SWIDP的标准化数据生成管线,从全球公开的地质模型与实测数据出发,历经严格的质量控制与参数统一化。针对浅层研究,从OpenFWI的二维地质模型中提取超过340万条一维速度剖面,并通过对层厚与速度施加随机扰动进行4至10倍扩增,最终生成逾2200万组样本;深层子集则整合了LITHO1.0等14个全球及区域三维模型,提取约21万条原始剖面后,利用基于莫霍面识别的分层样条扰动策略扩增至约126万条。所有剖面均通过正演模拟生成基阶瑞利波相速度与群速度频散曲线,并采用混合采样策略覆盖宽频周期范围,确保数据在物理一致性与数值稳定性上的高质量。
特点
该数据集以规模宏大、地质多样性与标准化格式为突出特点。OpenSWI-shallow覆盖平坦层、断层、褶皱等五种典型浅层构造,样本量达千万级;OpenSWI-deep囊括全球与区域尺度的深部结构,样本量逾百万,周期延伸至100秒,深度达300公里。此外,数据集创新性地引入扩散概率模型实现地质模型的持续生成,进一步丰富了构造多样性。配套的OpenSWI-real提供了来自长滩与CSRM项目的真实观测频散曲线及参考速度模型,专为评估深度学习模型的泛化能力而设计,填补了该领域缺乏大规模、多尺度基准数据集的空白。
使用方法
OpenSWI以统一的数据格式提供,每个样本包含周期、相速度、群速度与对应的一维横波速度剖面,可直接用于监督学习。用户可基于SWIDP工具箱自定义数据生成流程,调整周期范围、采样策略或扩增倍数。实验表明,基于Transformer架构的模型在合成数据上训练后,无需微调即可对真实观测数据实现高精度反演,验证了数据集的代表性与实用性。所有数据、预训练模型及代码均已开源,支持研究者复现、迁移学习或构建更复杂的多模态联合反演框架。
背景与挑战
背景概述
面波频散曲线反演是重构地下横波速度结构的关键地球物理技术,广泛应用于浅层工程勘探与深部地质研究。然而,传统反演方法严重依赖初始模型且易陷入局部极小值,计算效率低下。近年来,深度学习方法的兴起为突破这些瓶颈提供了新契机,但高质量、大规模基准数据集的匮乏严重制约了该领域的发展。为此,上海人工智能实验室联合上海交通大学、成都理工大学及中国地震局等机构的研究人员于2025年发布了OpenSWI数据集。该数据集通过系统化的数据构建流程SWIDP,整合了来自OpenFWI的浅层二维地质模型与全球14个三维深部地质模型,生成超过2200万条浅层一维速度剖面与约126万条深部高保真数据对,并配套构建了面向真实场景的评估数据集OpenSWI-real,为智能面波反演研究提供了坚实的数据基础。
当前挑战
OpenSWI所解决的领域核心挑战在于传统面波反演方法对初始模型敏感、非线性优化易陷入局部最优且计算成本高昂,深度学习虽能有效规避这些缺陷,但训练数据的质量与多样性直接决定模型性能。在数据集构建过程中,面临多重困难:其一,实际观测数据多属专有且难以获取,同时受观测条件与主观拾取影响,频散曲线常存在噪声污染与数据缺失;其二,速度模型与频散曲线间的非唯一性使监督学习训练复杂化;其三,原始地质模型来源多样,存在格式不统一、参数类型差异大(如仅提供vp或vsv/vsh)等问题,需经过严格的质量控制、参数转换与标准化处理;此外,为提升地质多样性,还需设计扰动增强与扩散模型生成策略,在保证物理合理性的前提下扩展样本空间,这对数据生成流程的鲁棒性与可扩展性提出了极高要求。
常用场景
经典使用场景
在地球物理勘探与深部地质研究领域,面波频散曲线反演是重建地下横波速度结构的关键技术。OpenSWI数据集为这一经典任务提供了规模空前的基准资源,其浅层子集(OpenSWI-shallow)涵盖超过2200万条一维速度剖面,模拟了水平层状、断层、褶皱及复杂沉积等多种地质构造场景;深层子集(OpenSWI-deep)则整合全球14个三维地质模型,包含约126万条高保真速度-频散数据对,覆盖地壳至300公里深度的上地幔结构。研究者可基于该数据集训练深度学习模型,实现从频散曲线到速度剖面的端到端映射,从而摆脱传统方法对初始模型的依赖和局部极小值陷阱,显著提升反演效率与精度。
衍生相关工作
OpenSWI的发布催生了一系列衍生研究工作。其配套的SWIDP工具箱提供了从速度模型提取、数据增强到频散曲线正演的完整流水线,支持用户灵活构建定制化数据集。基于该数据集,研究者已开发出多种Transformer架构的反演网络,并验证了其在不同地质背景下的迁移能力。数据集中的扩散概率模型(DDPM)模块开创了利用生成式模型持续扩充地质结构多样性的新范式,衍生出结构感知正则化与多尺度建模等改进策略。此外,OpenSWI-real真实数据子集为评估模型泛化性能提供了标准化基准,促进了跨区域、跨深度的迁移学习方法研究,推动了面波反演领域向多模态、多物理场联合反演方向演进。
数据集最近研究
最新研究方向
在面波频散曲线反演领域,深度学习方法的崛起正推动着地质勘探与地球内部成像技术的范式变革。然而,传统反演方法对初始模型的敏感性与局部极小值困境长期制约其应用效能,而大规模、多样化基准数据集的匮乏更成为智能化反演发展的关键瓶颈。OpenSWI的诞生恰逢其时,它以超过2200万条浅层速度剖面与126万条深层高保真数据对,构建了涵盖平坦层、断层、褶皱乃至真实地层结构的跨尺度样本库,并创新性地引入扩散概率模型(DDPM)实现地质结构的持续扩充。该数据集不仅为Transformer等深度网络提供了训练基础,更在Long Beach与CSRM等真实观测数据上展现出无需微调即可媲美传统反演结果的泛化能力,标志着面波反演从经验驱动向数据驱动转型的重要里程碑,为资源勘探、地震灾害评估与地球动力学研究开辟了智能化新路径。
相关研究论文
  • 1
    通过上海交通大学电子信息与电气工程学院, 上海人工智能实验室, 南京大学地理与海洋科学学院, 成都理工大学, 中国地震局地震预测研究所 · 2025年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务