遇见数据集

SeismicX-Cont-mini

收藏
Hugging Face2026-06-14 更新2026-06-15 收录
官方服务:

资源简介:

SeismicX-Cont Mini Two-Hour Subset是完整SeismicX-Cont数据产品的两小时紧凑子集,专为快速下载、教程使用、软件烟雾测试和工作流验证而设计。该数据集包含两个一小时窗口:一个密集地震活动时段(2019年7月6日04:00-05:00 UTC,包含6948个参考拾取)和一个安静时段(2021年11月14日16:00-17:00 UTC,包含7个参考拾取)。数据以结构化HDF5文件存储,包含连续波形数据、SQLite波形索引、标注JSON文件、仪器响应JSON文件以及预训练的相位拾取器模型(如PhaseNet、PNSN v3 diff和SkyNet)。数据集总大小约3.0 GiB,支持地震事件检测、相位拾取、信号处理和机器学习等任务。该子集旨在帮助用户在完整14天数据产品使用前,验证HDF5、标注、SQLite、数据加载器、拾取器和验证工作流的集成。

SeismicX-Cont Mini Two-Hour Subset is a two-hour compact subset of the full SeismicX-Cont data product, designed for quick downloads, tutorial usage, software smoke testing, and workflow validation. The dataset includes two one-hour windows: a period of dense seismic activity (July 6, 2019, 04:00-05:00 UTC, containing 6948 reference picks) and a quiet period (November 14, 2021, 16:00-17:00 UTC, containing 7 reference picks). Data is stored in structured HDF5 files, including continuous waveform data, SQLite waveform index, annotation JSON files, instrument response JSON files, and pre-trained phase picker models (such as PhaseNet, PNSN v3 diff, and SkyNet). The total dataset size is approximately 3.0 GiB, supporting tasks like earthquake event detection, phase picking, signal processing, and machine learning. This subset aims to help users validate the integration of HDF5, annotations, SQLite, data loaders, pickers, and verification workflows before using the full 14-day data product.

创建时间:
2026-06-12
原始信息汇总

数据集概述:SeismicX-Cont Mini Two-Hour Subset

该数据集是 SeismicX-Cont 完整数据产品的一个小型两小时子集,专为快速下载、教程使用、软件冒烟测试以及验证 HDF5、标注、SQLite、数据加载器、拾取器和验证工作流程的兼容性而设计。完整的数据产品托管在 Hugging Face 和 ModelScope 上。

核心信息

  • 语言: 英语
  • 许可证: 自定义 (layered-upstream-compatible-terms)。波形衍生的 HDF5 数据库产品仅用于非商业科学研究。SeismicX-Cont 自创的元数据、文档等遵循 CC BY 4.0;代码遵循 MIT 许可。
  • 大小: 约 3.0 GiB (数据类别: 1GB < n < 10GB)。包含两个波形文件(分别约 1.7 GiB 和 1.2 GiB)和一个响应 JSON 文件(约 119 MiB),可在笔记本电脑上运行。
  • 标签/主题: 地震学、地球物理学、地震、时间序列、波形、信号处理、机器学习、深度学习、地震事件检测、相位拾取、HDF5。

数据内容

该子集包含两个一小时的连续波形数据窗口:

  1. 密集 Ridgecrest 时段: 2019-07-06 04:00-05:00 UTC,包含 6948 个参考拾取(用于测试密集余震行为)。
  2. 静默期时段: 2021-11-14 16:00-17:00 UTC,包含 7 个参考拾取(用于测试低事件率监测行为)。

文件夹布局

数据集根目录为 publish_mini,主要文件结构如下:

text data/ hdf5/ continuous_waveform_usa_20190706_04.h5 # 波形数据文件 continuous_waveform_usa_20211114_16.h5 index/ waveform_index.sqlite # SQLite 波形覆盖索引 label/ annotations_mini_two_hours.json # 两小时标注子集 (原始事件、台站、相位等) stations.csv response/ instrument_responses_mini.json # 仪器响应 JSON picks/ # 生成的拾取 JSONL 文件存放处 notebooks/ seismicx_cont_mini_quickstart.ipynb # 快速入门笔记本 pickers/ phasenet.jit # PhaseNet 模型 pnsn.v3.diff.jit # PNSN v3 diff 模型 skynet.jit # SkyNet 模型 scripts/ # 包含数据处理、拾取、评估等脚本 essd_scripts/ # 复制手稿输出的脚本 utils/ # Python 工具模块 (HDF5 数据集、索引、API)

快速使用步骤 (示例)

以下是在 publish_mini 目录下运行的基本验证步骤:

  1. 验证数据包完整性并检查 SQLite 索引: bash python scripts/verify_full_dataset.py --scan-hdf5 python scripts/example_query_waveform.py --db data/index/waveform_index.sqlite --starttime 2019-07-06T04:00:00 --endtime 2019-07-06T04:05:00 --limit 5

    预期结果:2 个 HDF5 文件,22908 个波形段,971 个台站,6955 个拾取。

  2. 从 SQLite 查询波形: bash python scripts/example_query_waveform.py --db data/index/waveform_index.sqlite --network BK --station BDM --channel BHZ --starttime 2019-07-06T04:00:00 --endtime 2019-07-06T04:01:00 --limit 3

  3. 使用 PyTorch HDF5 数据加载器: bash python scripts/example_dataloader.py --n_samples 2

    或指定单个 HDF5 文件以使用仪器响应校正。

  4. 运行拾取器: bash python scripts/run_picker_to_jsonl.py --h5_input "data/hdf5/continuous_waveform_usa_*.h5" --picker_model pickers/phasenet.jit --output_jsonl data/picks/phasenet.mini.phase.jsonl --canonical_input_length 360000 --max_picks_per_sample 0 --no_auto_restart

  5. 运行三个捆绑拾取器: bash DEVICE=cpu ./scripts/run_pickers.sh

  6. 评估拾取器输出: bash python scripts/evaluate_picks.py --auto-jsonl data/picks/pnsn_v3_diff.mini.phase.jsonl --label-json data/label/annotations_mini_two_hours.json --index-db "${LOCAL_PICK_DB:-/tmp/seismicx_cont_picks.sqlite}" --outdir eval_picks/example --waveform-db data/index/waveform_index.sqlite --tp-tol 1.5 --err-window 5.0 --build-index --drop-existing --plot

  7. 运行 REAL 关联 (需要先编译 scripts/real/real.c): bash python scripts/run_real_association.py --picks-jsonl data/picks/pnsn_v3_diff.mini.phase.jsonl --output-jsonl data/associated/real_events.jsonl --starttime 2019-07-06T04:00:00Z --endtime 2019-07-06T05:00:00Z

引用说明

在使用此迷你子集时,请引用完整的 SeismicX-Cont 数据产品及其原始数据来源。Zenodo 记录地址为:https://zenodo.org/records/20047415,DOI 为:https://doi.org/10.5281/zenodo.20047415

搜集汇总
数据集介绍
SeismicX-Cont-mini 数据集图片
构建方式
SeismicX-Cont-mini 是完整 SeismicX-Cont 数据集的两小时子集,专为快速下载、教程演示及软件冒烟测试而设计。其构建方式基于从原始 MiniSEED 波形档案中提取两个特定的一小时窗口:2019年7月6日04:00-05:00 UTC 的稠密 Ridgecrest 时段(含6948个参考震相拾取)与2021年11月14日16:00-17:00 UTC 的安静时段(含7个参考拾取)。通过灵活的 HDF5 构建脚本(makeh5_flex_seg.py)将源数据按小时分割并压缩为结构化 HDF5 文件,同时利用 SQLite 建立波形覆盖索引,并整合仪器响应 JSON 及标注文件,最终形成约3.0 GiB 的紧凑发布包。
特点
该数据集的显著特点在于其紧凑性与完整工作流的可验证性。Mini 子集虽仅包含两小时数据,却完整保留了 HDF5 波形文件、SQLite 索引、JSON 标注及仪器响应文件,并附带了 PhaseNet、PNSN v3 diff 和 SkyNet 三种震相拾取模型的 TorchScript 权重。其架构支持从波形查询、仪器响应校正、PyTorch 数据加载到震相拾取评估与 REAL 事件关联的端到端流程。特别地,稠密与安静两个时段的设计,使用户能在不同地震活动背景下测试检测与拾取算法,而数据集自带的验证脚本(verify_full_dataset.py)可实现快速完整性检查。
使用方法
数据集的使用遵循清晰的层级化操作路径:首先通过 verify_full_dataset.py 和 example_query_waveform.py 验证包完整性及 SQLite 索引的波形查询功能;随后可调用 example_dataloader.py 加载 PyTorch 数据加载器,并可选地进行仪器响应去除与模拟。震相拾取环节支持单个模型(如 run_picker_to_jsonl.py)或批量运行三种模型(run_pickers.sh),输出 JSONL 格式拾取结果。进一步地,通过 evaluate_picks.py 对拾取结果进行精度评估,并利用 run_real_association.py 将拾取结果输入 REAL 关联算法实现地震事件检测。所有操作均可在 notebooks/seismicx_cont_mini_quickstart.ipynb 中交互式完成。
背景与挑战
背景概述
地震波形数据的连续记录与精细化分析是地震学研究的核心基石,然而,传统地震目录往往依赖人工或半自动方法进行事件检测与震相拾取,其效率与一致性难以满足大规模、高时空分辨率的地震活动监测需求。为应对这一挑战,由Cang Ye等人构建的SeismicX-Cont数据集应运而生,其迷你版SeismicX-Cont-mini于2024年发布,旨在为快速验证和流程测试提供轻量化样本。该迷你子集聚焦于两个代表性时段:2019年Ridgecrest地震序列密集余震期(6948个参考拾取)与2021年平静期(7个参考拾取),从而覆盖了高密度事件与低事件率两种典型监测场景。作为SeismicX-Cont完整数据产品的浓缩版本,该数据集通过HDF5格式存储波形、SQLite索引管理元数据、JSON文件记录标注与仪器响应信息,为深度学习模型在震相拾取、事件关联等任务上的开发与基准测试提供了标准化的数据支撑,对推动地震学与机器学习的交叉融合具有重要价值。
当前挑战
该数据集所解决的领域问题核心在于地震事件检测与震相拾取的自动化挑战。传统方法在密集事件序列中面临震相重叠、低信噪比及多台站关联困难的瓶颈,而SeismicX-Cont-mini通过提供高精度标注的连续波形切片,为训练和评估深度学习模型(如PhaseNet、PNSN v3 diff、SkyNet)提供了基准,从而推进了从原始波形到事件目录的全流程自动化。在构建过程中,主要挑战包括:(1)处理来源于多个台网(涵盖971个台站)的异构原始MiniSEED数据,需统一采样率与格式;(2)整合不同来源的参考标签,确保时间精度与相位标识的一致性;(3)设计可扩展的HDF5存储与SQLite索引结构,以支持灵活按段查询与仪器响应校正;(4)构建轻量化迷你版本时,需在保留完整数据产品关键特征的基础上压缩至约3.0 GiB,同时确保所有脚本与验证流程的可复现性。
常用场景
经典使用场景
SeismicX-Cont-mini作为连续地震波形数据的精炼子集,在深度学习驱动的震相检测与拾取研究中扮演着不可或缺的桥梁角色。该数据集精心选取了两个极具代表性的时段——密集余震序列的2019年里奇克莱斯特地震序列与平静背景下的2021年时段——为研究人员提供了一个兼具高信噪比与低事件率的微型测试平台。经典的使用范式包括利用封装的PyTorch数据加载器与预训练拾取模型(如PhaseNet、PNSN v3 diff与SkyNet)进行端到端的波形处理、震相概率输出与拾取评估,从而在完整数据集的庞大计算资源投入之前,快速验证算法在多种地震活动水平下的鲁棒性与泛化能力。
衍生相关工作
SeismicX-Cont-mini的出现催化了一系列围绕连续波形深度学习处理的开源工具与方法革新。其配套的TorchScript模型包(包括PhaseNet、PNSN v3 diff与SkyNet的即时编译版本)使得模型推理不再受限于特定的深度学习框架版本,促进了跨平台的地震信号处理应用。基于该数据集衍生的共识拾取构建策略(即多模型投票机制)启发了研究者探索更鲁棒的半监督震相标注方法。此外,它与REAL震相关联算法的深度集成,为从连续波形直接产出地震编目的完整管线提供了可复现的参考实现,这一工作流已被多个区域地震台网评估项目采纳,用以加速自动化编目系统的迭代与部署。
数据集最近研究
最新研究方向
地震学领域正以前所未有的深度拥抱深度学习技术,SeismicX-Cont-mini作为精心策划的连续波形基准数据集的微型代表,正引领着地震事件检测与震相拾取研究的范式革新。该子集精选了密集余震序列与安静时段两个极端场景,为验证从端到端波形加载到多模型集成推断的全链条工作流提供了高效入口。当前研究前沿聚焦于结合PhaseNet、PNSN v3 diff与SkyNet等主流神经网络的共识拾取策略,并通过REAL关联算法实现自动化地震事件编目。这种开源、可复现的标准化框架不仅推动了实时地震监测系统向数据驱动转型,更为地球物理领域的可重复性科学树立了典范,加速了机器学习方法从实验室走向实际台网部署的进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务