遇见数据集

mars-multisensor-dataset

收藏
github2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

包含火星地质特征的多传感器数据集

Multi-sensor Dataset Containing Martian Geological Features

创建时间:
2026-08-12
原始信息汇总

数据集概述

本仓库提供了一套自动化的多传感器数据处理流水线,用于提取和分析火星地质特征。数据来源于 NASA 的轨道数据浏览器(ODE),数据集经过标准化处理,可直接用于机器学习模型的训练与评估。

数据集构建目标

  • 针对火星地质特征(如撞击坑、沟壑等),整合来自不同轨道传感器的观测数据。
  • 每个数据样本定义为一个地质特征及其对应的多传感器观测数据(如影像、光谱等),并裁剪为统一的格式。
  • 输出数据集的每个样本包括空间数据数组和嵌入的元数据(如轴名称、地面坐标指示、特征位置、原始产品标签等)。

数据集结构

数据集存储在单一目录中,不打包为压缩文件,而是以**独立的对象(裁剪文件)**发布。每个裁剪文件通过主索引文件关联到对应的特征和观测。

dataset/ dataset.json # 描述数据集信息:格式版本、创建时间、来源 features.parquet # 每个特征一行:位置和保留的观测信息 observations.parquet # 每个裁剪文件一行:形状、地面信息、统计量 <class>/<feature>/<instrument>/<identifier>.npz

  • 每个裁剪文件为 .npz 格式,内含空间数据数组和元数据 JSON 对象。
  • 训练时,作业读取索引文件,仅获取所需的裁剪文件,无需下载整个数据集。

可用数据内容

流水线会下载并处理 ODE 元数据,最终生成以下数据产物:

数据对象 内容描述 存储位置
coverage 特征覆盖度测量结果 data/analysis/coverage/
summary 每个特征和仪器组合的汇总 data/analysis/coverage/
catalog ODE 特征集列表 data/_catalog/
metadata 测量所依据的 ODE 记录 data/analysis/metadata/
selection 过滤后保留的特征和观测 data/analysis/selection/
stats 过滤后数据集统计 data/analysis/stats/
dataset 裁剪后的观测数据及其索引 data/building/dataset/

运行与处理流程

  • 流水线首先检查特征可用性,并根据覆盖范围和观测时间窗口条件筛选地质目标。
  • 提供本地运行及在 DigitalHub 集群上的分布式运行方式(通过 --dh 参数)。
  • 所有运行参数、数据集构建选项均通过配置文件管理,确保实验可重复性。

配套工具

  • 定性分析笔记本:逐个特征加载并可视化,缺失的仪器数据会以零值绘制,便于判断数据覆盖情况。
  • 定量分析笔记本:基于过滤后的特征统计数据进行评估,不生成额外文件。
  • CRISM 预处理笔记本:逐步展示对 CRISM 观测数据的光谱校正过程。

数据处理流水线

  • 下载 ODE 元数据,计算每个特征的覆盖度,搜索最佳观测时间窗口,并写入过滤结果。
  • 流水线支持跳过下载(--only-stats)、强制重做(--force)等运行模式。
  • 所有选择与参数均由 configs/ 目录下的 YAML 配置文件控制。
搜集汇总
数据集介绍
mars-multisensor-dataset 数据集图片
构建方式
该数据集依托于美国国家航空航天局(NASA)轨道数据浏览器(ODE)所公开的火星多传感器观测数据,构建了一套规范化的自动分析流水线。其核心流程由两个阶段构成:首先,通过分析管线对地质特征候选目标进行覆盖度测量与观测时间窗口筛选,剔除不符合条件的样本,形成精选特征列表;随后,构建流水线依据该列表,将每个地质特征与其对应的多种传感器观测结果进行关联,形成以特征与观测为基本单位的样本,并裁剪生成标准化遥感数据切片。所有数据以目录结构组织,每个特征为一个子目录,多传感器观测以独立数组文件存于相应仪器目录下,辅以特征及观测的索引元数据,从而完成从原始数据到可训练机器学习格式的转换。
特点
该数据集的核心特征在于其高度自包含与可扩展的架构设计。所有数据聚合在一个目录内,包含数据描述文件、特征表、观测表及逐个数组切片,且每个切片嵌入完整的元数据JSON,确保数据的可解释性与可追溯性;数据切片独立存储,便于按需读取,支持机器学习训练过程中的索引采样与远程获取,降低了数据分发负担。此外,数据集严格遵循自动流水线生成,覆盖了从特征筛选到观测裁剪的完整步骤,保证了数据的一致性。其多传感器特性使每个地质特征都具备多源、多分辨率的观测视角,为研究火星地表构造提供了丰富信息。更关键的是,流水线的配置完全透明,基于配置文件定义运行参数,使得数据集具备可复现与可动态更新能力,适用于对火星地质特征进行大规模、系统性的机器学习研究。
使用方法
使用该数据集开展研究时,用户可依据README中的开发命令,利用uv工具同步运行环境并进行代码规范检验。在本地或DigitalHub集成环境中,通过执行分析流水线(如`uv run python scripts/analysis_pipeline.py`)即可自动下载ODE元数据、测量特征覆盖度、搜索最佳时间窗口并输出筛选结果,其配置均可通过调整`configs/`下的YAML文件实现个性化设置。若要跳过下载与测量并直接从已有数据中选择,可添加`--only-stats`标志;如需强制重新处理,可使用`--force`。此外,用户可通过运行`building_pipeline.py`脚本,从精选特征构建数据集,该脚本支持在DigitalHub分布式环境执行或本地运行。数据下载脚本`dh_download.sh`则方便用户拉取已发布的数据对象。所有操作均遵循配置文件的指导,确保了结果的标准化和可复现性。
背景与挑战
背景概述
mars-multisensor-dataset数据集诞生于行星科学向数据驱动范式转型的关键时期,由致力于火星地质特征自动化解译的研究团队创建,旨在利用NASA轨道数据浏览器提供的多源遥感数据,系统性地构建覆盖火星地质目标的多传感器标准化数据集。该数据集通过自动化分析管线,对ODE元数据进行下载、覆盖度测量与时间窗口筛选,最终生成面向机器学习模型训练与评估的高质量数据产品。其核心研究问题在于如何高效整合可见光、热红外、光谱等多种传感器观测,为火星地质特征的识别与分类提供可靠的数据基础。该数据集的发布显著推动了行星遥感数据分析的标准化进程,为后续基于深度学习的火星地质研究提供了重要的数据支撑,在行星科学和数据挖掘领域均产生了广泛影响。
当前挑战
当前挑战贯穿于火星地质特征多传感器数据集的构建与应用的各个环节。领域层面,火星地质特征的识别面临观测条件严苛、地质目标多样、传感器数据异构等固有难题,需在覆盖度评估与时间窗口优化中兼顾空间分辨率与光谱信息的一致性。构建过程中,自动化管线需应对ODE元数据量庞大且格式复杂的挑战,同时保证特征筛选的可重复性与地理坐标的准确性;多传感器观测的裁剪与存储需兼顾数据完整性与存储效率,避免因数据格式繁杂而导致的信息丢失。此外,数据集在中尺度上缺乏现成的标注基准,且DigitalHub分布式执行环境的引入增加了版本管理与运行配置的复杂性,如何确保数据质量与管线可复现性成为持续挑战。
常用场景
经典使用场景
该数据集是围绕火星地质特征的多传感器观测数据构建的标准化数据集,其经典使用场景集中在行星科学领域的机器学习模型训练与评估中。由于数据将地质特征(如撞击坑、沟壑等)与其对应的多种遥感仪器观测(如可见光影像、热红外光谱、高程数据等)以裁剪后的空间数据切片形式组织,研究者可直接利用这些配对样本开展多模态特征融合研究,例如联合分析不同传感器对同一地质单元的显示差异,或利用地物坐标标签进行多光谱图像中的地质目标检测与语义分割。数据集的索引结构支持按特征或传感器进行哈希式读取,便于构建大规模样本集以训练深度学习网络,同时其地理经纬度元数据又为迁移学习、跨区域泛化测试提供了基线。
衍生相关工作
围绕该数据集的结构与发布方式,衍生了若干具有影响力的科研工作。其中一类聚焦于利用其多传感器配准特性开发智能解译算法,例如训练深度神经网络对火星地形进行分类,或通过对比不同仪器间的数据残差来检测空间异常。另一类衍生工作着重于数据集的构建方法论本身,将其视为一个可复现的开放性科学范例,推动了行星遥感数据预处理框架的规范化与模块化,类似pipelines中的“分析-筛选-构建”模式被后续项目采纳,形成行业内的最佳实践。同时,该数据集也被用作教学与基准测试平台,在行星科学图像理解挑战赛中被用于算法竞技,催生了对数种新型轻量级多模态架构的验证与优化,其嵌入式元数据规范亦推动了跨任务数据集交互标准的研究。
数据集最近研究
最新研究方向
在行星科学领域,多传感器数据的融合与分析正成为揭示火星地质演化历史的关键途径。该数据集构建了一套自动化处理流程,依托NASA轨道数据浏览器(ODE)的丰富观测资源,通过智能筛选与标准化处理,为机器学习模型提供了高价值训练样本。其最新研究方向聚焦于利用多光谱、热红外及高分辨率成像等异构数据的协同分析,以精确刻画火星表面地质特征的时空分布规律。该方向与当前火星探测任务的科学目标高度契合,尤其为寻找潜在水冰沉积物或古代宜居环境线索提供了数据支撑。通过将原始遥感数据高效转化为可供深度模型直接调用的结构化数据集,不仅加速了火星地质特征的高通量识别,也为未来行星科学中数据驱动的研究范式树立了重要标杆。此举对于解译火星环境演变及指导后续无人或载人探测任务具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务