cmgyai/cosmogony-multimodal-v3-scaled
收藏资源简介:
COSMOGONY Multimodal v3 Scaled 是一个公开的、与任务对齐的多模态空间物理表示学习训练语料库。它从公共提供商(如NASA SPDF OMNI每小时和每分钟产品、CelesTrak选定公共轨道组、NASA系外行星档案目录产品)中精选而来,并作为具体化数据集发布,用于直接训练。数据集包含训练分割,共有4,249,403行数据,核心模态包括空间天气时间序列、轨道元素和行星系统目录。规范列包括记录ID、模态(字符串列表)、来源、来源URL、时间戳、特征名称、特征和任务相关性。数据集遵循FAIR原则(可查找、可访问、可互操作、可重用),并应用了严格的质量控制,如非空模态列表、对齐的特征名称和特征、必需的身份/时间字段存在、确定性行排序和重复记录ID移除。预期用途包括空间物理信号的自监督表示学习、掩码重建和预测预训练,以及下游COSMOGONY模型的多模态编码器预热。局限性包括并非所有上游档案的完整镜像、许可证来源特定且版本中模态覆盖偏向空间天气时间序列。
COSMOGONY Multimodal v3 Scaled is a public, mission-aligned training corpus for multimodal space-physics representation learning. It is curated from public providers (such as NASA SPDF OMNI hourly and minute products, CelesTrak selected public orbital groups, NASA Exoplanet Archive catalog products) and published as a materialized dataset for direct training. The dataset includes a train split with 4,249,403 rows, representing core modalities: space weather timeseries, orbital elements, and planetary system catalog. Canonical columns include record_id, modality (list of strings), source, source_url, timestamp, feature_names, features, and task_relevance. It follows FAIR-oriented curation (findable, accessible, interoperable, reusable) with applied quality controls like non-empty modality lists, aligned feature_names and features, presence of required identity/time fields, deterministic row ordering, and duplicate record_id removal. Intended uses include self-supervised representation learning for space-physics signals, masked reconstruction and forecasting pretraining, and multimodal encoder warm-start for downstream COSMOGONY models. Limitations include not being a complete mirror of all upstream archives, source-specific license posture, and modal coverage weighted toward space-weather time series in this version.



