遇见数据集

hugging-science/mmu_legacysurvey_dr10_south_21

收藏
Hugging Face2026-06-16 更新2026-06-21 收录
官方服务:

资源简介:

这是代表mmu_legacysurvey_dr10_south_21的HATS目录集合。

This is the collection of HATS catalogs representing mmu_legacysurvey_dr10_south_21.

提供机构:
hugging-science
搜集汇总
数据集介绍
hugging-science/mmu_legacysurvey_dr10_south_21 数据集图片
构建方式
mmu_legacysurvey_dr10_south_21 数据集源自 DESI Legacy Imaging Surveys Data Release 10 (DR10) 的南方巡天观测,覆盖约 15,000 平方度的天区。数据集以 HATS (Hierarchical Astronomical Survey Tiling System) 格式组织,采用 Apache Parquet 格式存储,并通过 HEALPix 层次化网格对 1.23 亿个图像切片进行分区管理。数据构建过程中,仅依据特定的对象类型、星等、四波段观测可用性及质量标志进行筛选,未施加额外的后期处理。为了确保交叉匹配的完整性,还提供了默认的 10 角秒边界目录。
特点
该数据集的核心特点在于其多模态与大规模性,包含 1.24 亿个 160×160 像素的图像切片,覆盖 g、r、i、z 四个光学波段,像素尺度为 0.262 角秒。每个图像切片均附带 Legacy Survey 分析流程产生的丰富测量数据,包括通量、方差、掩模及形态参数等 35 个字段。数据采用 HATS 标准结构,支持高效的跨星表交叉匹配,同时提供嵌套的星表与图像信息,便于天文机器学习应用,如引力透镜识别和星系形态分类。
使用方法
推荐使用 LSDB Python 框架访问该数据集,可通过 pip install lsdb 安装。用户可通过 lsdb.open_catalog 方法直接加载数据集,例如 `catalog = lsdb.open_catalog("https://huggingface.co/datasets/hugging-science/mmu_legacysurvey_dr10_south_21")`。LSDB 利用 HEALPix 分区实现内存高效的交叉匹配操作,用户可通过 `catalog.crossmatch(other, radius_arcsec=1.0)` 与其他星表进行精确配对。此外,Apache Parquet 格式兼容 pandas、pyarrow、DuckDB 等多种工具,支持灵活的分布式数据分析。
背景与挑战
背景概述
mmu_legacysurvey_dr10_south_21数据集作为Multimodal Universe项目的重要组成部分,于2024年由多家天文科研机构联合发布,旨在为大规模机器学习研究提供丰富的多模态天文数据。该数据集源自DESI Legacy Imaging Surveys的第十期数据发布(DR10),覆盖南天约15,000平方度,包含1.24亿个160×160像素的星系图像切块,涵盖g、r、i、z四个光学波段,像素尺度为0.262角秒。核心研究问题聚焦于利用海量天文影像数据推动机器学习在天文学中的应用,例如强引力透镜识别和星系形态分类。该数据集的发布显著提升了多模态天文数据在深度学习领域的可用性和标准化水平,为天体物理研究提供了前所未有的数据基础,对计算天文学和天体信息学的发展产生了深远影响。
当前挑战
该数据集主要致力于解决天文大数据时代的研究挑战,尤其是传统天文数据分析方法在处理超大规模多波段成像数据时面临的效率瓶颈和维度灾难问题。ImageNet等经典数据集推动了图像分类任务,而mmu_legacysurvey_dr10_south_21则聚焦于天文特定任务,如弱引力透镜检测、星系形态自动分类和瞬变源识别,这些任务需处理高度复杂的空间结构和噪声环境。在构建过程中,挑战包括对原始Legacy Survey数据中超过1.2亿个源进行严格筛选,依据对象类型、星等、四波段观测质量标志等多重条件剔除劣质数据,同时保留数据的统计完整性;此外,需将数据转换为HATS(HEALPix Adaptive Thin Splitting)格式和Apache Parquet存储,以确保在61.1 TiB的数据规模下实现高效分区和跨匹配操作,且需设计边缘目录避免近邻源丢失,这对数据压缩、索引构建和元数据管理提出了极高要求。
常用场景
经典使用场景
mmu_legacysurvey_dr10_south_21数据集是由DESI Legacy Imaging Surveys第十次数据发布的南天成像数据所构建的大规模多模态天文数据集,涵盖了约1.24亿个天体目标的四波段(g、r、i、z)图像切片及对应的光度测量信息。该数据集的经典使用场景集中于基于深度学习的强引力透镜识别与星系形态分类任务,研究人员可以利用其丰富的图像特征与结构化管道测量结果,训练高精度分类模型以自动发现罕见的天体现象。其高达61.1 TiB的存储规模与HEALPix分区组织方式,也为大规模天文学数据的分布式处理与跨表交叉匹配提供了标准化底座。
解决学术问题
该数据集有效解决了传统天文研究中人工视觉检测效率低下与样本覆盖不足的核心瓶颈。通过提供百万量级、均匀处理的南天空四波段图像及配套的流量、形状、掩膜等元数据,研究者得以在统一标准下开展对弱引力透镜信号、星系形态演化以及前景星族特性的大数据统计分析。其结构化的HEALPix分区与LSDB交互框架相辅相成,大幅降低了跨表交叉匹配的计算门槛,使天文学家能够更加便捷地探讨不同巡天数据间的天体一致性检验与多波段辐射特性关联,从而推进对宇宙大尺度结构与星系形成演化的理解。
衍生相关工作
该数据集衍生出了一系列具有里程碑意义的研究工作,其中最引人注目的是《The Multimodal Universe: Enabling Large-Scale Machine Learning with 100TBs of Astronomical Scientific Data》一文,该工作系统性地整合了多个多模态天文数据资源,并首次将mmu_legacysurvey_dr10_south_21作为核心子集予以发布。此外,基于类似Legacy Survey图像切片的先期工作已成功应用于强引力透镜候选体的深度识别与星系形态自动分类,这些方法论为该数据集后续开展更精细的河外星系结构分析、瞬变源识别乃至宇宙学参数推断打下了坚实基础。该数据集还有望催化新一代分层式天文数据管道(如HATS格式与LSDB框架)的标准化推广,进一步推动天文计算生态的协同发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务