遇见数据集

mmu_hsc_pdr3_wide_21

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

mmu_hsc_pdr3_wide_21 数据集是 HATS 目录集合的一部分,属于 Multimodal Universe 项目,旨在提供大规模多模态天文数据用于机器学习研究。该数据集源自 Hyper Suprime-Cam Subaru Strategic Program (HSC-SSP) 的第三次公开数据发布 (PDR3) 的 Wide 层,覆盖约 700 平方度,包含超过 320 万个天体。每个天体提供 5 个光学波段 (g, r, i, z, y) 的 160×160 像素图像切片(像素尺度 0.168 角秒),以及对应的通量图、反方差图、二进制掩膜(标记坏像素、饱和像素和无数据区域)、每个波段的 PSF 半高全宽和像素尺度。此外,还包含 cmodel 星等及其误差、消光值、延展性指标、自适应形状矩等共 55 列。数据以 Apache Parquet 格式存储,可通过 LSDB 框架高效访问和交叉匹配。典型应用包括星系形态学、光红移估计、强引力透镜搜索和自监督表示学习。注意:选择时仅包含延展源(i 波段延展性 > 0.5)且 z 波段 cmodel 星等小于 21 的天体,因此不适合星-星系分类任务;图像边缘或亮星附近的切片可能包含掩膜或零值区域。

The mmu_hsc_pdr3_wide_21 dataset is part of the HATS catalog collection, belonging to the Multimodal Universe project, which aims to provide large-scale multimodal astronomical data for machine learning research. This dataset originates from the Wide layer of the third public data release (PDR3) of the Hyper Suprime-Cam Subaru Strategic Program (HSC-SSP), covering approximately 700 square degrees and containing over 3.2 million celestial objects. Each object provides 160×160 pixel image cutouts in five optical bands (g, r, i, z, y) with a pixel scale of 0.168 arcseconds, along with corresponding flux maps, inverse variance maps, binary masks (marking bad pixels, saturated pixels, and no-data regions), PSF full width at half maximum and pixel scale for each band. Additionally, it includes 55 columns such as cmodel magnitudes and their errors, extinction values, extendedness indicators, and adaptive shape moments. The data is stored in Apache Parquet format and can be efficiently accessed and cross-matched using the LSDB framework. Typical applications include galaxy morphology, photometric redshift estimation, strong gravitational lens search, and self-supervised representation learning. Note: The selection only includes extended sources (i-band extendedness > 0.5) with z-band cmodel magnitude less than 21, making it unsuitable for star-galaxy classification tasks; cutouts near image edges or bright stars may contain masks or zero-value regions.

创建时间:
2026-08-28
原始信息汇总

mmu_hsc_pdr3_wide_21 数据集概述

数据集基本信息

  • 名称: mmu_hsc_pdr3_wide_21 HATS Catalog Collection
  • 许可协议: CC-BY-4.0
  • 数据规模: 1M < n < 10M 行
  • 所属项目: Multimodal Universe(多模态宇宙项目),该项目汇集了大规模多模态天文数据,详见论文《The Multimodal Universe: Enabling Large-Scale Machine Learning with 100TBs of Astronomical Scientific Data》。

数据来源与背景

该数据集基于Hyper Suprime-Cam Subaru Strategic Program (HSC-SSP) 第三次公开数据发布(PDR3)中的 Wide 层数据。Wide 层是 HSC-SSP 三个观测层中最浅但覆盖面积最大的部分,使用位于 8.2 米斯巴鲁望远镜上的 Hyper Suprime-Cam 拍摄。数据选择要求在每个波段至少有三次观测覆盖(全深度全色覆盖),最终覆盖面积约为 700 平方度。

数据内容与规模

属性
行数 3,226,161
列数 55
分区数 1,422
磁盘占用 2.5 TiB
HATS 构建工具 hats-import v0.9.0, hats v0.9.0

数据集包含约 320 万个图像切片(cutouts),每个切片尺寸为 160 × 160 像素,覆盖 5 个光学波段(g、r、i、z、y),像素尺度为 0.168 角秒,对应每边约 27 角秒的视场。

数据模态

每个目标包含以下信息:

  • 通量图像 (image.flux)
  • 逆方差图 (image.ivar)
  • 二进制掩码 (image.mask),标记坏像素、饱和像素和无数据区域
  • 各波段的 PSF FWHM (image.psf_fwhm) 和 像素尺度 (image.scale)
  • cModel 星等及误差(g、r、i、z、y 五个波段)
  • 消光值(a_g、a_r、a_i、a_z、a_y)
  • 扩展度值(各波段的 extendedness_value)
  • 自适应形状矩(各波段的 SDSS 形状参数)

主要列字段

数据集包含以下主要列(均为 float 类型,带下划线特殊前缀的属于嵌套字段):

  • radec:天球坐标(double 类型)
  • object_id:目标标识符(string 类型)
  • _healpix_29:HEALPix 像素索引(int64 类型)
  • image.bandimage.fluximage.ivarimage.maskimage.psf_fwhmimage.scale:图像相关嵌套字段
  • a_ga_y:各波段消光值
  • 各波段 _extendedness_value_cmodel_mag_cmodel_magerr_sdssshape_psf_shape*_sdssshape_shape*:天文测量参数

目标选择标准

目标选自 pdr3_wide.forced 表,具体条件包括:

  • z 波段 cModel 星等小于 21corrected_z_cmodel_mag < 21
  • 限制为扩展源i_extendedness_value > 0.5
  • 五个波段各有至少三次曝光
  • 排除受亮星掩模、图像边缘、饱和像素、宇宙射线、插值像素或坏像素影响的目标
  • 排除 cModel 测光不可靠的目标

选择查询详见 Multimodal Universe 仓库中的 pdr3_wide_21.sql 文件。

数据访问与使用

推荐使用 LSDB Python 框架访问该 HATS 星表,可通过 pip install lsdbconda install conda-forge::lsdb 安装。数据以 Apache Parquet 格式存储,可配合多种工具使用(如 pandas、pyarrow、dask、Spark、DuckDB)。HATS 目录支持通过 LSDB 进行高效的交叉匹配操作。

典型应用场景

  • 星系形态学研究
  • 光度红移估计
  • 强引力透镜搜索
  • 自监督表征学习
  • 与 DESI Legacy Imaging Surveys 的交叉仪器对比研究(观测区域重叠)

注意事项

  • 星等截断在 z 波段而扩展度在 i 波段测量,选择函数具有颜色依赖性
  • 点源已被排除,因此该样本不适用于恒星-星系分类任务
  • 巡天足迹边缘或亮星附近的切片可能包含掩模或零值区域
  • 未进行超出 HSC 管线自身处理的去混叠处理,拥挤区域可能包含邻近源

引用说明

在科学出版物中使用该数据集时,请引用 HSC-SSP 巡天及数据发布相关论文:

  • Aihara et al. (2018), The Hyper Suprime-Cam SSP Survey: Overview and survey design, PASJ 70, S4 — https://doi.org/10.1093/pasj/psx066
  • Aihara et al. (2022), Third data release of the Hyper Suprime-Cam Subaru Strategic Program, PASJ 74, 247 — https://doi.org/10.1093/pasj/psab122

使用 HSC 数据需要注明“NAOJ / HSC Collaboration”。完整使用条款参见 HSC-SSP 数据发布网站。

搜集汇总
数据集介绍
mmu_hsc_pdr3_wide_21 数据集图片
构建方式
该数据集源自Hyper Suprime-Cam Subaru Strategic Program(HSC-SSP)第三次公开数据释放(PDR3)的Wide层,构建过程基于严格的筛选条件与HATS目录规范。原始数据从pdr3_wide.forced表中提取,限定z波段修正cModel星等小于21、i波段延伸度大于0.5的天体,并要求五个光学波段(g、r、i、z、y)均至少三次曝光,同时排除受亮星掩膜、图像边缘、饱和、宇宙射线、插值或坏像素影响以及cModel测光不可靠的源。筛选后的源被组织为HATS目录,每个天体对应一幅160×160像素的五波段图像裁切,并关联通量、逆方差、掩膜、PSF FWHM、像素尺度、消光、延伸度及自适应形状矩等元数据,最终覆盖约700平方度的天区,包含约322万个天体。
特点
数据集以多模态天文学数据为核心特色,融合了图像裁切与表格化测光属性。每个天体提供五个光学波段的图像数据,像素尺度为0.168角秒,单边约27角秒,同时附带逆方差图和二进制掩膜用于标识坏像素、饱和及无数据区域。表格部分包含cModel星等、消光值、延伸度以及SDSS形状的PSF与自适应矩,列数达55个,存储为Apache Parquet格式并采用HEALPix分区,总规模约2.5 TiB。该数据集专为暗弱延伸源设计,适用于星系形态、光度红移估计、强引力透镜搜索及自监督表示学习等任务,且其天区与DESI Legacy Imaging Surveys重叠,便于跨仪器比较研究。
使用方法
使用该数据集推荐采用LSDB Python框架,可通过pip或conda安装后,以lsdb.open_catalog()函数直接加载HATS目录,例如传入Hugging Face数据集路径即可访问全天天区。LSDB利用HEALPix分区实现高效交叉匹配,避免全量数据加载,仅需指定半径参数即可完成与其他星表的匹配。数据亦可借助pandas、pyarrow、dask、Spark或DuckDB等工具读取,每个HATS目录包含collection.properties、hats.properties、partition_info.csv及skymap.fits等元数据文件,便于理解数据组织。实际应用中需注意,星等限制在z波段而延伸度在i波段测量,导致选择函数依赖颜色,且样本排除点源,不适用于恒星-星系分类;边缘或亮星附近的裁切可能包含掩膜区域,用户可通过image.mask字段识别。
背景与挑战
背景概述
在大规模天文观测数据呈指数级增长的当下,如何高效整合多波段影像与测光信息以驱动机器学习研究,成为天体物理学与数据科学交叉领域的关键命题。mmu_hsc_pdr3_wide_21数据集于2024年随Multimodal Universe项目发布,由多机构联合团队基于Hyper Suprime-Cam Subaru Strategic Program第三次公开数据释放构建。该数据集从约700平方度的广域天区中精选322万余个星系源,提供五个光学波段的图像切片及完整测光属性,旨在为星系形态分类、光度红移估计和自监督表示学习等任务提供标准化的多模态基准,对推动天文数据驱动的可复现研究具有重要影响力。
当前挑战
该数据集所应对的领域问题在于,传统星系形态与测光红移研究依赖小样本或单一波段信息,难以支撑大规模深度模型的训练与泛化,而多波段图像数据的异构性和高维度对数据表示与算法鲁棒性提出了严峻考验。构建过程中,数据集面临多重技术挑战:需从海量HSC星表中严格筛选满足全深度五波段覆盖且未被亮星掩模、边缘或坏像素污染的源,同时保持选源函数在不同颜色下的自洽性;星表以HEALPix分区和嵌套结构存储,对跨波段数据对齐与高效访问提出要求;此外,截断在z波段而延展性在i波段测量的设计导致选择函数具有颜色依赖性,点源被完全排除,密集区域中邻近源的去混叠亦未超出HSC流程的固有处理,这些因素共同构成了数据使用中不可忽视的系统性挑战。
常用场景
经典使用场景
在当代天文学与机器学习交叉领域,大规模多波段成像数据为星系形态分类、测光红移估计等任务提供了关键支撑。mmu_hsc_pdr3_wide_21数据集凭借其覆盖约700平方度的Hyper Suprime-Cam PDR3宽视场测光数据,成为训练和评估深度模型的经典基准。其核心使用场景是提供五波段(g、r、i、z、y)图像切图及对应逆方差图与掩膜,并以cModel星等、延展度、自适应形状矩等测光参数作为辅助标签。研究者常将此数据集用于有监督的星系形态分类、基于切图的自监督表征学习,以及测光红移的端到端回归,借助统一的数据格式和HEALPix分区实现高效的大规模模型训练。
解决学术问题
该数据集有力缓解了天文机器学习研究中长期存在的若干瓶颈。首先,它通过统一、高质量的多波段成像与测光标签,使星系形态分类和测光红移估计得以在标准化的大样本上可复现地比较,削弱了不同巡天数据处理差异带来的偏差。其次,五波段深度成像与逆方差图、掩膜的搭配,为自监督学习提供了丰富的物理先验,减少了模型对人工标注的依赖。再者,其与DESI Legacy Imaging Surveys等巡天的天区重叠,支持跨仪器、跨分辨率的泛化性研究,推动了模型鲁棒性和可迁移性的评估,对建立可扩展的天文基础模型具有深远意义。
衍生相关工作
该数据集作为Multimodal Universe计划的重要组成部分,衍生了一系列经典工作。基于其切图与测光参数,研究者开展了星系形态分类和自监督表征学习的基准测试,推动了天文视觉模型的发展。该数据集的HATS格式与LSDB工具链结合,催生了高效的天区交叉匹配方法,支持跨巡天的大规模联合分析。此外,该数据集被用于构建测光红移估计和强透镜搜寻的公开挑战,促进了算法比较与可复现研究。其与DESI Legacy Imaging Surveys的重叠区域,还激发了跨仪器数据融合与迁移学习的研究,为后续多模态天文数据集的设计提供了范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务