遇见数据集

UniverseTBD/mmu_jwst_primer_uds_grizli_v6.0_all_96

收藏
Hugging Face2026-05-27 更新2026-03-29 收录
官方服务:

资源简介:

mmu_jwst_primer_uds_grizli_v6.0_all_96 HATS星表集合是多模态宇宙(Multimodal Universe)大规模天文多模态数据的一部分,具体代表詹姆斯·韦伯太空望远镜(JWST)PRIMER/UDS巡天数据的grizli v6.0处理版本。该数据集包含64,679个天文源(行)和647个特征(列),数据大小为6.1 GiB,采用HEALPix分区(11个分区)。星表列包括天文源的基本参数(如位置、通量、误差、背景、掩模等)以及多个JWST波段(如f090w、f115w、f150w、f200w、f356w、f444w等)的测光数据,用于支持大规模天文机器学习研究。数据集以Apache Parquet格式存储,可通过LSDB框架或其他工具(如pandas、pyarrow)访问。

The mmu_jwst_primer_uds_grizli_v6.0_all_96 HATS Catalog Collection is part of the Multimodal Universe, a large-scale collection of multimodal astronomical data, specifically representing the grizli v6.0 processed version of the James Webb Space Telescope (JWST) PRIMER/UDS survey data. The dataset contains 64,679 astronomical sources (rows) and 647 features (columns), with a size of 6.1 GiB, partitioned using HEALPix (11 partitions). The catalog columns include basic parameters of astronomical sources (e.g., positions, fluxes, errors, backgrounds, masks) and photometric data from multiple JWST bands (e.g., f090w, f115w, f150w, f200w, f356w, f444w), designed to support large-scale astronomical machine learning research. The dataset is stored in Apache Parquet format and can be accessed via the LSDB framework or other tools (e.g., pandas, pyarrow).

提供机构:
UniverseTBD
搜集汇总
数据集介绍
UniverseTBD/mmu_jwst_primer_uds_grizli_v6.0_all_96 数据集图片
构建方式
该数据集是基于JWST PRIMER巡天项目在UDS天区获取的观测数据,经过Grizli处理流程生成的v6.0版本天文物表。数据以Apache Parquet格式存储,并采用HATS(Hierarchical Adaptive Tile Storage)层次化自适应瓦片存储方案进行组织,将天空划分为多个HEALPix瓦片,辅以10角秒的边缘目录以保障交叉匹配时数据完整性。整体结构包含主目录、边缘目录及元数据文件,总计64,679行、647个列,磁盘占用约6.1 GiB。
特点
该数据集的核心特点在于其多波段、多维度的丰富信息。它囊括了从紫外到远红外的大量测光与光谱特征,涵盖JWST NIRCam多个滤光片(如F090W至F444W)以及HST ACS/WFC3各通道的流量、背景、误差等细致度量。同时包含源的位置、形态参数、红移估计(光度和光谱)、恒星质量、恒星形成率等物理参数,为研究星系形成与演化提供了极其全面的多波段观测约束。
使用方法
用户可通过LSDB Python框架便捷地访问该HATS格式的星表,只需执行`lsdb.open_catalog()`并传入HuggingFace上的数据集URL即可载入。由于数据以Apache Parquet格式存储,亦能直接利用pandas、pyarrow、Dask、Spark或DuckDB等工具进行高效读取与分析,支持大规模分布式计算与交互式探索。
背景与挑战
背景概述
该数据集隶属于Multimodal Universe项目,由UniverseTBD团队于2024年发布,核心论文《The Multimodal Universe: Enabling Large-Scale Machine Learning with 100TBs of Astronomical Scientific Data》已发表于arXiv。数据集聚焦于JWST PRIMER巡天项目中UDS天区的grizli v6.0处理结果,包含约6.5万个天体的647维特征,涵盖从紫外到远红外的多波段测光、形态参数、光谱能量分布及物理属性(如红移、恒星质量、恒星形成率等)。作为天文多模态数据的关键组成部分,该数据集旨在为机器学习模型提供高质量的星系参数,推动高红移宇宙研究。
当前挑战
领域层面,该数据集旨在解决天文领域普遍存在的多模态数据融合难题,即如何将JWST的高分辨率影像与HST、Spitzer等历代望远镜的测光数据整合,以系统性地研究早期宇宙星系的形成与演化。构建过程中面临三方面挑战:一是处理多个波段(如f090w至f850lp)的孔径光度测量与背景校正,确保跨仪器数据一致性;二是通过grizli软件从约65000个源中提取647维参数,包括红移概率分布、光变曲线和星族合成特征,计算复杂度极高;三是对HATS编目格式的适配,需生成HEALPix分区与边缘目录以支持大规模空间交叉匹配。
常用场景
经典使用场景
该数据集源自詹姆斯·韦布空间望远镜对UDS天区的深度巡天,整合了Grizli流程处理的多波段测光与光谱能量分布信息。在天文学研究领域,它被广泛用于高红移星系的搜寻与认证,尤其是借助其丰富的波段覆盖和精细的测光数据,研究者能够精准刻画星系的形态、恒星质量、星族年龄以及尘埃消光等物理属性。数据集的HATS目录格式支持LSDB框架进行高效的空间检索与交叉匹配,便于开展大规模统计研究。
解决学术问题
在学术前沿,该数据集成功应对了早期宇宙结构形成机制探究中的核心挑战,例如通过多波段测光数据精确测量z>6星系的红移与恒星形成率,从而约束再电离时期的物理条件。它使研究者能够系统性地分析星系在宇宙时标上的演化轨迹,揭示超大质量黑洞与其寄主星系间的协同增长关系。数据集中包含的数百个波段通量与光谱诊断线测量,为破解星系际介质性质与星系反馈机制提供了关键约束。
衍生相关工作
该数据集衍生了众多具有影响力的研究成果,包括基于大规模测光红移的星系恒星质量函数构建,以及利用光谱能量分布拟合技术揭示的尘埃遮蔽星暴星系族群。此外,它催生了针对JWST深度场数据的自动化处理流程优化工作,并为Multimodal Universe项目提供了重要的多模态数据范例。相关研究还利用其丰富的列属性训练了高精度红移回归模型,推动了深度学习在天文信息提取中的系统性应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务