遇见数据集

galaxies-with-hats

收藏
Hugging Face2026-07-11 更新2026-07-12 收录
官方服务:

资源简介:

Galaxies with HATS 是一个基于 HEALPix 自适应分块方案 (HATS) 重构的天文星系数据集。它源自 Smith42/galaxies 数据集的 v2.0 版本,核心内容为约 850 万张来自 DESI 遗产巡天第八次数据发布 (DR8) 的 256×256 像素 PNG 格式星系图像。与原始为机器学习优化排序的版本不同,本数据集专为基于天空坐标的空间分析设计:每条数据记录均包含赤经 (`ra`)、赤纬 (`dec`) 和一个 `_healpix_29` 空间索引,数据本身按照 HEALPix 图块进行物理分区存储,使得锥形搜索、盒形搜索或与其他星表的交叉匹配等操作只需访问相关的数据文件,极大提升了空间查询效率。数据集严格保留了原始 98/1/1 的数据划分,形成三个独立的集合:训练集(约 847 万样本,1555 个分区,~709 GB)、验证集(约 8.6 万样本,27 个分区,~7.3 GB)和测试集(约 8.6 万样本,27 个分区,~7.3 GB)。除了核心的图像字段 (`image`) 外,每条数据还附带了丰富的元数据,总计约 170 个字段。这些元数据涵盖了 Galaxy Zoo DESI 项目的众包形态学分类结果(如平滑/有特征/伪影、是否有棒旋结构、旋臂数量与缠绕度等概率分数)、NSA 测光参数(星等、大小、椭圆率等)、红移信息,以及来自 OSSY、ALFALFA、JHU-MPA 等多个外部星表的交叉匹配物理参数(如恒星形成率、黑洞质量、中性氢流量等)。该数据集适用于需要融合多波段星系图像与多维度物理参数的天体物理研究,例如星系形态自动分类、星系演化与环境的关联分析、特定类型天体的空间分布统计,以及作为机器学习模型训练与验证的数据源。数据以 Apache Parquet 格式提供,支持通过 Hugging Face Datasets 库流式加载,也推荐使用 LSDB 库进行高效的空间查询,或直接使用 pandas、PyArrow 等工具处理。

创建时间:
2026-07-10
原始信息汇总

数据集概述:Galaxies with HATS

数据集地址https://huggingface.co/datasets/Smith42/galaxies-with-hats

许可协议:cc-by-sa-4.0

数据集规模:1M < n < 10M(约850万条记录)

标签:天文学、科学、HEALPix、星系


数据集构成

该数据集是 Smith42/galaxies(v2.0版)的 HATS(HEALPix Adaptive Tiling Scheme)版本。它提供了约850万个256×256像素的PNG格式星系切图,图像源自DESI Legacy Survey DR8巡天数据,以星系源为中心。数据按天空位置进行空间分区,每条记录包含约170个元数据列。

原始数据集按机器学习训练顺序组织,而本版本按天空位置顺序组织,便于基于坐标的天文分析。每条记录都包含赤经(ra)、赤纬(dec)以及一个名为_healpix_29的空间索引,数据被分区到HEALPix tiles中,使得锥形/矩形/交叉匹配查询仅需访问相关文件。

原始数据集的98/1/1训练/验证/测试划分被保留为三个独立的HATS集合:

集合 行数 HEALPix分区数 大小
train 8,474,566 1,555 ~709 GB
validation 86,499 27 ~7.3 GB
test 86,471 27 ~7.3 GB

数据列

所有三个集合共享相同的170列模式,包括:

  • 图像与标识image(PIL图像,由Hugging Face的datasets库自动解码)、dr8_idgalaxy_sizeradecfile_nameiauname
  • 空间索引_healpix_29(int64)
  • 形态参数(Galaxy Zoo DESI):包括平滑/特征、盘面、旋臂、棒状结构、核球大小、形状、边缘核球、旋臂缠绕、旋臂数量、合并状态等各类分数(float32)
  • 光度测量(NSA):各波段星等(mag_r_desi, mag_g_desi, mag_z_desi等)、Petrosian半径、椭圆率、Sérsic指数等
  • 红移与光谱redshift_nsaspec_zphoto_z
  • 交叉匹配数据
    • OSSY(光谱):redshift_ossylog_l_oiiilog_m_bh
    • ALFALFA(中性氢HI):W50HIfluxlogMH
    • JHU-MPA(恒星形成率):fibre_sfr_avgtotal_sfr_avgtotal_ssfr_avg
    • PhotoZ(测光红移):photo_zmass_med_photozsfr_sup_photoz

Null值情况:部分形态参数列有较高的缺失率(如合并状态相关列缺失率约93%-98%);光度测量相关列缺失率在0%-93%之间。

数据格式:HATS格式本质上是Parquet文件,可直接用pandaspyarrowdaskSparkDuckDB读取。分区文件按Norder={order}/Dir={dir}/Npix={pixel}.parquet规则命名,每个tile约包含10,000行数据(约0.8 GB)。


应用与工具

  • 数据流式加载(Hugging Face Datasets):可使用datasets库流式加载,例如: python from datasets import load_dataset galaxies = load_dataset("Smith42/galaxies_with_hats", split="train", streaming=True)

    由于流式顺序遵循HEALPix天空分块,连续样本是天空邻居;如需用于机器学习训练的独立同分布批次,可添加.shuffle(buffer_size=10_000)或使用原始Smith42/galaxies数据集。

  • 空间查询(LSDB):推荐使用lsdb库进行空间分析,例如锥形搜索和交叉匹配: python import lsdb galaxies = lsdb.open_catalog("hf://datasets/Smith42/galaxies_hats/train") cone = lsdb.open_catalog("hf://datasets/Smith42/galaxies_hats/train", search_filter=lsdb.ConeSearch(ra=161.0, dec=48.0, radius_arcsec=3600.0)) df = cone.compute()

  • 直接读取Parquet文件:可以直接读取单个天空区块,例如: python import pandas as pd tile = pd.read_parquet("hf://datasets/Smith42/galaxies_hats/test/test/dataset/Norder=0/Dir=0/Npix=4.parquet")

搜集汇总
数据集介绍
galaxies-with-hats 数据集图片
构建方式
该数据集基于DESI Legacy Survey DR8巡天数据构建,从原始星系图像数据集中提取了约850万张256×256像素的PNG格式星系切片,并采用HEALPix自适应平铺方案(HATS)在天空平面上进行空间分区。每一行数据不仅包含星系中心切片的图像,还融合了Galaxy Zoo DESI形态分类、NSA测光、红移以及OSSY、ALFALFA、JHU-MPA等多个星表的交叉匹配结果,总计约160个元数据列。原始数据集98/1/1的训练/验证/测试划分被完整保留,分别存储为独立的HATS集合,每个集合内部数据按HEALPix阶数和平铺编号组织为Parquet文件。
使用方法
该数据集支持多种使用方式:通过Hugging Face Datasets库可直接流式加载,使用load_dataset函数即可获取PIL图像和元数据;推荐使用LSDB库进行空间分析,可执行锥形搜索、交叉匹配等天文查询操作,且数据延迟加载,仅在需要时计算;也可直接通过Pandas、PyArrow、Dask、Spark或DuckDB读取Parquet格式的HEALPix平铺文件,每个平铺约包含1万行数据(约0.8 GB)。若需用于机器学习训练,建议添加.shuffle方法打乱顺序以获得近似独立同分布的小批量数据。
背景与挑战
背景概述
星系形态的精确分类是理解宇宙结构形成与演化的重要基石。近年来,随着大口径巡天项目如DESI Legacy Survey的推进,海量的高分辨率星系图像被获取,为数据驱动的天文学研究提供了前所未有的机遇。在此背景下,'galaxies-with-hats'数据集于近年由研究团队构建,其核心目标是将约850万张来自DESI Legacy Survey DR8的256×256像素星系切片图像,通过HEALPix自适应平铺方案(HATS)进行空间重组织,并整合了Galaxy Zoo DESI形态分类、NSA测光、红移以及OSSY、ALFALFA、JHU-MPA等多源交叉匹配的约160个元数据字段。该数据集不仅保留了原始98/1/1的训练/验证/测试划分,更引入了基于天球坐标的空间索引,使得天区锥形搜索、交叉匹配等空间分析操作能够高效执行,极大促进了星系形态学、恒星形成活动以及星系环境等交叉领域的研究,具备深远的影响力。
当前挑战
该数据集所应对的领域核心挑战在于,如何将大规模、多波段、具有复杂形态学特征的星系图像,与来自不同观测设备和巡天项目(如SDSS、ALFALFA、JHU-MPA)的海量异构元数据(包括测光、光谱、射电、恒星形成率等)进行有效整合与空间索引。此外,数据集构建过程中面临显著的技术挑战:数据规模庞大,超过700GB,需要高效的空间分区方案(HEALPix)来组织约850万个样本,并确保在Parquet格式下支持流式读取与快速空间查询。同时,多源数据融合带来了数据缺失与不一致性问题——例如,Galaxy Zoo形态学投票分数在多数样本中高度稀疏(如旋臂特征缺失率超过90%),射电观测数据亦存在大范围空白,如何在保留完整元数据schema的前提下维持数据集的可用性与一致性,是确保其科学价值的重大考验。
常用场景
经典使用场景
在天文学研究的浩瀚星图中,对星系形态的精准识别与分类始终是理解宇宙结构演化的核心课题。Galaxies with HATS数据集凭借其源自DESI Legacy Survey DR8的约850万张256×256像素星系切片图像,以及附带的银河动物园(Galaxy Zoo DESI)形态学投票分数,为深度学习驱动的星系形态学分析提供了无与伦比的资源。该数据集最经典的应用场景在于训练卷积神经网络或视觉Transformer模型,用以自动区分平滑椭圆星系与包含盘状结构的旋涡星系,并进一步细化识别星系棒的强弱、旋臂的缠绕程度、核球的大小占比以及并合特征等精细形态类别。研究者能够利用这些高质量的图像数据构建鲁棒的分类器,复现并超越传统目视分类的精度。
解决学术问题
该数据集的诞生有力地回应了天体信息学中一个长期存在的瓶颈:如何将海量的巡天图像数据高效转化为可供机器学习模型使用的结构化语料库。其所解决的学术核心问题在于,通过HEALPix自适应平铺方案(HATS)对原始数据进行了空间索引重组织,使得约850万条记录得以按照天球坐标进行分区存储。这一革命性的设计让天文研究者能够摆脱传统数据集仅适于随机批次训练的局限,转而执行天空锥形检索、交叉匹配以及空间邻域分析等复杂的天文学原生查询。其意义在于弥合了大规模机器学习训练集与天文学空间分析范式之间的鸿沟,使模型训练与科学研究在空间逻辑上实现了统一。
实际应用
在现实的天文学研究中,Galaxies with HATS数据集的实际应用场景展现出卓越的灵活性。借助LSDB等空间分析库,研究者可以针对特定天区(例如一片已知的星团或超星系团区域)进行锥形搜索,仅加载该区域的星系图像及其完整的160维元数据列(包括来自NSA的光度数据、红移值、以及OSSY、ALFALFA和JHU-MPA的交叉匹配结果)。这种按需加载机制使得大规模天文学的统计分析成为可能,例如研究星系形态与其局部环境密度的相关性、分析中性氢(HI)含量与星系形态类型的耦合关系,或是针对特定红移区间筛选出具有奇异形态特征的目标天体进行后续光谱观测。
数据集最近研究
最新研究方向
在天文学与深度学习交汇的前沿,星系形态学研究正经历一场由大规模标注数据集驱动的范式变革。galaxies-with-hats数据集以HEALPix自适应分割方案重新组织了约850万张来自DESI Legacy Survey DR8的星系切图,不仅保留了Galaxy Zoo DESI形态学投票分数、NSA测光、红移及OSSY/ALFALFA/JHU-MPA多波段交叉匹配等160余维元数据,更通过空间索引实现了相邻天区星系的连贯浏览与高维高效的锥形、矩形及交叉匹配查询。该数据集的发布标志着天文大数据从传统的单一机器学习训练流水线,向着兼顾空间均匀性与科学探索灵活性的全新架构演进,为星系形态分类、宇宙大尺度结构分析及多信使天文学研究提供了突破性的数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务