遇见数据集

snad-space/astra-zubercaldr16_gaiadr3vclassre

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含ZTF Zubercal DR16源与Gaia DR3变星分类的交叉匹配数据,以HATS(分层自适应平铺方案)目录形式提供。HATS目录是使用ASTRA框架中的数据准备管道构建的,用于天文学研究,涉及ZTF和Gaia观测数据。数据集包括HATS目录和TFRecord文件,后者用于数据输入,分为训练集和验证集,训练集包含多滤波器光变曲线,验证集用于监控预训练和评估下游任务。数据来源包括ZTF Zubercal DR16的光度测量数据和Gaia DR3的变星分类,需在引用时注明相关文献。

This dataset contains ZTF Zubercal DR16 sources cross-matched with Gaia DR3 variability classifications, served as a HATS (Hierarchically Adaptive Tiling Scheme) catalog. The HATS catalog was built using the data preparation pipeline at ASTRA framework. It includes HATS catalog directory and TFRecord files for data ingestion, with training split containing multi-filter light curves and validation split for monitoring pre-training and evaluating downstream tasks. Data sources are ZTF Zubercal DR16 photometric data and Gaia DR3 variability classification, with citations required for use.

提供机构:
snad-space
搜集汇总
数据集介绍
snad-space/astra-zubercaldr16_gaiadr3vclassre 数据集图片
构建方式
该数据集源自ZTF Zubercal DR16与Gaia DR3变星分类的交叉匹配结果,依托ASTRA框架下的数据准备流水线构建而成。数据以HATS(分层自适应平铺方案)目录格式组织,确保大规模时序数据的高效索引与检索。同时,为便于深度学习模型的直接摄入,数据集额外提供了TFRecord格式的分割文件,包含用于预训练的多波段光变曲线训练集与用于下游任务评估的验证集。
特点
数据集兼具天文学与机器学习双重特性:一方面,融合了ZTF高精度测光数据与Gaia DR3权威变星分类标签,覆盖超过百万量级的天体源;另一方面,采用HATS分层目录结构与TFRecord序列化格式,支持LSDB等现代天文数据库工具与TensorFlow等深度学习框架的无缝对接。其精心设计的训练-验证分割方案,为变星光变曲线的自监督预训练与下游分类任务提供了标准化基准。
使用方法
使用该数据集时,天文研究者可基于LSDB库直接打开HATS目录,通过空间索引高效查询目标天区的光变数据。机器学习从业者则可直接加载TFRecord文件,利用TensorFlow的数据管道进行批量化训练,无需额外格式转换。数据集采用CC-BY-4.0许可协议,使用时需分别引用ZTF、Gaia DR3及HATS格式的相关学术文献,以确保溯源合规。
背景与挑战
背景概述
在天文学领域,变星与暂现源的识别是理解恒星演化、星系结构乃至宇宙学距离尺度的重要基石。随着大规模时域巡天项目如Zwicky Transient Facility (ZTF)和Gaia卫星的持续运行,海量的多波段光变曲线数据为统计分析提供了前所未有的机遇。此数据集诞生于2025年前后,由ASTRA项目团队基于ZTF Zubercal DR16与Gaia DR3变源分类结果构建,核心研究问题在于融合地面与空间望远镜的视角,通过交叉匹配构建统一的变源分类目录。该工作不仅填补了多波段数据协同分类的空白,更推动了基于Hierarchically Adaptive Tiling Scheme的星表管理方法,对后续的大数据驱动型天文研究具有显著的示范效应。
当前挑战
该数据集面临的核心挑战首先在于领域问题本身的复杂性:从ZTF与Gaia的亿级源中准确识别变星类别,需克服不同观测波段、时间采样不均以及测光精度差异带来的分类偏差。其次,构建过程中需要解决多来源数据的交叉匹配技术难题,包括空间坐标的不确定性、不同仪器系统的星等零点校准,以及处理高达千万级的源数量所引致的计算资源瓶颈。此外,将非结构化光变曲线转化为适用于自监督学习的高质量TFRecord格式,同时保证训练与验证集的天体物理代表性,也是一项严峻的数据工程挑战。
常用场景
经典使用场景
该数据集融合了ZTF Zubercal DR16测光数据与Gaia DR3变星分类结果,为天文变源研究提供了高密度的多波段光变曲线资源。经典使用场景集中于变星分类与周期分析,通过跨源交叉匹配构建大规模样本,适用于训练机器学习模型以识别脉动变星、食双星、爆发变星等类别。数据以HATS层级自适应瓦片格式存储,可借助LSDB高效空间查询,支撑银河系结构测绘与恒星物理参数反演。
实际应用
在实际应用中,该数据集推动时域天文学观测策略优化。天文学家可基于其构建的变星分类器,快速筛选候选体以分配光谱或高频测光资源。此外,数据经TFRecord格式预分割为训练与验证集,可直接用于TensorFlow等框架的预训练模型和下游任务调优,加速人工智能在自动化变星识别、异常检测及瞬变源预警等场景的部署。
衍生相关工作
该数据集衍生工作核心围绕HATS格式的推广利用。Caplar等(2025)提出的HATS层级自适应瓦片方案,解决了球面天文数据的大尺度索引瓶颈。基于本数据预训练的模型可迁移至其他巡天任务(如LSST),并启发后续研究在跨源匹配算法、变星分类特征工程及联邦学习框架下的分布式数据处理等方向取得突破,形成开放科学协作生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务