遇见数据集

T-STAR

收藏
github2026-07-08 更新2026-07-29 收录
数据链接:
官方服务:

资源简介:

T-STAR是首个用于卫星视频时空全景场景图生成(TPSG)的大规模数据集,包含超过110万个实例掩码和380万个时空三元组,涵盖39个细粒度对象类别和70个细粒度关系类别,旨在通过联合建模全景场景元素的身份一致实例掩码和时空关系,描述动态地理空间场景。

T-STAR is the first large-scale dataset for Satellite Video Spatiotemporal Panoramic Scene Graph Generation (TPSG). It contains over 1.1 million instance masks and 3.8 million spatiotemporal triples, covering 39 fine-grained object categories and 70 fine-grained relational categories. It aims to describe dynamic geospatial scenes by jointly modeling identity-consistent instance masks and spatiotemporal relationships of panoramic scene elements.

创建时间:
2026-07-01
原始信息汇总

数据集概述

T-STAR 是一个面向卫星视频的时空全景场景图生成(Spatio-Temporal Panoptic Scene Graph Generation, TPSG)的大规模基准数据集。

核心任务:TPSG

给定一段卫星视频序列,TPSG 任务旨在生成一个结构化的图,该图由一组具有明确时间跨度的三元组 ⟨主体, 关系, 客体⟩ 组成。通过联合建模身份一致的实例掩码以及全景场景元素间的时空关系,来描述动态的地理空间场景。

数据集规模

  • 实例掩码数量:超过 110 万(1.1 million)
  • 时空三元组数量:超过 380 万(3.8 million)
  • 细粒度目标类别:39 类
  • 细粒度关系类别:70 类

数据构成与可视化

数据集提供了以下维度的统计与可视化内容(图片来自仓库 demos 目录,已转为绝对地址):

  • 场景:展示代表性标注场景,如 https://github.com/linlin-dev/T-STAR/raw/main/demo/scene.jpg
  • 目标:展示目标统计与可视化,如 https://github.com/linlin-dev/T-STAR/raw/main/demo/Object.jpg
  • 关系:展示关系统计与可视化,如 https://github.com/linlin-dev/T-STAR/raw/main/demo/Relationship.jpg
  • 目标-关系交互:展示主体类别、关系类别与客体类别之间的交互映射,如 https://github.com/linlin-dev/T-STAR/raw/main/demo/Obj-Rel%20Interaction.png

下载链接

  • T-STAR 数据集:即将开放下载(状态为 Coming soon)。

引用

该工作基于 STARSGG in Large-Size Satellite Imagery 论文,引用格式已提供 BibTeX。代码基于 OpenPVSG(CVPR23)实现。

搜集汇总
数据集介绍
T-STAR 数据集图片
构建方式
T-STAR数据集是针对卫星视频中时空全景场景图生成任务构建的首个大规模基准数据集。其构建过程涵盖对卫星视频序列中动态地理场景的精细标注,具体涉及39个细粒度目标类别和70个细粒度关系类别。通过逐帧标注实例掩码并保持身份一致性,数据集共生成超过110万个实例掩码和380万个时空三元组⟨主语,关系,宾语⟩,每个三元组均关联明确的时间范围,从而实现对全景场景元素间时空关系的结构化描述。
特点
T-STAR数据集的核心特点在于其大规模、细粒度标注与时空动态建模的结合。相较于现有数据集,它首次将全景场景图生成从静态图像拓展至卫星视频领域,覆盖丰富的目标与关系类别,并提供了高密度的实例掩码和三元组标注。此外,数据集的分布经过精心统计,包含对目标、关系及其交互映射的详细可视化分析,为研究卫星视频中动态场景理解提供了全面且具挑战性的评估基准。
使用方法
T-STAR数据集的使用可参考其基于OpenPVSG的代码框架。研究者需下载数据集并加载卫星视频序列及其对应的实例掩码和时空三元组标注。模型输入为视频帧序列,输出为包含语义类别、实例掩码及带有时间跨度关系的全景场景图。评估时,可遵循数据集提供的标准协议,通过计算预测三元组与真值标注的匹配度来衡量性能。具体实现细节和依赖库详见GitHub仓库中的文档与示例代码。
背景与挑战
背景概述
随着遥感对地观测技术的飞速发展,卫星视频已成为动态地理场景分析的重要数据源。然而,现有视觉理解研究多聚焦于静态卫星图像中的目标检测或场景图生成,难以捕捉时空中物体身份的连续性与关系演变。为此,研究者于2025年提出了T-STAR基准数据集,由武汉大学等机构联合构建,旨在推动卫星视频场景理解的范式革新。该数据集首次定义了时空全景场景图生成任务,通过构建超过110万个实例掩膜与380万个时空三元组,覆盖39种细粒度物体类别与70种关系类别,为从卫星视频中联合建模目标身份一致性、全景分割与时序关系推理提供了大规模标注基础,为遥感智能分析开辟了新方向。
当前挑战
T-STAR数据集所面临的挑战源自其任务定义与构建过程的双重复杂性。在领域问题层面,传统场景图生成仅针对静态图像,而卫星视频中的目标快速移动、遮挡频繁、尺度剧变等现象,使得同时保持实例掩膜在时序上的身份一致性与准确解析时空关系成为难题,现有方法难以直接迁移。在数据集构建层面,卫星视频覆盖广域场景,需对多轨道、多时相数据进行高精度全景标注,人工成本极高;同时,定义一套覆盖地理要素运动交互的70种关系类别并确保标注一致性,对领域专家协作提出严苛要求。此外,大规模实例掩膜的边界精细度与关系三元组的稀疏性,进一步增加了模型在复杂动态场景中泛化的难度。
常用场景
经典使用场景
在卫星视频智能理解领域,T-STAR数据集作为首个面向时空全景场景图生成任务的大规模基准,其经典使用场景聚焦于从卫星视频序列中联合建模实例级语义掩码与动态空间关系。研究者利用该数据集,可系统性地训练与评估模型在39类细粒度目标(如车辆、建筑)及70类时空关系(如“跟随”、“停靠”)上的推理能力,生成结构化的⟨主体,关系,客体⟩三元组,并赋予明确的时序跨度。这一范式超越了传统静态场景图或单帧目标检测的局限,推动了对地理空间动态场景的精细化表征。
解决学术问题
该数据集旨在解决卫星遥感领域长期存在的两大核心学术瓶颈:其一,缺乏同时包含像素级全景分割与时空关系标注的视频级数据集,导致模型难以理解地物间的交互演化;其二,现有场景图生成方法多针对地面视角图像,无法适应卫星数据中的尺度剧变、密集小目标以及复杂空间拓扑。T-STAR通过提供超过110万个实例掩膜与380万个时空三元组,为动态地理场景的结构化推理奠定了数据基石,显著促进了卫星视频中语义感知、事件推断与因果发现等方向的研究进展。
衍生相关工作
T-STAR的构建衍生了一系列开创性工作:其底层的全景分割与关系图网络设计承接了OpenPVSG等早期视频场景图框架,并针对卫星图像特性进行了适配;基于同一课题组前序工作STAR数据集在大幅面卫星图像场景图生成中的积累,T-STAR进一步将静态空间关系建模拓展至视频时序域。此外,该数据集推动了高分辨率卫星视频中动态全景场景图生成这一新兴任务的定义,为后续研究如时空关系记忆网络、跨帧实例关联算法及长时程事件推理提供了标准化的评估平台与性能基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务