遇见数据集

InsScene4D-147K

收藏
arXiv2026-07-22 更新2026-07-23 收录
数据链接:
官方服务:

资源简介:

InsScene4D-147K是由地平线机器人与南洋理工大学等机构联合构建的大规模4D场景理解数据集,旨在支持几何与实例联合学习的训练与评估。该数据集涵盖真实与合成、静态与动态场景,包含147,000个数据样本,总计约6,000万个实例掩码,数据来源包括RGB图像、深度图、相机位姿及点云,并通过自动化几何引导标注流程生成时序一致的实例标签。其创建过程采用基于空间基础模型的几何重建、投影与掩码细化流水线,实现了多视角一致的几何与实例标注的高效生成。该数据集主要应用于在线4D场景理解、实例空间跟踪、开放词汇分割等下游任务,旨在解决动态环境中长期序列的几何-实例一致性预测缺乏高质量监督数据的问题。

InsScene4D-147K is a large-scale 4D scene understanding dataset jointly constructed by Horizon Robotics, Nanyang Technological University and other institutions, aiming to support the training and evaluation of joint learning of geometry and instance. This dataset covers real and synthetic, static and dynamic scenes, contains 147,000 data samples totaling approximately 60 million instance masks. Its data sources include RGB images, depth maps, camera poses and point clouds, and temporally consistent instance labels are generated through an automated geometry-guided annotation pipeline. Its creation process adopts a spatial foundation model-based pipeline for geometry reconstruction, projection and mask refinement, enabling efficient generation of multi-view consistent geometry and instance annotations. This dataset is mainly applied to downstream tasks such as online 4D scene understanding, instance spatial tracking and open-vocabulary segmentation, and aims to address the problem of lack of high-quality supervised data for geometry-instance consistency prediction in long-term sequences in dynamic environments.

创建时间:
2026-07-22
原始信息汇总

数据集概述

数据集名称

InsScene4D-147K

数据规模

总计 147,000 条序列,涵盖真实与合成场景、静态与动态场景。

数据构成

  • RGB 图像:包含对应的深度图、相机位姿(pose)。
  • 实例掩码(Instance Masks):通过自动化的几何引导标注流程生成,具有时间一致性(temporally consistent)。

数据来源

数据集由三个互补的数据源构成:

  1. RoboTwin 2.0:利用官方流程生成带有时间一致性实例掩码的 RGB-D 序列。
  2. RealEstate10K:使用 DA3 深度和真实位姿,通过 TSDF 网格重建进行 ID 继承,并结合 SAM2 自动及框提示掩码进行标注优化。
  3. HOI4D:在静态网格重建前移除动态区域,并利用提供的动态对象注释更新投影伪标签。

关键特点

  • 提供 4D 一致的实例注释
  • 旨在解决高质量 4D 监督数据缺乏的问题。
  • IGGT4D 模型(一种流式实例几何Transformer)的在线 4D 场景理解提供训练和评估基准。

应用场景

  • 3D 重建
  • 位姿估计
  • 实例空间追踪
  • 开放词汇语义分割
  • 4D 场景问答
搜集汇总
数据集介绍
InsScene4D-147K 数据集图片
构建方式
在4D场景理解领域,现有数据集多聚焦于几何重建而缺乏时序一致的实例标注。InsScene4D-147K的构建旨在填补这一空白,其采用自动化几何引导的标注管线,跨越真实与合成、静态与动态四大域,涵盖147K段精心筛选的视频序列。对于静态场景,通过DA3模型估计多视角一致深度,经TSDF融合生成高质量3D网格,进而将顶点投影至图像平面,并利用SAM2进行掩码分割与ID继承,辅以深度一致性检查与消失检测机制确保身份连续性。动态场景则先移除动态区域重建静态背景,再融合动态对象标注以完善整体实例监督。合成数据则直接整合源数据集提供的RGB-D与实例掩码,形成统一的4D监督资源。
特点
该数据集的核心特色在于其大规模、多域覆盖与几何-实例一致性。总计147K段序列提供了RGB图像、深度图、相机位姿、点云及帧间一致的实例掩码,使模型能够在真实与合成、静态与动态的多样化环境中学习鲁棒的4D表示。其自动化管线生成的高质量伪标签显著降低了人工标注成本,同时通过几何引导的投影与掩码匹配策略,有效克服了过分割、身份切换与背景泄漏等常见问题。此外,数据集支持长序列因果推理训练,通过首帧几何归一化避免尺度歧义,为流式4D场景理解提供了关键监督信号。
使用方法
InsScene4D-147K可直接用于训练和评估流式几何-实例联合预测模型。使用时,每个序列提供连续帧的RGB、深度、位姿及实例掩码,支持模型以因果方式逐帧处理并增量更新几何与实例表示。研究者可基于该数据集开展多项下游任务,包括3D重建、相机位姿估计、实例空间追踪及开放词汇语义分割。通过将预测的实例嵌入与2D视觉语言模型结合,还可实现跨帧的开放词汇理解。数据集划分明确,适于公平比较,其高效的流式聚类机制使长序列在线推理成为可能,为具身智能体的空间理解研究提供了基准资源。
背景与挑战
背景概述
在三维视觉领域,从连续的动态视频流中实时理解场景几何与运动物体的实例身份,是迈向空间智能的关键一步。传统的三维重建方法多集中于几何恢复,而语义理解则常依赖二维视觉语言模型提供的独立帧线索,难以在长时间序列中维持物体身份的一致性。为弥补这一鸿沟,Horizon Robotics与南洋理工大学S-Lab等机构的研究人员于2026年提出了InsScene4D-147K数据集,旨在为流式四维场景理解提供大规模、高质量的监督信号。该数据集包含14.7万段视频序列,涵盖真实与合成、静态与动态四大类场景,并提供了RGB图像、深度图、相机位姿及时间一致性实例分割标注。其构建依托于自动化几何引导的标注管线,通过三维重建、投影与掩膜精修,实现了对动态环境中物体身份的可靠跟踪,为后续的在线场景理解研究奠定了坚实的数据基础。
当前挑战
InsScene4D-147K数据集所面对的挑战分为两个层面。首先是领域核心问题:现有流式重建方法受限于几何中心范式,未能将物体实例身份作为与几何同等重要的预测目标,导致在物体运动、遮挡与重现时难以维持时间一致的实例理解。其次是数据集构建过程中的技术难题:为获得大规模四维多视角一致标注,传统人工标注耗时且昂贵,而依赖二维模型的自动标注又缺乏三维几何一致性。该数据集的创新之处在于采用几何引导的自动标注管线,先通过多视角深度估计与TSDF融合构建高质量三维网格,再将网格投影至各帧以继承全局实例ID,并利用SAM2分割掩膜进行匹配与精修,从而在显著降低人力成本的同时,产出了大规模、高一致性的四维实例监督数据。
常用场景
经典使用场景
在四维场景理解领域,InsScene4D-147K数据集最为经典的应用场景是作为联合几何与实例预测的基准训练与评估平台。具体而言,研究人员可借助该数据集中涵盖真实与合成、静态与动态场景的海量视频序列,训练模型在线处理连续视频流,同时输出相机运动、三维几何结构以及具有时间一致性的实例特征。该数据集通过自动化几何引导标注管道生成高质量的实例掩码,为因果时空建模提供了强有力的监督信号,使得模型能够在长序列动态环境中实现增量式的四维重建与物体身份追踪。
实际应用
在实际应用中,InsScene4D-147K所支撑的模型可赋能多种具身智能系统。例如,在自主导航机器人中,模型能够实时跟踪环境中的动态物体(如行人、车辆),并维持其身份标识的连续性,从而实现稳定的空间避障与路径规划。在手-物交互感知场景中,该数据集训练的模型可准确分离人手与操作对象的实例掩码,支持精细化的交互行为分析。此外,面向大语言多模态模型,通过注入四维一致的实例特征,系统可显著提升对动态场景的时空推理能力,例如准确判断物体是否离开视野或完成复杂场景问答任务。
衍生相关工作
InsScene4D-147K的提出催生了一系列相关重要工作。该数据集直接支撑了IGGT4D这一流式实例引导几何Transformer的研发,后者在相机姿态估计、三维重建、实例空间跟踪与开放词汇语义分割等任务上均取得了领先性能。在数据层面,其自动标注流水线衍生了高效的几何引导实例标注方法,降低了大规模四维数据的人工成本。在方法层面,因果时空建模与轻量流式聚类机制为后续流式空间基础模型(如Stream3R、LingBot-Map)提供了可借鉴的设计范式,推动了动态场景理解从离线优化向在线预测的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务