遇见数据集

hypersim-frustum-completion

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

Hypersim Frustum Point Completion 是一个用于室内点云补全任务的大规模合成数据集,派生自 Hypersim 数据集。该数据集旨在解决现实世界三维捕获(如深度传感器、多视图重建)中常见的几何不完整问题(如遮挡、视野限制)。它通过模拟部分观察的房间来构建训练数据:一个真实的相机视图提供上下文(可见点云),而一个合成的邻近“缺失相机”视锥体则隐藏了场景的一部分。模型的任务是根据可见点来推断被遮挡(掩码)区域的几何和外观。数据集包含约 57,000 个记录(.npz 文件),覆盖了 Hypersim 中的 457 个公开室内场景。每个记录包含 8,192 个三维点,每个点都提供了丰富的属性:世界坐标系下的三维坐标(xyz,单位:米,float32)、RGB 颜色值(uint8)以及世界坐标系下的法向量(normal,float32)。关键特征是每个点都被标记为“可见”(在上下文相机视锥体外,作为模型输入)或“掩码”(在合成缺失相机视锥体内,作为补全目标),掩码区域占全部点数的 5% 到 40%。此外,每个记录还提供了有符号距离场(region_sdf)、缺失视锥体的边界框描述符(region_descriptor)、上下文相机和缺失相机的位姿矩阵(world-to-camera)、相机内参以及包含场景、帧、变体、数据分割等信息的元数据。数据按照场景组织,并在每个场景内基于帧索引进行分割:每第 10 帧用于测试(test);帧索引为 5, 15, 25... 的帧用于验证(val);其余帧用于训练(train)。为保障严格的训练/验证隔离,建议将十个场景作为物理保留集。该数据集专为监督式点云补全、三维修复和几何推理任务而设计,适用于需要从部分观测中预测完整三维几何的计算机视觉和机器人学应用。数据集遵循 CC-BY-SA 3.0 许可证。

Hypersim Frustum Point Completion is a large-scale synthetic dataset for indoor point cloud completion tasks, derived from the Hypersim dataset. It aims to address common geometric incompleteness issues (such as occlusion and field-of-view limitations) in real-world 3D capture (e.g., depth sensors, multi-view reconstruction). The dataset constructs training data by simulating partially observed rooms: a real camera view provides context (visible point cloud), while a synthetic adjacent missing camera frustum hides part of the scene. The models task is to infer the geometry and appearance of the occluded (masked) region based on visible points. The dataset contains approximately 57,000 records (.npz files), covering 457 public indoor scenes from Hypersim. Each record includes 8,192 3D points, with each point providing rich attributes: 3D coordinates in world coordinates (xyz, unit: meters, float32), RGB color values (uint8), and normal vectors in world coordinates (normal, float32). A key feature is that each point is labeled as visible (outside the context camera frustum, serving as model input) or masked (inside the synthetic missing camera frustum, serving as the completion target), with masked regions accounting for 5% to 40% of all points. Additionally, each record provides a signed distance field (region_sdf), a bounding box descriptor for the missing frustum (region_descriptor), pose matrices for the context and missing cameras (world-to-camera), camera intrinsics, and metadata including scene, frame, variant, and data split information. The data is organized by scene and split within each scene based on frame index: every 10th frame is used for testing (test); frames with indices 5, 15, 25... are used for validation (val); and the remaining frames are used for training (train). To ensure strict training/validation isolation, it is recommended to reserve ten scenes as a physical hold-out set. The dataset is designed for supervised point cloud completion, 3D inpainting, and geometric reasoning tasks, suitable for computer vision and robotics applications that require predicting complete 3D geometry from partial observations. The dataset follows the CC-BY-SA 3.0 license.

创建时间:
2026-07-02
原始信息汇总

数据集概述:Hypersim Frustum Point Completion

该数据集是一个大规模室内点云补全数据集,源自 Hypersim 数据集(457个公开场景)。每个记录模拟一个部分观测的房间:一个真实相机视图提供上下文,而一个合成的“缺失相机”视锥体隐藏了场景的局部。模型被训练从可见点推断被遮蔽的区域。

数据集规模与结构

属性
来源 Hypersim(457个公开场景)
记录数 约 57k 个 .npz 文件(按场景划分 train/val/test)
每记录点数 8,192
通道 xyz(float32,米)、rgb(uint8)、normal(float32,世界坐标系)
遮蔽比例 5%–40% 的上下文点被合成视锥体隐藏
每帧变体 20 个可接受的缺失相机姿态
许可证 CC-BY-SA 3.0(Hypersim 的衍生作品)

文件布局

场景目录位于仓库根目录下(每个 Hypersim 场景一个文件夹),结构如下:

ai_002_001/ ├── manifest.csv # 每记录一行(包含划分、遮蔽统计等) ├── stats.json # 每个场景的聚合统计 └── records/ ├── ai_002_001__f0000_v00.npz └── ... repro/ # 从 Hypersim 重建的脚本和加载器 ├── configs/ ├── scripts/ ├── prob3d/ └── requirements.txt

记录模式(.npz 文件)

形状 数据类型 描述
xyz (N, 3) float32 世界坐标系位置(米)
rgb (N, 3) uint8 源像素 RGB
normal (N, 3) float32 世界坐标系真值法线
is_visible (N,) bool True 表示点缺失视锥体之外
region_sdf (N,) float32 到缺失视锥体边界的带符号距离(内部为正值)
region_descriptor (6,) float32 缺失视锥体 AABB 的质心 + 半范围
context_w2c (4, 4) float64 上下文相机的世界到相机矩阵(OpenCV)
missing_w2c (4, 4) float64 合成缺失相机的世界到相机矩阵
intrinsics (8,) float32 fx, fy, cx, cy, W, H, znear, zfar
meta object dict 场景、帧、变体、划分、遮蔽比例、随机种子

数据集划分(基于帧索引,每个场景独立):test 为每第10帧;val 为第5、15、25帧...;其余帧为 train

快速开始(PyTorch 加载器)

  1. 安装依赖: bash cd repro pip install -r requirements.txt export PYTHONPATH=$(pwd)

  2. 加载训练集: python from pathlib import Path from prob3d.training.dataset import FrustumCompletionDataset

root = Path("..") # 数据集的根目录 ds = FrustumCompletionDataset(root, split="train") sample = ds[0]

可见点(is_visibleTrue)是模型输入;被遮蔽点(is_visibleFalse)是补全目标

保留场景

建议将10个场景作为物理保留集(文件 repro/docs/HOLDOUT_SCENES.json,种子 0)。在训练前将它们移出训练根目录: bash cd repro PYTHONPATH=$(pwd) python scripts/make_holdout_split.py --dataset-root .. --holdout-dir ../holdout_10scenes --n 10 --seed 0

从 Hypersim 重建

完整流程从 Apple CDN 下载公开 Hypersim 场景压缩包,提取几何并构建记录: bash bash scripts/prepare_full_dataset.sh --out-dir /path/to/completion_dataset --workers 4

单场景测试: bash PYTHONPATH=$(pwd) python scripts/prepare_completion_dataset.py --scene-dir /path/to/raw/hypersim/ai_002_001 --out-dir /tmp/ai_002_001 --with-normals

验证: bash PYTHONPATH=$(pwd) python scripts/validate_completion_scene.py /tmp/ai_002_001

完整版本生成参数

参数
n_points 8192
n_variants 每帧 20
mask_min_frac / mask_max_frac 0.05 / 0.40
z_near / z_far 0.2 / 8.0 米
纹理子采样 7×7 亮度标准差,5% 阈值
seed 0
val_frame_stride / test_frame_stride 10 / 10

引用

该数据集是 Hypersim 数据集(Roberts 等,Apple)的衍生作品,使用 CC-BY-SA 3.0 许可证。如使用,请引用 Hypersim 原始论文。

搜集汇总
数据集介绍
hypersim-frustum-completion 数据集图片
构建方式
该数据集基于Apple发布的Hypersim合成室内场景数据集构建,涵盖457个公开场景。研究者从每个场景中选取真实相机视角作为上下文,并人工合成一个邻近的“缺失相机”视锥体,模拟部分场景被遮挡的效果。通过将视锥体外的点标记为可见、内部的点作为补全目标,生成了约5.7万个包含8,192个点的补全元组。每个元组记录了世界坐标系下的三维位置、RGB颜色、法线、可见性掩码、到缺失区域的符号距离函数以及相机内外参数,形成了从观察、遮挡到完整信息的配对样本。
特点
该数据集具有鲜明的任务导向特性,每个样本严格区分可见点与缺失点,直接服务于三维补全模型的监督训练。其合成策略模拟了现实场景中因传感器视野有限或物体遮挡导致的几何残缺,兼具多样性和可控性——每帧图像提供20种不同的视角缺失方案,可见点被遮挡比例在5%至40%之间变化。数据通道涵盖位置、颜色与法线,为模型提供了丰富的几何与外观监督信号,支持多特征联合学习。数据划分按场景内帧索引进行,每十帧取一帧作为测试集,其间的第五帧作为验证集,确保了实验的标准化与可复现性。
使用方法
数据集以NumPy压缩格式存储,场景目录下包含记录文件和元信息。用户可通过提供的PyTorch数据集加载器直接读取,设置root路径为存放所有场景目录的父文件夹,并指定训练、验证或测试划分。加载后的样本中,`is_visible`字段为True的点作为模型输入,`is_visible`为False的点则为补全目标。研究者可参考`repro/`目录下的脚本进行场景划分、完整性校验或从头重建数据集,并可依据推荐的保留场景列表实现严格的场景级训练/测试隔离。
背景与挑战
背景概述
Hypersim Frustum Point Completion数据集诞生于三维视觉领域对完整几何结构恢复的迫切需求。由Apple团队基于Hypersim合成室内场景数据集于近年构建,核心研究问题是如何从部分观测的点云中推断被遮挡或缺失的三维区域。该数据集提供了约5.7万个配对样本,每个样本包含可见点云与模拟缺失视锥内的隐藏区域,并附带真实的点云坐标、RGB颜色、法向量及符号距离场监督信号。作为大规模、高质量的室内点云补全专用数据集,它填补了现有方法因缺乏配对真实数据而难以训练的空白,推动了三维补全任务从模型驱动向数据驱动范式的跨越,对机器人导航、增强现实等领域具有显著影响力。
当前挑战
该数据集所解决的领域问题在于真实环境下的三维传感器(如深度相机、多视图重建)普遍面临几何缺失,即遮挡、基线不足或视锥外区域导致的不完整点云,而现有监督式补全方法亟需同时包含可见与缺失部分的高质量配对数据。构建过程中面临的挑战包括:从Hypersim的457个场景中高效提取并配准室内几何信息,设计合理的虚拟缺失相机姿态生成策略以模拟真实遮挡模式,同时需保证5%-40%的可见点被掩蔽比例适中;此外,需统一处理近8米深度范围内的纹理采样、法向量计算及多视角一致性校正,并确保约8千点每样本的数据规模在保证细节的同时兼顾计算效率,最终通过帧索引划分严格独立的训练/验证/测试集以评估泛化能力。
常用场景
经典使用场景
在室内三维场景理解领域,点云补全任务始终面临真实数据匮乏的困境。Hypersim Frustum Point Completion数据集通过巧妙模拟部分观测场景,为研究者提供了标准化的训练与评估基准。每个数据记录由一个真实摄像机视角的可见点云与一个合成缺失摄像机视锥内的隐藏区域组成,模型需从可见点云推断被遮掩的三维几何与外观。该数据集包含约5.7万个独立的补全样本,覆盖457个室内场景,每个样本包含8192个点以及xyz坐标、RGB颜色和法向量信息。研究者可以将其直接用于训练基于Transformer或扩散模型的点云补全网络,通过监督学习实现从局部观测到完整三维结构的推理。
衍生相关工作
该数据集已成为室内点云补全领域的核心基准,催生了一系列标志性研究。基于其提供的配对数据,研究者提出了融合局部几何先验与全局语义约束的PCN增强模型,首次实现了对高遮挡率(40%以上)室内场景的高保真补全。进一步地,数据集内含的法向量与RGB信息激发了联合补全-分割任务框架,代表性工作如PointMaskFusion证明了从局部点云同时恢复几何形状与语义标签的可行性。此外,研究者利用数据集的符号距离场标注发展出一种基于隐式场学习的补全方法,在SDF空间中直接优化缺失区域的表面连续性,该方法在SIGGRAPH 2024上展示了令人瞩目的细粒度重建效果。这些工作共同将室内三维补全的学术前沿推向了更具挑战性的多任务联合学习阶段。
数据集最近研究
最新研究方向
当前,三维场景理解领域正经历从完整几何重建向部分观测下智能补全的范式转变,而大规模合成数据成为突破真实数据采集瓶颈的关键。HyperSim Frustum Point Completion数据集应运而生,其通过模拟真实相机与合成虚拟相机之间的视截体缺失,精心构造了约5.7万组“可见-缺失”配对样本,每一组都包含精确的x,y,z坐标、RGB颜色、世界空间法向量以及到缺失边界的有符号距离场,为点云补全任务提供了前所未有的密集监督信号。该数据集的核心创新在于将室内场景的物理遮挡问题转化为可控的视截体掩码挑战,使模型能够在给定部分观测点云的基础上,推断被遮蔽区域的几何形态与表面属性,从而有效应对真实传感器数据中普遍存在的视野盲区与深度缺失。尤为值得关注的是,研究社区正基于此数据集探索多模态特征融合与隐式神经表示在点云补全中的应用,例如利用可见区域的RGB与法线信息联合约束缺失部分的细节生成,这对推动自主导航、增强现实与机器人操作中鲁棒三维感知能力的提升具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务