遇见数据集

3dvlm-hypersim

收藏
Hugging Face2026-05-29 更新2026-05-30 收录
官方服务:

资源简介:

本数据集是Hypersim(Apple,ICCV 2021)经过重新转换后的版本,采用了3DVLM项目的统一格式。Hypersim是一个用于整体室内场景理解的光照真实合成数据集,包含457个室内场景,总计约77,400帧图像数据,并提供了V-Ray渲染生成的真实深度信息。数据以场景为单位组织,每个场景包含RGB彩色图像、深度文件、相机内参和外参矩阵、有效掩码以及元数据文件,所有数据严格对齐。数据集适用于三维视觉、视觉语言模型、场景理解、深度估计、新视图合成和三维重建等任务,遵循CC BY-SA 3.0许可协议。

This dataset is a re-converted version of Hypersim (Apple, ICCV 2021), adopting the unified format of the 3DVLM project. Hypersim is a photorealistic synthetic dataset for holistic indoor scene understanding, containing 457 indoor scenes with approximately 77,400 image frames, and provides realistic depth information generated by V-Ray rendering. The data is organized by scene, with each scene including RGB color images, depth files, camera intrinsic and extrinsic matrices, valid masks, and metadata files, all strictly aligned. The dataset is suitable for tasks such as 3D vision, vision-language models, scene understanding, depth estimation, novel view synthesis, and 3D reconstruction, and is licensed under CC BY-SA 3.0.

创建时间:
2026-05-29
原始信息汇总

数据集概述

3DVLM Hypersim — §6 depth format 是苹果公司 Hypersim 数据集(ICCV 2021)的重制版本,遵循 3DVLM 项目的统一 §6 磁盘格式。该数据集包含 457 个场景,约 77,400 帧 图像,并提供 V-Ray 渲染的 ground truth 数据。

  • 许可协议: CC BY-SA 3.0(继承自原始 Hypersim 数据集)
  • 数据规模: 10,000 < n < 100,000 帧
  • 语言: 英语
  • 标签: 深度 (depth)、3D、视觉语言模型 (VLM)、场景理解 (scene-understanding)、Hypersim

数据布局

数据集以每个场景一个未压缩的 .tar 文件形式存储于仓库根目录的 hypersim/ 文件夹下:

hypersim/ ai_001_001.tar ai_001_002.tar ... ai_055_010.tar # 共457个tar文件,每个约620 MB,总计约303 GB

每个 tar 文件解压后生成一个 {scene_id}/ 目录,遵循 §6 格式,包含以下文件:

文件 格式 描述
images/{frame_id}.jpg JPEG RGB 图像,分辨率 1024 × 768
depth.npy float32, (N, H, W) z 深度(沿相机 z 轴),单位为米
intrinsics.npy float32, (N, 3, 3) 相机内参矩阵
extrinsics.npy float32, (N, 4, 4) w2c 外参矩阵(OpenCV 坐标系)
valid_mask.npy bool, (N, H, W) 有效像素掩码,True 表示有效
meta.json JSON 场景元数据

meta.json 示例: json { "scene_id": "hypersim/ai_001_001", "dataset": "hypersim", "is_pseudo": false, "frame_ids": ["cam_00_frame_0001", "..."], "image_size": [768, 1024] }


数据约定

  • 深度: 使用 z 深度(沿相机 z 轴),而非欧几里得距离。原始 Hypersim 的欧几里得深度已在转换过程中进行余弦校正。
  • 外参: w2c 格式,遵循 OpenCV 坐标系(x 向右,y 向下,z 向前)。原始 OpenGL 的 c2w 姿态已反转,且旋转矩阵列 1 和 2 已翻转。
  • 有效掩码: False 表示 NaN、超出范围、天空、玻璃等无效像素。
  • 帧索引: frame_ids 的顺序与所有 .npy 文件的第一个维度严格对应,images/{frame_ids[i]}.jpg 与索引 i 对齐。
  • 光线图 (Raymap): 不直接存储,需根据 (intrinsics, extrinsics) 在模型端推导(遵循 DA3 约定:未归一化方向 + z 深度 + w2c)。

固定内参

内参在每个场景内恒定,但为保持格式统一,仍为每帧单独存储。

参数
fx, fy 886.81
cx 511.5
cy 383.5
图像尺寸 768 × 1024

下载与解压

完整数据集: bash hf auth login hf download helioom/3dvlm-hypersim --repo-type dataset --local-dir ./hypersim_raw mkdir -p hypersim for t in hypersim_raw/hypersim/*.tar; do tar -xf "$t" -C hypersim/; done

单个场景: bash hf download helioom/3dvlm-hypersim --repo-type dataset --include "hypersim/ai_001_001.tar" --local-dir ./hypersim_raw tar -xf hypersim_raw/hypersim/ai_001_001.tar -C ./


最小加载器示例

python import json, numpy as np, torch from pathlib import Path from PIL import Image

class SceneFrames(torch.utils.data.Dataset): """One scene → N frames. Returns (rgb, depth, K, w2c, valid)."""

def __init__(self, scene_dir: str):
    root = Path(scene_dir)
    self.meta  = json.loads((root / "meta.json").read_text())
    self.depth = np.load(root / "depth.npy",      mmap_mode="r")
    self.K     = np.load(root / "intrinsics.npy", mmap_mode="r")
    self.E     = np.load(root / "extrinsics.npy", mmap_mode="r")
    self.V     = np.load(root / "valid_mask.npy", mmap_mode="r")
    self.imgs  = [root / "images" / f"{fid}.jpg"
                  for fid in self.meta["frame_ids"]]

def __len__(self) -> int:
    return len(self.imgs)

def __getitem__(self, i: int):
    rgb = np.asarray(Image.open(self.imgs[i]).convert("RGB"))
    return {
        "rgb":   torch.from_numpy(rgb),
        "depth": torch.from_numpy(self.depth[i].copy()),
        "K":     torch.from_numpy(self.K[i].copy()),
        "w2c":   torch.from_numpy(self.E[i].copy()),
        "valid": torch.from_numpy(self.V[i].copy()),
    }

来源与引用

  • 原始仓库: https://github.com/apple/ml-hypersim
  • 论文: Roberts et al., Hypersim: A Photorealistic Synthetic Dataset for Holistic Indoor Scene Understanding, ICCV 2021.
  • 许可协议: CC BY-SA 3.0(Apple Inc. 版权所有,衍生数据需继承相同许可条款)
搜集汇总
数据集介绍
3dvlm-hypersim 数据集图片
构建方式
3dvlm-hypersim数据集源自Apple ICCV 2021年发表的Hypersim工作,经3DVLM项目统一格式转换而来。该数据集包含457个室内场景,总计约77,400帧V-Ray渲染的逼真图像。构建时遵循§6规范,将每个场景打包为独立的未压缩.tar文件,每个文件约620 MB,总容量约303 GB。解压后每个场景目录下存储RGB图像(1024×768分辨率)、z深度图、相机内参矩阵、w2c外参矩阵、有效像素掩码以及元数据JSON文件。其中深度由原始欧氏距离经余弦校正转换为沿相机z轴的z深度,外参采用OpenCV坐标系(x右、y下、z前),有效掩码严格标记NaN、天空、玻璃及超出范围像素。
使用方法
用户可通过HuggingFace的`hf download`命令便捷获取数据,支持完整下载或按场景筛选。下载后使用tar解压即可获得目录结构。官方提供了轻量级PyTorch数据加载器`SceneFrames`示例,该加载器可返回RGB张量、深度图、内参矩阵、外参矩阵及有效掩码。用户可直接继承此基类进行训练或评估。值得注意的是,光线映射(raymap)需根据内参和外参在模型端动态计算,遵循DA3约定。数据集采用CC BY-SA 3.0许可,使用时应引用原Hypersim论文并遵守相同方式共享条款。
背景与挑战
背景概述
Hypersim数据集由Apple公司在2021年国际计算机视觉大会(ICCV)上提出,是面向室内场景理解的全景合成数据集。该数据集通过V-Ray光线追踪引擎生成高保真度的RGB-D图像,涵盖457个场景、约77,400帧,旨在为三维视觉与场景解析提供大规模、多模态的训练与评估基准。其核心研究问题在于:如何利用合成数据弥合模拟与真实环境之间的领域鸿沟,从而推动深度估计、语义分割及三维重建等任务的性能提升。3DVLM项目将其重构为统一的§6格式,进一步降低了多数据集联合使用的门槛,对视觉-语言模型与三维场景理解的交叉研究产生了重要影响。
当前挑战
数据集所解决的领域挑战包括:真实室内场景中深度标签获取成本高昂且噪声显著,合成数据虽能提供精确标注,但面临模拟与真实环境间的领域分布差异问题,导致模型泛化能力受限。在构建过程中,面临的主要挑战是:原始Hypersim采用 OpenGL 坐标系,需转换为OpenCV约定,同时将欧几里得深度经余弦校正转为z轴深度;此外,需处理天空、玻璃、NaN及超出范围像素的无效掩码生成,并确保每帧图像与对应标注严格对齐,最终以457个独立tar包形式存储,每个约620MB,整体规模达303GB,其转换管线必须兼顾精度与效率。
常用场景
经典使用场景
3dvlm-hypersim数据集是Apple公司发布的Hypersim数据集的重新整理版本,专为三维视觉与语言模型研究而设计。该数据集包含了457个室内场景、约77,400帧高保真图像,每帧均配准了精确的深度图、相机内外参数以及有效的像素掩码。其最经典的用途在于为室内场景理解任务提供统一、标准化的训练与评估基准,尤其适用于深度估计、三维重建、场景解析以及视觉定位等核心计算机视觉问题。通过将原始Hypersim数据转换为统一的§6格式,该数据集极大简化了多模态数据加载流程,使得研究者能够便捷地开展跨场景、跨任务的实验,推动视觉语言模型在三维空间理解领域的进步。
解决学术问题
在学术研究领域,3dvlm-hypersim数据集有效解决了室内场景理解中数据格式不统一、标注质量参差不齐这一长期困扰学界的核心痛点。通过提供精确的z-depth深度图、OpenCV约定的相机外参以及可靠的有效像素掩码,该数据集为几何与语义的联合建模创造了理想条件。它使得研究者能够系统性地探究从二维图像到三维空间的映射关系,尤其是在处理玻璃、天空等挑战性区域时,valid_mask的引入为模型评估提供了公正基准。该数据集的意义在于促进了多视图几何、单目深度估计以及场景抽象表示等方向的交叉融合,其统一格式设计更鼓励了可复现研究,显著提升了室内三维视觉研究的标准化水平。
实际应用
在实际应用层面,3dvlm-hypersim数据集为增强现实、机器人导航和智能家居环境感知等前沿领域提供了关键支撑。在增强现实场景中,精确的深度图与相机参数使得虚拟物体能够更真实地与真实环境交互,例如实现正确的遮挡关系和光照一致性。对于机器人领域,该数据集可用于训练室内环境的语义地图构建算法,帮助机器人理解复杂空间布局并安全地规划路径。在智能家居系统中,统一格式的多帧数据支持模型学习跨视角的场景理解能力,从而实现更自然的人机交互,如语音控制的物体搜索或空间状态感知。这些应用都得益于数据集所提供的高保真合成数据与严格定义的几何先验。
数据集最近研究
最新研究方向
在当前三维视觉语言模型(3DVLM)蓬勃发展的背景下,Hypersim数据集的重新格式化为统一§6格式,精准契合了室内场景理解领域对大规模、高质量、多模态标注数据的迫切需求。该数据集基于Apple ICCV 2021的Hypersim工作,涵盖457个场景、约7.7万帧V-Ray渲染的真实深度与姿态信息,为模型在空间推理、遮挡处理及几何一致性学习等前沿方向提供了坚实的数据基石。其引入的‘有效掩码’机制有效过滤了玻璃、天空等噪声区域,显著提升了深度估计与场景解析任务的可靠性。在近期热点如具身智能与室内导航中,此类高质量合成数据正成为弥合仿真与真实世界鸿沟的关键桥梁,推动着从单帧感知向几何-语义联合理解的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务