helioom/3dvlm-hypersim
收藏官方服务:
资源简介:
Hypersim数据集(苹果公司,ICCV 2021)已转换为3DVLM项目的统一§6磁盘格式。该数据集包含457个场景,约77,400帧图像,并提供了V-Ray地面真实数据。每个场景存储为一个未压缩的.tar文件,包含RGB图像(分辨率为1024×768)、浮点型深度图(z-depth,单位为米)、相机内参矩阵、外参矩阵(w2c,OpenCV格式)和有效像素掩码。数据遵循CC BY-SA 3.0许可协议,使用时需引用原始论文并遵守共享相同方式条款。
Hypersim (Apple, ICCV 2021) reconverted to the 3DVLM projects unified §6 on-disk format. 457 scenes, ~77,400 frames, V-Ray ground truth. License: CC BY-SA 3.0, same as the source. If you use this, please cite Roberts et al. (Hypersim) and apply share-alike terms to any derivatives.
提供机构:
helioom搜集汇总
数据集介绍

构建方式
Hypersim数据集由Apple团队于ICCV 2021提出,是一套面向全场景理解的高质量合成室内场景数据集。本版本隶属于3DVLM项目,将其原始数据统一转化为§6标准存储格式。原始场景共计457个,涵盖约77,400帧图像及V-Ray渲染真值。每个场景被压缩为独立的.tar文件,位于仓库根目录,解压后形成包含RGB图像(JPEG,1024×768)、深度图(float32,z-depth,单位米)、相机内参矩阵(3×3)、外参矩阵(4×4,OpenCV坐标系下的世界到相机变换)、有效像素掩膜(bool)以及meta.json元数据文件的规范目录结构。
特点
该数据集融合了大规模合成数据与标准化格式的双重优势。深度采用z-depth(沿相机Z轴),并于转换时对Hypersim原始欧几里得深度进行余弦校正;外参严格遵循OpenCV右手系惯例(x右、y下、z前),从原始OpenGL坐标系转化而来。有效掩膜如实标注NaN、天空、玻璃及超出范围等无效像素,确保数据真实性。每帧数据在多通道.npy文件中按索引严格对齐,且场景级内参固定(fx=fy=886.81,主点位于511.5, 383.5),便于批量处理与跨场景比较。
使用方法
数据可通过Hugging Face CLI工具进行灵活下载:使用`hf download`命令获取完整数据集或仅下载特定场景的.tar文件,并借助`tar -xf`解压即可使用。推荐使用提供的`SceneFrames`类加载单场景数据,该类将读取meta.json、深度、内参、外参及有效掩膜,并返回PIL读取的RGB图像转numpy数组,最终以字典格式输出torch张量(含rgb、depth、K、w2c、valid)。此外,射线地图未持久化存储,建议根据内参、外参及z-depth在模型端动态计算,遵循DA3约定的标准化流程。
背景与挑战
背景概述
在三维视觉与语言模型交叉领域,高质量合成数据集对推动场景理解研究至关重要。Hypersim数据集由Apple团队于2021年国际计算机视觉大会(ICCV)上提出,旨在通过逼真的合成图像为室内场景理解提供密集的几何与语义标注。该数据集涵盖457个室内场景、约77,400帧图像,并利用V-Ray渲染引擎生成高保真真值,包括深度、法线及语义信息。3dvlm-hypersim作为其衍生版本,由3DVLM项目团队重新整理为统一的§6格式,每帧包含RGB图像、z深度图、相机内外参及有效掩码,为多模态推理与3D感知研究提供了标准化数据基础。该数据集因其对室内场景真实感的卓越模拟,已成为评估视觉定位、深度估计及场景图生成等任务的重要基准,在领域内具有广泛影响力。
当前挑战
3dvlm-hypersim数据集所解决的核心领域挑战在于,现实场景理解任务常面临真实标注获取困难、光照条件多变及物体遮挡复杂等问题。合成数据虽能提供精确标注,但其与真实场景间的域差异仍制约模型泛化能力。具体挑战包括:1)合成图像中纹理与材质的理想化特征导致模型难以适应真实环境的噪声与光照变化;2)深度由欧几里得距离余弦校正为z深度,增加了与真实传感器数据(如LiDAR)对齐的复杂性;3)转换后镜头内参固定(fx=fy=886.81),限制了模型对不同相机模型的适用性;4)构建过程中需处理原始OpenGL坐标系至OpenCV坐标系的转换,易引入位姿对齐误差;5)有效掩码需排除天空、玻璃等非朗伯面及NaN像素,增加了预处理流程的校验负担。
常用场景
经典使用场景
3DVLM-Hypersim数据集是面向3D视觉与语言模型(VLM)研究的高保真合成数据资源,源自Apple团队的Hypersim数据集,经过重新整理为统一格式,涵盖457个室内场景、约77,400帧高分辨率RGB图像及其对应的稠密深度图、内外参数与有效像素掩码。其最经典的使用场景在于支持单目深度估计、多视图立体匹配、三维场景重建与室内布局理解等几何计算任务,尤其适合作为真实感渲染与物理精确几何信息的基准数据,推动算法在复杂室内环境下的泛化能力评估。
衍生相关工作
该数据集衍生出一系列具有影响力的工作,包括基于单张图像的室内深度先验学习框架、跨场景一致的几何与语义联合嵌入方法,以及利用合成数据域适应真实场景的无监督深度估计技术。例如,通过在其上预训练深度补全网络,研究人员成功将知识迁移至真实世界数据集如NYUv2与ScanNet,显著提升了域外泛化性能。此外,基于其规整的视角布局与光照一致性,学界还发展了可泛化的神经辐射场(NeRF)初始化策略,以及利用语义掩码引导的几何精细化管线,这些探索共同夯实了逼真合成数据作为三维视觉研究基石的地位。
数据集最近研究
最新研究方向
在三维视觉与语言模型交叉领域,Hypersim数据集的重新格式化版本正成为推动多模态场景理解研究的关键基石。该数据集延续了Apple在ICCV 2021提出的高质量合成室内场景理念,通过统一的§6存储格式整合457个场景、约7.7万帧的精准深度、位姿与语义掩码,为大规模预训练任务提供了标准化的密集几何与光度真值。当前前沿方向聚焦于利用此类基准数据训练能够同时解析空间布局、物体属性与语言指令的联合模型,例如在具身智能中实现零样本操作规划,或在室内导航任务中融合自然语言与三维拓扑推理。尤其在扩散模型与神经渲染技术突破的背景下,Hypersim的深度一致性约束被用于提升场景编辑和新视角合成的物理合理性,而共享协议(CC BY-SA 3.0)则鼓励学术界在此基础上开展可复现的对比研究,其影响已延伸至数字孪生与增强现实等热门应用领域,有力推动了从静态感知走向动态交互的范式转型。
以上内容由遇见数据集搜集并总结生成



