遇见数据集

Voxel51/Syn4D_RGBD

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

Syn4D RGBD是一个大规模、全合成的多视图动态场景数据集,旨在推动4D重建、深度估计、3D点跟踪、新视图合成和人体姿态估计等研究。它提供了密集、完整和准确的几何注释,包括每像素深度图、多视图相机轨迹、密集长程3D点跟踪以及参数化SMPL-X人体注释,涵盖使用Unreal Engine 5渲染的多样化室内和室外环境。这个FiftyOne数据集是完整Syn4D版本的一个精选子集,包含3个场景(共45个序列),每个序列有8个同步的多相机视频剪辑,配有每帧深度热图、实例分割掩码和相机姿态元数据,以及一个从所有8个视图重建的融合彩色3D点云。数据集由牛津大学视觉几何组、南洋理工大学和Naver Labs Europe等机构创建,许可证允许用于AI训练,语言为英语(字幕),相关论文为arXiv:2605.05207。

Syn4D RGBD is a large-scale, fully-synthetic multiview dataset of dynamic scenes designed to advance research in 4D reconstruction, depth estimation, 3D point tracking, novel-view synthesis, and human pose estimation. It provides dense, complete, and accurate geometric annotations — including per-pixel depth maps, multi-view camera trajectories, dense long-range 3D point tracks, and parametric SMPL-X human body annotations — across a diverse collection of indoor and outdoor environments rendered with Unreal Engine 5. This FiftyOne dataset is a curated subset of the full Syn4D release, covering 3 scenes (45 sequences total), with each sequence available as 8 synchronised multi-camera video clips, paired with per-frame depth heatmaps, instance segmentation masks, and camera pose metadata, and a fused coloured 3D point cloud reconstructed from all 8 views. The dataset is curated by Visual Geometry Group (VGG), University of Oxford; Nanyang Technological University; Naver Labs Europe, licensed for AI training use, with English captions, and the paper is arXiv:2605.05207.

提供机构:
Voxel51
搜集汇总
数据集介绍
Voxel51/Syn4D_RGBD 数据集图片
构建方式
Syn4D_RGBD数据集源自大规模全合成多视角动态场景数据集Syn4D,由牛津大学视觉几何组、南洋理工大学及Naver Labs Europe联合构建。其渲染管线基于Unreal Engine 5,利用30个大型3D环境、1674个来自Objaverse的动画物体以及585个BEDLAM2模拟人体模型,通过程序化方式生成场景。每段视频序列以1280×720分辨率、30帧率渲染,并采用Lumen实时全局光照技术。所有标注信息均从引擎渲染管线自动导出,包括深度图(float32 EXR格式)、分割掩码、相机内外参数等,无需人工标注。该子集精选了3个场景共45段序列,每段序列包含8路同步多视角视频及融合的彩色点云。
使用方法
使用Syn4D_RGBD数据集需依赖FiftyOne库。用户首先通过pip安装FiftyOne,然后利用Hugging Face的snapshot_download工具将数据集快照下载至本地目录。随后,使用FiftyOne的from_dir方法加载该数据集,并指定数据集格式为FiftyOneDataset。加载完成后,可通过launch_app启动可视化界面进行交互式探索与分析。该数据集适用于单目/多视角深度估计、视频分割、相机位姿估计、3D重建、人体姿态估计及几何感知的新视角合成等任务的训练与评估,但需注意其合成数据特性,不适用于要求真实场景照片级保真度的应用。
背景与挑战
背景概述
Syn4D_RGBD是由牛津大学视觉几何组(VGG)、南洋理工大学及Naver Labs Europe等机构联合创建于2025年的大规模全合成多视图动态场景数据集。该数据集旨在推动四维重建、深度估计、三维点跟踪、新视角合成及人体姿态估计等计算机视觉前沿研究。核心研究问题在于突破真实数据标注稀疏、昂贵且不完整的瓶颈,通过Unreal Engine 5渲染引擎生成包含密集逐像素深度图、多视角相机轨迹、长距离三维点轨迹及参数化SMPL-X人体标注的合成动态场景。作为Syn4D全集的一个精心挑选子集,该数据涵盖了3类场景共45个序列,每个序列提供8路同步视频、深度热图、实例分割掩码及相机位姿元数据,为验证几何感知算法提供了高精度基准,对多视角动态场景理解领域产生了重要影响。
当前挑战
该数据集主要应对两大挑战。在领域问题层面,传统真实动态场景数据集面临标注成本高昂、光照条件不可控、遮挡关系复杂等困境,严重制约了四维重建与时序深度估计算法的发展。Syn4D_RGBD通过完全合成的数据生成管线,提供了稠密、完整且精确的几何标注,使模型能够在理想条件下学习时空对应关系,从而突破真实数据标注稀疏与噪声的瓶颈。在数据构建层面,挑战在于如何利用Unreal Engine 5逼真渲染大规模动态场景:需从30个三维环境与1674个动画对象中程序化组合场景,并借助Lumen实时光照与烘焙光照贴图平衡渲染效率与物理真实感;同时,自动提取深度、分割等标注虽避免了人工成本,但需确保相机轨迹覆盖最大化,八路视频的精确同步及点云下采样后的几何保真度,这对管线设计提出了严苛要求。
常用场景
经典使用场景
Syn4D_RGBD作为大规模全合成多视图动态场景数据集,在四维重建研究领域展现出无可替代的经典应用价值。该数据集通过虚幻引擎5渲染的室内外多样化环境,提供了包括逐像素深度图、多视角相机轨迹、密集长程三维点追踪及SMPL-X人体注释在内的完整几何标注,为动态场景的时空建模提供了理想训练与评测平台。其精心设计的8视角同步视频序列与融合彩色点云,使得研究者能够系统性地评估算法在复杂运动场景下的鲁棒性与泛化能力,尤其在处理遮挡、光照变化及复杂形体形变等挑战性问题时,这种全合成数据带来的精确地面真值成为推动技术突破的关键基石。
解决学术问题
Syn4D_RGBD数据集精准解决了计算机视觉领域中动态场景几何理解的多项核心学术难题。在深度估计方面,它提供的厘米级精确深度图克服了真实世界采集设备受限于纹理与光照的缺陷,为单目与多视图深度预测算法提供了可靠基准。针对三维点追踪这一长期困扰学术界的挑战,该数据集通过像素对齐重心坐标与网格序列实现了亚像素级密集追踪标注,使得长时域运动建模研究得以在可控条件下进行精细化验证。此外,其自动生成的SMPL-X人体参数与多视角一致性约束,为人机交互场景中的姿态估计与新颖视图合成研究开辟了全新的验证范式,推动了从静态场景理解向动态四维重建的学科演进。
实际应用
Syn4D_RGBD数据集在工业与科技领域的实际应用场景中展现出广泛潜力。在自动驾驶领域,其精确的深度图与实例分割掩码可用于验证环境感知模型在复杂动态城市环境中的性能表现,尤其是多传感器融合系统的鲁棒性评估。影视制作与虚拟现实产业中,该数据集提供的多视角动态数据与点云资源为数字替身创建、虚拟摄影规划及特效渲染管线提供了珍贵素材与算法评测标准。在增强现实应用中,研究人员利用其标注精密的相机轨迹与深度信息,能够更高效地开发适用于移动设备的实时定位与遮挡处理算法,从而提升用户体验的沉浸感与交互自然度。
数据集最近研究
最新研究方向
Syn4D_RGBD数据集作为大规模全合成多视图动态场景资源,正引领4D重建、深度估计与3D点追踪等前沿方向的研究突破。该数据集利用虚幻引擎5的Lumen全局光照技术,提供包含多视角相机轨迹、逐像素深度图及SMPL-X人体注释在内的密集几何标注,显著推动了动态场景理解与合成视图生成技术的发展。其精心设计的室内外场景与程序化渲染管线,使得在缺乏真实标注的复杂动态环境中训练模型成为可能,为4D感知领域的算法基准测试与跨模态学习奠定了坚实基础,影响深远。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务