遇见数据集

Real4D

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

Real4D 是一个面向真实域动态场景的数据集,基于同步多相机捕获,通过几何正则化的 4D 高斯泼溅(Gaussian Splatting)及时空相机插值技术生成。该数据集提供同步的 RGB 图像、密集渲染的深度图以及精确的相机元数据。数据集包含来自 N3DV 和 MeetRoom 两个源数据集的共 10 个场景,总计 3,084 条轨迹,每条轨迹包含 300 帧,总帧数达 925,200 帧。RGB 图像为 8 位 JPEG 格式,深度图为 16 位灰度 PNG(毫米单位,零值表示无效像素)。相机元数据以 JSON 格式按轨迹组织,并附带可视化预览(彩色深度图及 30fps MP4 视频)。深度信息为基于重建的渲染结果,而非传感器真值,相机姿态相对于预设虚拟轨迹精确。该数据集适用于深度估计、动态场景重建、新视角合成、多视图 4D 场景理解等任务。来源数据遵循各自许可(N3DV 为 CC BY-NC 4.0,MeetRoom 为研究用途),使用时需引用原始论文。

Real4D is a dataset for real-world dynamic scenes, generated from synchronized multi-camera captures using geometry-regularized 4D Gaussian Splatting and spatio-temporal camera interpolation. It provides synchronized RGB images, densely rendered depth maps, and accurate camera metadata. The dataset includes a total of 10 scenes from two source datasets, N3DV and MeetRoom, consisting of 3,084 trajectories, each with 300 frames, resulting in 925,200 frames in total. RGB images are in 8-bit JPEG format, and depth maps are 16-bit grayscale PNG (in millimeters, with zero values indicating invalid pixels). Camera metadata is organized by trajectory in JSON format, accompanied by visual previews (colored depth maps and 30fps MP4 videos). Depth information is derived from reconstruction-based rendering, not sensor ground truth, and camera poses are accurate relative to predefined virtual trajectories. The dataset is suitable for tasks such as depth estimation, dynamic scene reconstruction, novel view synthesis, and multi-view 4D scene understanding. Source data follows respective licenses (N3DV: CC BY-NC 4.0, MeetRoom: research use), and the original papers must be cited when using the dataset.

创建时间:
2026-08-20
原始信息汇总

Real4D 数据集概述

基本信息

  • 数据集名称:Real4D
  • 许可证:other(遵循源数据集条款)
  • 任务类型:深度估计(depth-estimation)
  • 数据规模:100K < n < 1M
  • 标签:4D、动态场景、多视角、新视角合成、相机位姿、高斯泼溅

数据集简介

Real4D 是一个真实域动态场景数据集,通过几何正则化的 4D 高斯泼溅(4D Gaussian Splatting)和时空相机插值,从同步多相机捕捉中生成。数据集包含同步 RGB 图像、密集渲染深度图和解析式规定的相机元数据。

数据规模统计

来源子集 场景数 参考相机数 轨迹数 每轨迹帧数 总帧数 分辨率
N3DV 6 18–21 2,408 300 722,400 1352 x 1014
MeetRoom 4 13 676 300 202,800 1280 x 720
总计 10 -- 3,084 300 925,200 --

每条轨迹命名为 cam{a}_{b},相机位姿与场景时间从参考相机 a 同步推进至参考相机 b。恒等对(如 cam00_00)表示视点固定而时间推进。

发布模态

  • RGB:8-bit JPEG 图像
  • 深度:透明度归一化的渲染深度,16-bit 灰度 PNG 格式,单位为毫米,零值表示无效或低透明度像素
  • 相机元数据:每条轨迹一个 JSON 清单,每帧一个条目
  • 预览文件:彩色化深度图像,以及 30 fps 的 RGB 和深度 MP4 视频

文件组织结构

text Real4D/ ├── dynerf/ │ └── <scene>/ │ ├── images/<trajectory>/<trajectory><frame>.jpg │ ├── depths/<trajectory>/<trajectory><frame>.jpg.geometric.png │ ├── depth_vis/<trajectory>/<trajectory><frame>.jpg │ ├── camera_params/<trajectory>.json │ └── video/<trajectory>{rgb,depth}.mp4 ├── meetroom/ │ └── <scene>/ │ └── ... ├── dataset_manifest.json ├── docs/DATA_FORMAT.md └── scripts/ ├── load_frame.py ├── validate_dataset.py └── upload_to_hf.sh

注意事项

  • 深度数据为重建渲染的监督信号,并非传感器真实深度值
  • 相机位姿相对于规定的虚拟轨迹是精确的
  • 帧文件编号从 000001000300,JSON 列表索引从零开始,需按轨迹和列表索引匹配帧
  • 本地生成目录(如 _scene_cacheplane_depths 等)为中间产物,不属于公开发布内容

源数据与许可证

  • N3DV 源数据集采用 CC BY-NC 4.0 许可证
  • MeetRoom 相关材料声明仅供研究用途,未明确数据集许可证,因此本数据集使用 license: other
  • 使用前需保留源数据集的适用条款和引用要求,公开发布 MeetRoom 衍生子集前需与原数据集所有者确认
搜集汇总
数据集介绍
Real4D 数据集图片
构建方式
在动态场景重建与新颖视角合成领域,真实世界多视角数据的获取往往受限于硬件同步与标注精度。Real4D通过同步多相机捕获系统采集原始视频,继而借助几何正则化的四维高斯泼溅技术对场景进行时空联合建模,并引入时空相机插值策略生成连续虚拟轨迹。每条轨迹由参考相机对定义,相机位姿与场景时间协同推进,最终输出同步的RGB图像、稠密渲染深度及解析规定的相机元数据。
使用方法
使用前需运行完整性校验脚本以确认数据完整。帧文件以六位数字编号,JSON清单索引从零起算,须依据轨迹名称与列表索引进行匹配。加载单帧可参考提供的示例脚本,深度图与RGB图像按目录结构对应存放。用户可借助颜色化深度预览及三十帧每秒的视频文件快速浏览动态效果,相机参数逐帧记录于各轨迹的JSON清单中,便于开展深度估计与视角合成等任务的训练与评测。
背景与挑战
背景概述
动态场景的三维重建与新颖视角合成是计算机视觉与图形学的核心议题,其发展长期受限于真实世界多视角时序数据的匮乏。现有数据集或聚焦静态场景,或缺乏精确的时空相机轨迹与稠密深度监督,难以支撑动态辐射场方法的系统性评测。Real4D数据集应运而生,它由同步多相机捕捉的真实场景经几何正则化四维高斯泼溅与时空相机插值生成,包含N3DV与MeetRoom两个子集,共计10个场景、3084条轨迹与逾92万帧同步RGB、稠密渲染深度及解析相机元数据。该数据集为动态场景建模、视角合成与深度估计研究提供了大规模、多模态的基准资源,推动了真实域动态场景理解的发展。
当前挑战
Real4D所应对的领域问题在于真实动态场景中时空一致性建模与新颖视角合成的复杂性,现有方法在视角剧变与时序演化耦合时往往产生几何失真与纹理模糊。构建过程中的核心挑战包括:从同步多相机捕获中精确恢复四维时空结构,确保渲染深度与相机轨迹的解析准确性;处理源数据集许可差异带来的合规发布问题,特别是MeetRoom子集缺乏明确许可条款;以及在大规模轨迹生成中维持帧间对应关系与数据完整性,避免插值引入的伪影。这些挑战共同构成了动态场景数据集构建与应用的实质性障碍。
常用场景
经典使用场景
在动态场景重建与自由视点视频生成的学术前沿,Real4D凭借同步多相机采集与几何正则化4D高斯泼溅技术,为时空连续视角的渲染提供了高质量的基准资源。其经典使用场景聚焦于新视角合成任务,尤其是相机位姿与场景时间同步演进的复杂设定:通过命名如cam{a}_{b}的轨迹,框架系统性地将参考相机从a平滑过渡至b,同时让场景时间步进,从而支撑起对动态辐射场时空插值能力的精细评估。研究者可依托RGB图像、密集渲染深度与解析相机元数据,系统检验模型在真实域动态场景中的泛化表现,推动四维重建方法从合成数据向真实采集的范式跃迁。
解决学术问题
针对动态场景多视角重建中长期存在的时空一致性建模难题,Real4D通过提供严格同步的多相机视频流与解析式虚拟轨迹,有效缓解了真实数据中相机位姿抖动与时间对齐误差对训练稳定性的干扰。其深度监督信号虽源自重建渲染而非传感器真值,却为几何正则化提供了密集且一致的约束,助力学术界探究4D高斯泼溅在动态场景下的深度估计与几何保真度边界。该数据集弥补了现有基准在真实域动态场景中视角连续变化与时间演进耦合验证的空白,为评估模型在非刚性形变与视角依赖效应下的鲁棒性建立了可复现的实验平台,对推动动态神经辐射场与实时渲染研究的融合具有基准性意义。
实际应用
在实际应用层面,Real4D为沉浸式远程会议、自由视点体育直播及虚拟制片等场景提供了贴近真实环境的数据支撑。其包含的MeetRoom子集源自真实会议场景,可用于训练和评测面向视频会议系统的动态人体与场景联合重建算法,提升远程协作中的临场感与视角自由度。N3DV子集则覆盖多相机采集的复杂动态场景,适用于影视级自由视点特效生成与动态光场编辑任务。借助精确的相机轨迹与逐帧深度信息,开发者能够构建时空一致的渲染管线,服务于虚拟现实内容创作、动态场景理解及机器人视觉中的动态环境建模等实际需求,弥合了学术基准与工业部署之间的数据鸿沟。
数据集最近研究
最新研究方向
在动态场景重建与新颖视角合成领域,Real4D数据集凭借其从多相机同步捕获中经几何正则化4D高斯泼溅与时空相机插值生成的特性,正推动着真实域动态场景理解的边界。当前前沿研究聚焦于利用该数据集的高密度渲染深度与精确相机元数据,探索动态场景的时空一致性建模与实时渲染,尤其在多视角动态场景的深度估计与视角合成任务中,为算法提供超越传感器真值的监督信号。这一方向与神经辐射场、高斯泼溅等热点技术紧密关联,有望提升动态场景重建的鲁棒性与泛化能力,对虚拟现实、自由视角视频等应用具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务