遇见数据集

WorldRover

收藏
github2026-08-19 更新2026-08-22 收录
官方服务:

资源简介:

WorldRover是一个数据引擎,它通过相机(可选角色)在艺术家构建的3D环境中行走,并将遍历过程记录为视频,同时附带渲染器能够精确生成的注释:度量深度、每帧相机姿态、光流以及产生运动的行为流。

WorldRover is a data engine that traverses artist-constructed 3D environments via cameras (optional roles), records the traversal process as videos, and provides precise annotations generated by the renderer, including metric depth, per-frame camera poses, optical flow, and motion-generating behavior flow.

创建时间:
2026-08-12
原始信息汇总

WorldRover 数据集概述

WorldRover 是一个可扩展的合成视频数据引擎,通过在艺术家构建的 3D 环境中移动摄像机(可选配角色)来生成视频,并同步输出渲染器可精确生成的丰富标注,包括度量深度、每帧相机位姿、光流以及产生运动的动作流。该数据集由 Alaya Lab 与东京大学联合发布。

核心特性

维度 说明
多视角 同一路线提供第一人称、第三人称和360度全景三种观测,时间与几何对齐
多模态 同一光栅化时刻输出颜色、深度和运动数据
多风格 保持几何与运动不变,可切换光照或纹理
多场景 包含30多个艺术家构建的虚幻引擎场景,覆盖室内到城市尺度
多角色 包含70多个动画化的人形、动物和生物角色

由于相机路径是一等输入,同一轨迹可在不同投影、光照状态或不同角色下重新渲染,帧与帧之间保持严格对齐。

数据集预览版

当前为预览版本,包含配对的全景/第一人称切片:4个场景,每视图约30分钟,总计约4.1小时、30 fps的视频。

场景 每视图片段数 每视图时长 含深度数据体积
med_village 13 32.1 分钟 286 GB
paris 23 30.7 分钟 167 GB
venice 46 30.5 分钟 169 GB
art_nouveau 47 30.2 分钟 179 GB

建议从精简子集(RGB、相机位姿、动作和元数据,约103 GB)开始,仅在需要无损深度时下载特定场景的仓库(深度数据约占总体积的87%)。

数据格式

每个片段(两种视图)均包含:

  • rgb.mp4:H.264编码,30 fps,sRGB;全景为4096x2048等距柱状投影,第一人称为1280x720针孔投影
  • depth/depth.mkv:FFV1无损16位,对数量化径向距离
  • depth/depth.meta.json:近/远平面、帧数、解码公式
  • camera_trajectory.csv:每帧位姿(厘米、度)及内参
  • description.json:场景身份、资产包及许可证、轨迹摘要
  • gamepad_format/:动作标签(坐标轴归一化至[-1, 1])
  • trajectory.png:俯视路径预览

同一片段ID的两种视图共享逐帧相同的相机路径,位姿文件完全一致。片段时长为35秒至3.5分钟的连续运动,无剪辑、无瞬移。

配套工具

tools/ 目录提供数据集侧Python包和脚本,支持读取片段、解码深度、相机几何计算、下载验证以及轨迹和点云的可视化。深度采用对数量化并存储径向距离,位姿文件包含n_frames + 1行(末行为闭合关键帧),位姿为虚幻引擎风格——左手坐标系、厘米单位、X向前/Y向右/Z向上。

许可与发布状态

数据集渲染的视频、深度、相机位姿和动作标签供研究使用;底层3D环境为第三方商业资产,随数据集分发,每个片段的description.json记录其资产包和许可证。tools/目录下的工具采用MIT许可证。

目前渲染器和轨迹规划器不在本次发布范围内。

搜集汇总
数据集介绍
WorldRover 数据集图片
构建方式
WorldRover是一种可扩展的合成视频数据引擎,通过在艺术家构建的三维环境中驱动虚拟摄像机(可选配角色)进行遍历,并渲染生成视频及精确的标注信息。其构建方式的核心在于将摄像机路径作为一等输入,使得同一轨迹能够在不同投影方式、光照条件或角色设定下逐帧重渲染,从而保证帧级对齐。引擎支持多视角(第一人称、第三人称、360度全景)、多模态(颜色、深度、运动)、多风格(几何与运动不变,仅改变光照或纹理)、多场景(30余个虚幻引擎场景,涵盖室内至城市尺度)以及多角色(70余个动画角色)的五维变化。预览版包含四个场景(med_village、paris、venice、art_nouveau)的双视角(全景与第一人称)RGB-D视频,总计约4.1小时,帧率30fps。每个片段包含H.264编码的RGB视频(全景4096x2048,第一人称1280x720)、无损16位对数量化的径向距离深度图、逐帧相机位姿CSV、描述元数据、游戏手柄格式的动作标签以及轨迹预览图。深度数据占字节量的87%,并单独存储以便按需下载。工具包提供读取片段、解码深度、处理相机几何、验证下载及可视化轨迹和点云的功能,同时规范了深度编码(对数量化、径向距离)、轨迹行数(n_frames+1)及虚幻引擎坐标系(左手系、厘米、X前/Y右/Z上)等易错约定。
使用方法
使用WorldRover数据集时,首先需从其Hugging Face仓库获取预览版本,建议从轻量子集(约103GB)开始,包含RGB、相机位姿、动作标签及元数据,并按需下载特定场景的深度数据(深度占存储的87%)。通过提供的Python工具包,用户可便捷地读取视频帧、解码深度图、获取世界坐标系下的点云。例如,使用`worldrover.Clip`类可直接访问指定帧的RGB图像和深度值,并通过`points_world`方法获得以厘米为单位的全局坐标。工具还提供`verify_dataset.py`脚本用于校验下载完整性,`check_pairing.py`用于验证全景与第一人称视角的轨迹对齐。用户应特别注意深度编码为对数量化的径向距离,非平面深度,需先转换再投影;轨迹CSV包含n_frames+1行,末尾为闭合关键帧;姿态遵循虚幻引擎坐标系(左手系,厘米单位,X向前,Y向右,Z向上,相机沿自身+X方向观察)。工具的详细说明见`tools/README.md`,并遵循MIT许可协议。数据集本身仅限研究用途,底层三维环境为第三方商业资产,不随数据分发,但每个片段的`description.json`记录了资产包及许可信息。
背景与挑战
背景概述
WorldRover 是由 Alaya Lab 与东京大学的研究人员(包括许晓杰、林正远等)于 2026 年推出的可扩展合成视频数据引擎,旨在为具身智能与视觉感知研究提供大规模、富含精确标注的视频数据。该引擎通过三维场景中的相机及角色漫游,同步渲染生成多视角(第一人称、第三人称、360°全景)、多模态(彩色、深度、光流)、多风格(几何与运动不变,光照或纹理变化)、多场景(30余个 Unreal Engine 场景)及多角色(70余个动画人物与动物)的视频数据。其核心优势在于所有标注(如度量深度、相机位姿、光流、动作流)均由渲染器精确生成,而非事后估计,保证了标注的绝对精确性,为世界探索任务(如导航、场景理解、运动预测)提供了高质训练样本,对相关领域具有重要推动作用。
当前挑战
WorldRover 面临的挑战涵盖两方面:一是领域问题,即现有真实视频数据集难以提供像素级精确的深度、位姿及动作标注,而合成数据虽可规避此问题,却往往缺乏多样性或标注完整性,WorldRover 需在保证标注精确性的同时,实现多视角、多模态、多风格、多场景、多角色的高度可控变体,满足世界探索任务对数据规模与多样性的需求。二是构建过程中的挑战,包括设计可复用的数据引擎以统一渲染管线并避免标注估算误差,处理多视角数据在几何与时间上的严格对齐(如第一人称与全景视频共享相机轨迹),管理海量数据存储与传输(深度数据占比高达87%),以及维护第三方商业场景资产的许可合规性,同时确保数据格式的标准化与工具链的易用性。
常用场景
经典使用场景
WorldRover数据集作为大规模合成视频数据引擎,其核心使用场景在于为世界探索任务提供高保真、多模态的视频数据。该数据集通过虚拟摄像机在精心构建的三维环境中漫游,同步记录RGB图像、度量深度、相机位姿、光流及动作流等精确标注,支持第一人称、第三人称及360度全景等多视角观测。其多场景、多风格、多角色的设计,使其成为训练和评估视觉定位、深度估计、光流计算、动作识别等模型的理想基准,尤其适用于需要精确几何与运动标注的复杂任务。
解决学术问题
WorldRover解决了合成视频数据中标注不精确、视角单一、场景覆盖有限等核心学术问题。传统数据集常依赖后处理估算标注,而WorldRover直接从渲染管线获取精确的度量深度和相机位姿,消除了估计误差。其多视角同步拍摄确保了几何一致性,为多视图几何、三维重建、跨视角学习等研究提供了可靠的基础。此外,多风格和多场景的变换支持了域适应和泛化能力的研究,推动了视觉模型在真实世界应用中的鲁棒性提升。
实际应用
在实际应用中,WorldRover数据引擎可赋能自动驾驶、机器人导航、增强现实等领域的模型训练与验证。例如,自动驾驶系统可利用其高精度深度和位姿数据进行感知算法的开发,机器人则能借助动作流和光流信息优化运动规划。其可重渲染特性允许用户根据需求调整光照或纹理,生成定制化数据,从而加速从虚拟到现实的迁移。此外,该数据集还支持大规模场景理解,为城市级导航和虚拟试穿等应用提供数据支撑。
数据集最近研究
最新研究方向
WorldRover作为一款可扩展的合成视频数据引擎,其发布标志着具身智能与多模态学习领域对高质量、多标注对齐数据需求的深刻回应。该数据集通过精心设计的引擎,在艺术家构建的3D环境中驱动摄像机与角色移动,同步生成第一人称、第三人称及360度全景等多视角视频,并附带度量深度、相机位姿、光流及动作流等精确标注,解决了传统数据采集中标注滞后与不精确的痛点。其多场景、多角色、多风格的灵活设计,为世界探索、视觉导航、具身交互等前沿研究提供了坚实的训练基石。当前预览版聚焦于全景与第一人称配对切片,展现了跨视角几何与时间一致性,而未来将扩展至风格化视频、第三人称动作标签及更丰富的场景,预示着该引擎在推动通用具身智能体环境理解与决策能力方面具有深远潜力,成为连接虚拟渲染与现实世界认知的桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务