WorldRover
收藏资源简介:
WorldRover是一个数据引擎,它通过相机(可选角色)在艺术家构建的3D环境中行走,并将遍历过程记录为视频,同时附带渲染器能够精确生成的注释:度量深度、每帧相机姿态、光流以及产生运动的行为流。
WorldRover is a data engine that traverses artist-constructed 3D environments via cameras (optional roles), records the traversal process as videos, and provides precise annotations generated by the renderer, including metric depth, per-frame camera poses, optical flow, and motion-generating behavior flow.
WorldRover 数据集概述
WorldRover 是一个可扩展的合成视频数据引擎,通过在艺术家构建的 3D 环境中移动摄像机(可选配角色)来生成视频,并同步输出渲染器可精确生成的丰富标注,包括度量深度、每帧相机位姿、光流以及产生运动的动作流。该数据集由 Alaya Lab 与东京大学联合发布。
核心特性
| 维度 | 说明 |
|---|---|
| 多视角 | 同一路线提供第一人称、第三人称和360度全景三种观测,时间与几何对齐 |
| 多模态 | 同一光栅化时刻输出颜色、深度和运动数据 |
| 多风格 | 保持几何与运动不变,可切换光照或纹理 |
| 多场景 | 包含30多个艺术家构建的虚幻引擎场景,覆盖室内到城市尺度 |
| 多角色 | 包含70多个动画化的人形、动物和生物角色 |
由于相机路径是一等输入,同一轨迹可在不同投影、光照状态或不同角色下重新渲染,帧与帧之间保持严格对齐。
数据集预览版
当前为预览版本,包含配对的全景/第一人称切片:4个场景,每视图约30分钟,总计约4.1小时、30 fps的视频。
| 场景 | 每视图片段数 | 每视图时长 | 含深度数据体积 |
|---|---|---|---|
| med_village | 13 | 32.1 分钟 | 286 GB |
| paris | 23 | 30.7 分钟 | 167 GB |
| venice | 46 | 30.5 分钟 | 169 GB |
| art_nouveau | 47 | 30.2 分钟 | 179 GB |
建议从精简子集(RGB、相机位姿、动作和元数据,约103 GB)开始,仅在需要无损深度时下载特定场景的仓库(深度数据约占总体积的87%)。
数据格式
每个片段(两种视图)均包含:
rgb.mp4:H.264编码,30 fps,sRGB;全景为4096x2048等距柱状投影,第一人称为1280x720针孔投影depth/depth.mkv:FFV1无损16位,对数量化径向距离depth/depth.meta.json:近/远平面、帧数、解码公式camera_trajectory.csv:每帧位姿(厘米、度)及内参description.json:场景身份、资产包及许可证、轨迹摘要gamepad_format/:动作标签(坐标轴归一化至[-1, 1])trajectory.png:俯视路径预览
同一片段ID的两种视图共享逐帧相同的相机路径,位姿文件完全一致。片段时长为35秒至3.5分钟的连续运动,无剪辑、无瞬移。
配套工具
tools/ 目录提供数据集侧Python包和脚本,支持读取片段、解码深度、相机几何计算、下载验证以及轨迹和点云的可视化。深度采用对数量化并存储径向距离,位姿文件包含n_frames + 1行(末行为闭合关键帧),位姿为虚幻引擎风格——左手坐标系、厘米单位、X向前/Y向右/Z向上。
许可与发布状态
数据集渲染的视频、深度、相机位姿和动作标签供研究使用;底层3D环境为第三方商业资产,不随数据集分发,每个片段的description.json记录其资产包和许可证。tools/目录下的工具采用MIT许可证。
目前渲染器和轨迹规划器不在本次发布范围内。




