遇见数据集

Rynn4DDataset 1.0

收藏
arXiv2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

Rynn4DDataset 1.0是由阿里巴巴达摩院等机构联合构建的大规模4D具身视频数据集,旨在为机器人操作提供几何与运动显式表达的训练基础。该数据集包含超过2.544亿视频帧,整合了以人为中心的第一视角活动视频与多样化机器人操作数据,并通过先进模型生成了高质量的深度与光流伪标注。其构建过程融合了多模态标注流水线,包括视频描述生成、光流估计与深度预测,确保了数据在时空维度上的一致性。该数据集主要应用于4D具身世界模型的训练,致力于解决开放世界机器人操作中场景动态预测与精确动作生成的难题,为具身智能的发展提供了关键的数据支撑。

Rynn4DDataset 1.0 is a large-scale 4D embodied video dataset jointly constructed by Alibaba DAMO Academy and other institutions. It aims to provide a training foundation with explicit geometric and motion representations for robotic manipulation. This dataset contains over 254.4 million video frames, integrates first-person activity videos centered on humans and diverse robotic manipulation data, and generates high-quality pseudo-annotations for depth and optical flow via advanced models. Its construction process integrates a multi-modal annotation pipeline, including video caption generation, optical flow estimation and depth prediction, to ensure the consistency of the data in both spatial and temporal dimensions. This dataset is mainly applied to the training of 4D embodied world models, and is committed to solving the challenges of scene dynamic prediction and precise action generation in open-world robotic manipulation, providing critical data support for the development of embodied intelligence.

创建时间:
2026-07-08
搜集汇总
数据集介绍
Rynn4DDataset 1.0 数据集图片
构建方式
在开放世界机器人操作任务中,场景三维结构的动态演化预测至关重要。为弥合大规模4D训练数据的匮乏,我们构建了Rynn4DDataset 1.0,这是一个融合了超过2.544亿帧视频数据的混合数据集。数据集整合了以自我为中心的人类活动数据(如Epic-Kitchens、EgoVid)与多样化机器人操作数据(如RoboMIND、RDT-1B、Galaxea、RoboCoin、AgiBot)。通过多模态伪标注流水线,首先利用Qwen3-VL对视频片段生成细致文本描述,随后采用DPFlow模型估算稠密光流,并借助Depth Anything 3模型预测单目深度,最终将深度图线性插值至原始分辨率并进行量化,形成涵盖RGB、深度与光流的4D标注。
使用方法
Rynn4DDataset 1.0专为训练4D生成式世界模型而设计,其典型应用场景是作为RynnWorld-4D模型的三阶段训练数据。使用时,首先从数据集中采样包含RGB帧序列、对应深度图及光流图的视频片段,并以首帧RGB-D图像和自然语言指令作为条件输入。在训练过程中,模型需同步学习生成后续RGB、深度与光流帧,通过联合跨模态注意力机制确保时空一致性。此外,该数据集亦可作为4D场景重建或机器人策略学习的基准,研究者可基于其稠密标注评估生成模型在视觉质量、几何精度及运动一致性方面的表现。
背景与挑战
背景概述
Rynn4DDataset 1.0由阿里巴巴达摩院与香港中文大学等机构的研究人员于2026年创建,旨在解决机器人操作领域中4D世界模型训练数据匮乏的核心问题。该数据集汇聚了超过2.544亿帧视频,融合了自我中心的人类活动数据与机器人操作数据,并借助先进算法为每一帧标注了高质量的深度图与光流信息。其核心研究问题在于如何构建一个能够同步预测未来RGB、深度与光流序列的生成式世界模型,从而弥合高维视觉预测与低层机器人动作之间的鸿沟。该数据集的发布推动了4D生成式建模在具身智能领域的发展,为后续的机器人策略学习提供了坚实的数据基础。
当前挑战
Rynn4DDataset 1.0所面临的挑战首先体现在领域问题层面:传统的2D视频模型缺乏几何基础,难以准确捕捉物体的空间位置与运动轨迹,导致机器人在执行精细操作时出现尺度波动与形状畸变。而构建该数据集的过程同样充满困难:需要从多个异构视频源中提取数据,并为其统一生成密集的深度与光流伪标注,这要求标注技术具备极高的鲁棒性与跨场景泛化能力;同时,2.544亿帧的庞大规模对存储、处理与训练效率提出了严峻考验,必须设计高效的多模态数据流水线来保证数据质量与一致性。
常用场景
经典使用场景
在具身智能与机器人操作领域,Rynn4DDataset 1.0 最经典的使用场景是作为大规模训练语料,驱动四维世界模型的生成式预训练。该数据集汇聚了超过2.544亿帧来自第一人称人类活动与机器人操作视频,并配有高质量伪标注的深度图与光流图。研究者可基于此数据集,训练诸如RynnWorld-4D这样的三分支扩散模型,使其在给定单张RGB-D图像与语言指令后,同步生成未来时刻的RGB序列、深度图与光流场,从而实现从二维像素到四维场景演化的能力跃迁。
解决学术问题
该数据集核心解决了具身智能研究中大规模四维标注数据匮乏的瓶颈问题。此前,生成式世界模型多局限于二维像素空间,缺乏对场景几何结构与动态运动的显式建模,导致机器人在空间精度与时序协调任务中表现不佳。Rynn4DDataset 1.0 通过整合人类与机器人操作数据并同步标注深度与光流,为训练兼具视觉外观、几何结构与运动动力学的四维世界模型提供了坚实数据基础。这一数据驱动范式显著缩小了世界预测与策略学习之间的表征鸿沟,推动了从被动感知到主动预测的学术研究方向转型。
实际应用
在实际应用中,Rynn4DDataset 1.0 支撑了高频闭环机器人控制系统的构建。基于该数据集训练的RynnWorld-4D-Policy策略模型,能够从四维世界模型内部表征中直接解码机器人动作,绕过繁琐的多步去噪过程,实现了约9Hz的有效控制频率。在真实世界的双臂灵巧操作任务中,包括双手拾取、叠碗、放置盖子等场景,该系统展现出卓越的空间精度与时序协调能力,相较于传统二维策略与基础模型取得了显著的性能提升,为开放环境中通用具身智能的落地提供了可行技术路径。
数据集最近研究
最新研究方向
Rynn4DDataset 1.0的提出标志着具身智能领域在4D世界模型构建上迈出了关键一步。该数据集汇集了超过2.54亿帧来自人类日常活动与机器人操作的视频,并通过高质量的伪标签提供了深度与光流的模态信息。当前,前沿研究正聚焦于利用该数据集训练能够同步预测RGB、深度与光流序列的生成式世界模型,从而将二维像素空间的视频生成拓展至包含几何结构与运动动力学的四维场景演化。这一方向紧密关联着具身智能中的开环与闭环操作任务,尤其是在需要精细时空协调的双臂灵巧操作中展现出显著优势。通过为机器人提供显式的三维场景流与几何线索,该数据集驱动的世界模型有望弥合视觉预测与底层动作执行之间的表征鸿沟,为通用具身智能体的构建奠定坚实的数据与理论基础。
相关研究论文
  • 1
    RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation阿里巴巴集团·达摩院; 香港具身智能实验室; 香港中文大学; 湖畔实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务