遇见数据集

EgoInfinity

收藏
github2026-06-19 更新2026-06-20 收录
官方服务:

资源简介:

EgoInfinity是一个网络规模的4D手-物体交互数据引擎,用于任意视角的机器人重定向和视频到动作的机器人学习。它从单个静态摄像头RGB视频中进行度量3D手-物体跟踪,无需深度传感器或校准,输出每帧21个关节的手部姿态、MANO网格、每个物体的6自由度姿态序列以及重建的3D网格,并提供一个交互式Viser 3D查看器。

EgoInfinity is a web-scale 4D hand-object interaction data engine designed for arbitrary-view robot remapping and video-to-action robotic learning. It performs metric 3D hand-object tracking from RGB videos captured by a single static camera, without requiring depth sensors or calibration. It outputs 21-joint hand pose per frame, MANO meshes, 6-degree-of-freedom (6DoF) pose sequences for each object, and reconstructed 3D meshes, and provides an interactive Viser 3D viewer.

创建时间:
2026-06-10
原始信息汇总

数据集概述:EgoInfinity

EgoInfinity 是一个面向机器人领域的 Web 规模的 4D 手-物交互数据引擎,旨在支持任意视角的机器人重定向和视频到动作的机器人学习。

  • 发布机构:莱斯大学(Rice University)机器人自主与交互感知实验室(Rice RobotPI Lab)与 Robotics and AI Institute 合作。
  • 核心论文:arXiv 2606.17385。
  • 数据集与演示
    • 数据集:Hugging Face 上的 EgoInfinity。
    • 可视化演示:Hugging Face Space 上的 Viewer。

核心功能

从单个静态相机 RGB 视频中实现度量级 3D 手-物交互跟踪,无需深度传感器或相机标定。输出内容包括:

  • 每帧的 21 关节点手部姿态。
  • MANO 手部网格模型。
  • 每个物体的 6D 位姿序列及重建的 3D 网格。
  • 交互式 3D 查看器。

处理流水线

流水线由多个阶段组成,每个阶段使用不同的骨干网络:

阶段 任务 骨干网络
A 度量深度 + 焦距估计 MoGe-2 (ViT-L)
A-grav 世界坐标系重力方向估计 GeoCalib
B 手部检测 + MANO 重建 YOLO + WiLoR (DINOv2-L)
C 光流、深度稳定、对齐、平滑、关节点约束 MEMFOF, SavGol, 生物力学 swing-twist
C+ 缺失帧运动插值 HaWoR Transformer
D-sam3 文本提示的物体检测与跟踪 SAM3.1 + SAM2
D-sam3d 单图像 3D 物体重建 SAM 3D Objects (高斯泼溅 PLY)
D-track 6D 网格位姿跟踪 Open3D + MEMFOF + 自定义算法

文档结构

项目提供了详细的文档说明:

文档 覆盖内容
docs/PIPELINE.md 流水线架构深入解析:每一阶段、跟踪后序列、PKL v2 格式、数据布局、硬件要求
docs/ARCHITECTURE.md 编排层设计:阶段/注册/运行器设计、恢复、剪辑组合选择器、第一阶段骨干网络替换
docs/MANIFEST.md manifest.json 字段参考:视频 URI、物体列表等输入信息
docs/THIRD_PARTY.md 第三方依赖、权重及许可证,以及 Action100M 数据集获取
docs/MULTI_HOST.md 跨机器运行指南

硬件要求

  • 推荐 GPU:单张 A100 (40 GB) 或 H100 (80 GB)。
  • 最小 GPU:建议 ≥ 16 GB。
  • 显存占用:启用 D 阶段时,两个 GPU 工作进程增加约 14 GB 驻留显存(SAM3.1 约 4 GB,SAM 3D Objects 约 10 GB,流水线主进程 3-5 GB 峰值)。

许可证与使用限制

组件 许可证
项目源代码 MIT
WiLoR (阶段 B) CC-BY-NC-ND (仅供研究,禁止衍生)
SAM2 Apache 2.0
Ultralytics YOLO AGPL-3.0
MANO 模型 非商业研究许可
机器人资产 遵循上游许可
MoGe-2/GeoCalib/SAM3.1/SAM 3D Objects/MEMFOF 各自上游许可证

商用限制:整个仓库的商用受 WiLoR (CC-BY-NC-ND) 和 MANO (非商业) 条款限制,且捆绑的 Ultralytics YOLO 为 AGPL-3.0 许可。

依赖与引用

项目基于多个上游工作构建,包括 WiLoR、HaWoR、MoGe-2、GeoCalib、SAM 系列模型、MEMFOF、Open3D、HaMeR 和 Ultralytics。使用时应根据所用组件引用相应论文。

搜集汇总
数据集介绍
EgoInfinity 数据集图片
构建方式
EgoInfinity 数据集构建了一个从单目静态相机RGB视频中提取度量级4D手-物体交互数据的全自动流水线。该流水线整合了多个先进模型,包括使用MoGe-2估计度量深度与焦距,GeoCalib确定世界重力方向,WiLoR进行手部检测与MANO网格重建,以及SAM3.1实现文本提示的物体检测与追踪。随后,系统通过MEMFOF光流法、深度稳定化与对齐、平滑化等处理优化时序一致性,并利用HaWoR Transformer填补缺失帧的运动信息。最终,通过Open3D与FGR+ICP相结合的6自由度网格位姿追踪,输出每帧的21关节点手部姿态、MANO网格、物体6自由度位姿序列及重建的3D网格,所有结果以PKL格式存储,并支持交互式3D可视化。
特点
该数据集的核心特色在于其全自动、无标定的端到端处理能力,无需深度传感器或额外标定即可从单一RGB视频生成度量级手-物体交互数据。其流水线设计高度模块化,支持分阶段执行、断点续传与单阶段重跑,便于用户迭代优化追踪结果。同时,EgoInfinity具备跨数据集扩展性,可处理任意静态相机拍摄的RGB视频,并支持将恢复的手部运动重定向到多种机器人(如G1、Franka),实现从视频到机器人动作的迁移学习。数据集还集成了文本提示物体检测与3D重建功能,能够处理未见过的物体,显著提升了在真实世界场景中的泛化能力。
使用方法
使用EgoInfinity需先安装依赖环境,包括PyTorch、MoGe-2、GeoCalib及WiLoR等,并手动下载MANO模型权重。用户需准备一个包含帧图像文件夹与manifest.json(指定视频URI及物体列表)的片段目录,通过命令行`python -m egoinfinity process /path/to/clip_dir/`运行流水线。如需机器人重定向,可添加`--robot g1`参数。流水线支持多种运行模式,包括恢复执行、强制重跑特定阶段及批量处理多个片段,用户可通过`python -m egoinfinity run`命令灵活控制。所有处理结果存储在输出目录的artifacts文件夹中,并可通过Viser交互式3D查看器实时浏览。
背景与挑战
背景概述
EgoInfinity数据集由莱斯大学机器人感知与交互实验室(Rice-RobotPI-Lab)的Gaotian Wang、Kejia Ren、Kaiyu Hang等学者联合机器人与人工智能研究所(Robotics and AI Institute)的Andrew Morgan于2026年创建,旨在解决机器人学习领域中从互联网视频到具身动作迁移的瓶颈问题。该数据集通过创新性的4D手-物交互数据引擎,能够从单目静态相机RGB视频中自动提取度量级3D手部姿态、MANO网格模型、物体6DoF位姿序列及重建的3D网格,无需深度传感器或相机标定。其核心研究问题聚焦于如何利用海量互联网视频数据,实现任意视角下机器人动作重定向与视频到动作的端到端学习,为机器人操作技能的泛化提供了大规模、多模态的数据基础。该数据集的影响力体现在其Web-Scale的数据处理能力与全自动管线设计,显著降低了机器人学习对昂贵动作采集系统的依赖,推动了数据驱动型机器人操控研究的发展。
当前挑战
EgoInfinity所解决的核心领域挑战在于从非结构化的互联网视频中精确恢复度量级4D手-物交互信息,这涉及无标定单目视频中手部与物体的三维空间关系解耦、遮挡下的鲁棒跟踪以及跨视角一致性保持等难题。传统方法依赖多视角相机阵列或深度传感器,难以扩展到大规模互联网视频场景。在数据构建过程中,研究团队面临的主要挑战包括:1)处理静态相机拍摄中频发的严重手-物遮挡,需通过哈欠填补(HaWoR Transformer)与生物力学约束平滑算法解决缺失帧的运动推理问题;2)实现从单一RGB图像到高保真物体3D网格重建,需集成SAM3D与文本提示的物体检测管线,并在大尺度场景中平衡计算资源与精度;3)确保度量深度估计的全局一致性,通过多阶段后处理(深度对齐、尺度验证、虚假检测剔除)对抗单目深度估计的尺度模糊性。
常用场景
经典使用场景
EgoInfinity作为一个面向网络规模的4D手-物交互数据引擎,其最经典的使用场景在于从单目静态相机拍摄的RGB视频中,高精度地重建三维手部姿态、MANO网格模型、物体六自由度姿态及其三维网格,而无需深度传感器或预先标定。这一能力使其广泛应用于机器人领域的任意视角动作重定位与视频到动作的模仿学习,通过将人类日常交互行为转化为机器人可执行的轨迹序列,为机器人技能获取提供了海量、多变的训练素材,显著降低了数据采集的硬件门槛与人工标注成本。
衍生相关工作
EgoInfinity的构建催生了一系列经典的衍生工作,其中最具代表性的是其核心组件——WiLoR(用于高精度手部检测与MANO重建)、HaWoR(用于全局手部运动补全与时空连贯性优化)以及MoGe-2(提供度量深度估计),这些方法被广泛应用于后续的手-物交互研究。此外,其提出的自动化流水线框架启发了诸如基于Transformer的运动修复模块和六自由度网格跟踪算法,推动了无标定单目4D重建的技术边界。EgoInfinity本身也作为基准数据集,被频繁引用在手-物协同跟踪、机器人模仿学习等最新工作中,形成了围绕大规模数据引擎的活跃研究生态。
数据集最近研究
最新研究方向
在具身智能与机器人学习领域,从静态单目RGB视频中高效提取精确的4D手-物交互数据正成为前沿热点。EgoInfinity作为一个网络规模的4D手-物交互数据引擎,突破了传统方法对深度传感器和标定板的依赖,通过多阶段流水线融合单目深度估计、手部姿态重建与6DoF物体跟踪,首次实现了从互联网规模视频到任意视角机器人重定向的无缝数据生成。该研究紧密关联大规模视频理解与视频到动作(Video-to-Action)机器人学习的核心需求,通过提供跨视角、跨场景的高质量交互时序数据,显著降低了仿真与真实环境间的域差距。其发布的Action100M数据集与配套的重定向框架,为通用技能学习、人机协作以及数据驱动的机器人泛化研究奠定了坚实的数据基础,有望推动下一代自动化数据引擎在具身智能中的广泛落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务