遇见数据集

EE4D-JSM

收藏
arXiv2026-09-01 更新2026-09-03 收录
数据链接:
官方服务:

资源简介:

EE4D-JSM是一个从EgoExo4D中精心整理的多模态数据集,旨在支持第一人称视频中场景与自身的联合三维重建。该数据集对齐了单目第一人称视频、稀疏度量场景几何、相机轨迹以及全身运动标注,为训练形如RESELF的统一框架提供监督信号。其创建过程涉及从EgoExo4D原始数据中提取并同步多种模态,确保时空一致性。EE4D-JSM主要用于解决第一人称视角下场景几何重建与穿戴者全身运动估计分离的难题,推动自盲与世界盲两大局限的联合突破。

EE4D-JSM is a meticulously curated multimodal dataset derived from EgoExo4D, aimed at supporting joint 3D reconstruction of the surrounding scene and the wearer in first-person videos. This dataset aligns monocular first-person videos, sparse metric scene geometry, camera trajectories, and full-body motion annotations, offering supervision signals for training unified frameworks such as RESELF. Its development process involves extracting and synchronizing various modalities from the raw EgoExo4D data to guarantee spatiotemporal consistency. EE4D-JSM is primarily utilized to solve the challenge of separated scene geometry reconstruction and wearer full-body motion estimation from first-person perspectives, promoting joint breakthroughs in the two core limitations of self-blindness and world-blindness.

创建时间:
2026-09-01
原始信息汇总

RESELF:从第一视角视频中重建场景与自我

数据集概述

RESELF(REconstructing the Scene and the sELF)是一个面向单目第一视角(egocentric)视频的联合度量重建框架,目标是在同一共享坐标框架下同时恢复场景几何、相机运动与穿戴者的全身运动。该方法突破了传统方案将场景重建与人体运动估计分离的局限,实现了两者的统一耦合。

核心方法

技术流程

输入单目第一视角视频后,该系统通过以下三个关键阶段完成重建任务:

  1. 度量几何(Metric Geometry):基于Pi3的几何主干网络预测度量尺度点图、相机姿态和场景感知的寄存器令牌,并采用帧级度量尺度与相对自我运动目标,适应快速头部运动和动态视频场景。

  2. 条件化运动生成(Conditioned Motion):恢复的相机轨迹用于锚定全局身体运动,同时场景感知的寄存器令牌作为条件,引导基于扩散模型的SMPL-X全身运动重建。

  3. 运动学反馈(Kinematic Feedback):采用冻结的运动先验,通过轨迹条件传递运动学监督,在闭环中优化相机跟踪精度。

评测数据集与交互

该项目在Ego-Exo4D数据集上构建了带有场景、相机与全身运动对齐监督的EE4D-JSM数据集。页面提供了**烹饪(Cooking)、篮球(Basketball)、足球(Soccer)、舞蹈(Dance)、钢琴(Piano)**五种场景的交互式演示,可同步查看预测结果与真实标注(三维点云可视化支持WebGL环境)。

主要结果

度量几何指标

指标 RESELF 第二优结果
ATE ↓ [mm] 217 263(Pi3X)
RPE旋转 ↓ [deg] 0.341 0.557(Pi3X)
绝对相对误差(Abs-Rel)↓ 0.141 0.147(Pi3X)

全身运动指标

指标 RESELF 第二优结果
MPJPE ↓ [mm] 109.8 116.1(UniEgoMotion)
PA-MPJPE ↓ [mm] 75.3 80.4(UniEgoMotion)
手部MPJPE ↓ [mm] 174.6 184.2(UniEgoMotion)

定性分析

  • 局部关节精度:在自行车序列中,基线方法UniEgoMotion出现错误的身体关节和脚-地不一致问题,而RESELF借助几何感知的场景上下文恢复了更合理的局部姿态。
  • 全局对齐精度:在烹饪序列中,UniEgoMotion虽然局部关节表现尚可,但存在显著的全局根节点漂移,RESELF能更好地保持根节点的位置与方向。

研究结论

RESELF在深度估计、相机跟踪和全身运动估计三项独立任务中均优于当前最先进的方法,验证了几何条件化运动合成与运动学反馈在联合重建中的互补作用。该项工作由香港理工大学和宁波东方理工研究院合作完成,相关论文以arXiv预印本形式发布(arXiv:2609.01276)。

搜集汇总
数据集介绍
EE4D-JSM 数据集图片
构建方式
EE4D-JSM数据集源自EgoExo4D,通过将EE4D-Motion精选的SMPL-X序列回溯至原始记录,检索对应的Project Aria SLAM点云,并校准同步第一视角视频、相机轨迹与全身运动注释。针对鱼眼RGB相机,应用时间戳校准将每帧矫正为448×448线性模型,场景点经同步相机位姿变换后投影生成稀疏深度图。依据经验阈值0.01%剔除几何质量低下的序列,最终保留16,807个训练序列和5,212个测试序列,覆盖18种活动与70余场景,确保多模态数据在统一度量框架下的精确对齐。
特点
EE4D-JSM的独特性在于首次为单目第一视角视频提供了场景几何、相机运动与全身运动的联合对齐监督,弥合了现有数据集仅聚焦单一任务的鸿沟。其场景点云源于Project Aria的SLAM重建,虽稀疏却具备真实度量尺度,与经由多视角拟合及时间平滑的SMPL-X全身运动注释精确同步。数据集规模宏大,涵盖丰富活动与场景多样性,并剔除了几何退化序列以保证质量。此设计使研究者能同时探索场景重建与运动估计的交互,为统一建模提供了坚实基础。
使用方法
EE4D-JSM适用于训练和评估联合场景与自我重建的模型。研究者可将其用于微调视觉几何基础模型以适应第一视角动态输入,通过帧级尺度与相对位姿一致性损失增强度量几何预测。同时支持训练条件扩散运动生成模型,以预测的相机轨迹与几何特征为条件恢复佩戴者全身动作。数据集亦提供基准测试,用于对比深度估计、相机跟踪及全身运动估计的性能。公开的预训练模型与基线设置可复现实验,推动该领域发展。
背景与挑战
背景概述
EE4D-JSM(Joint Scene and Motion)数据集由香港理工大学与宁波东方理工大学的研究团队于2026年创建,旨在解决第一视角视频中场景与穿戴者全身运动联合重建的难题。该数据集基于EgoExo4D构建,通过对齐第一视角视频、稀疏度量场景几何、相机轨迹及全身运动标注,提供了涵盖18种活动、超过70个场景的16,807个训练序列和5,212个测试序列。其核心研究问题在于克服现有方法在场景重建中忽略穿戴者(自盲)和运动估计中缺乏场景上下文(世界盲)的局限性,为统一的第一视角三维感知奠定基础。EE4D-JSM的发布填补了该领域缺乏对齐监督数据的空白,为场景与自身联合重建的研究提供了标准化基准,推动了具身智能的发展。
当前挑战
EE4D-JSM数据集面临的挑战主要源于其目标任务的复杂性和数据构建的难度。在领域问题层面,第一视角视频中场景与穿戴者存在视觉可见性不对称:场景大部分可观察,适合确定性几何重建,而穿戴者自身严重遮挡甚至完全出画,需要生成式运动推理,这种异构性对统一框架的设计提出了根本性挑战。此外,单目视频固有的尺度模糊和快速头部运动导致相机轨迹漂移,进一步加剧了场景几何与人体运动对齐的难度。在数据构建过程中,需要从EgoExo4D中精确匹配多视角SMPL-X序列与Project Aria SLAM点云,并处理鱼眼相机校正、时间戳同步及场景质量过滤等问题,特别是稀疏或不可用的点云数据需经过严格筛选以保证数据质量。
常用场景
经典使用场景
EE4D-JSM数据集作为首个聚焦于同步恢复第一视角视频中场景几何与穿戴者全身运动的数据集,为联合场景-自身重建任务提供了统一的评测基准。其经典使用场景在于评估单目视频中稀疏指标场景几何、相机轨迹与全身运动注释的对齐质量,从而支持自监督或监督学习框架下的三维感知研究。研究者可借助该数据集实现对环境与人体运动的同步理解,进而推动沉浸式交互、动作捕捉及自动驾驶等前沿领域的发展。
解决学术问题
该数据集解决了现有方法在处理第一人称视频时面临的‘自我缺失’与‘世界缺失’双重局限,突破了场景重建与运动估计各自为政的学术瓶颈。通过提供对齐的多模态标注,它使生成式运动推断得以显式地依赖场景几何,并让场景重建能利用运动学先验进行相机轨迹的细化,从而在统一的度量坐标系下实现场景与自身的联合重建。这一创新性资源为空域理解与行动感知的交叉研究提供了坚实基础。
衍生相关工作
围绕EE4D-JSM数据集,衍生出了一系列开创性研究工作,其中包括构建统一框架RESELF来耦合确定性几何重建与生成式运动推断,利用自适应几何基础模型和扩散模型实现场景与自身运动的高效恢复。该数据集还促成了对运动合成策略的深入探索,如闭合循环运动学反馈机制的引入,显著提升了相机轨迹的精度。这些衍生工作不仅丰富了该领域的研究范式,也为后续更多创新方法提供了借鉴与基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务