EE4D-JSM
收藏资源简介:
EE4D-JSM是一个从EgoExo4D中精心整理的多模态数据集,旨在支持第一人称视频中场景与自身的联合三维重建。该数据集对齐了单目第一人称视频、稀疏度量场景几何、相机轨迹以及全身运动标注,为训练形如RESELF的统一框架提供监督信号。其创建过程涉及从EgoExo4D原始数据中提取并同步多种模态,确保时空一致性。EE4D-JSM主要用于解决第一人称视角下场景几何重建与穿戴者全身运动估计分离的难题,推动自盲与世界盲两大局限的联合突破。
EE4D-JSM is a meticulously curated multimodal dataset derived from EgoExo4D, aimed at supporting joint 3D reconstruction of the surrounding scene and the wearer in first-person videos. This dataset aligns monocular first-person videos, sparse metric scene geometry, camera trajectories, and full-body motion annotations, offering supervision signals for training unified frameworks such as RESELF. Its development process involves extracting and synchronizing various modalities from the raw EgoExo4D data to guarantee spatiotemporal consistency. EE4D-JSM is primarily utilized to solve the challenge of separated scene geometry reconstruction and wearer full-body motion estimation from first-person perspectives, promoting joint breakthroughs in the two core limitations of self-blindness and world-blindness.
RESELF:从第一视角视频中重建场景与自我
数据集概述
RESELF(REconstructing the Scene and the sELF)是一个面向单目第一视角(egocentric)视频的联合度量重建框架,目标是在同一共享坐标框架下同时恢复场景几何、相机运动与穿戴者的全身运动。该方法突破了传统方案将场景重建与人体运动估计分离的局限,实现了两者的统一耦合。
核心方法
技术流程
输入单目第一视角视频后,该系统通过以下三个关键阶段完成重建任务:
-
度量几何(Metric Geometry):基于Pi3的几何主干网络预测度量尺度点图、相机姿态和场景感知的寄存器令牌,并采用帧级度量尺度与相对自我运动目标,适应快速头部运动和动态视频场景。
-
条件化运动生成(Conditioned Motion):恢复的相机轨迹用于锚定全局身体运动,同时场景感知的寄存器令牌作为条件,引导基于扩散模型的SMPL-X全身运动重建。
-
运动学反馈(Kinematic Feedback):采用冻结的运动先验,通过轨迹条件传递运动学监督,在闭环中优化相机跟踪精度。
评测数据集与交互
该项目在Ego-Exo4D数据集上构建了带有场景、相机与全身运动对齐监督的EE4D-JSM数据集。页面提供了**烹饪(Cooking)、篮球(Basketball)、足球(Soccer)、舞蹈(Dance)、钢琴(Piano)**五种场景的交互式演示,可同步查看预测结果与真实标注(三维点云可视化支持WebGL环境)。
主要结果
度量几何指标
| 指标 | RESELF | 第二优结果 |
|---|---|---|
| ATE ↓ [mm] | 217 | 263(Pi3X) |
| RPE旋转 ↓ [deg] | 0.341 | 0.557(Pi3X) |
| 绝对相对误差(Abs-Rel)↓ | 0.141 | 0.147(Pi3X) |
全身运动指标
| 指标 | RESELF | 第二优结果 |
|---|---|---|
| MPJPE ↓ [mm] | 109.8 | 116.1(UniEgoMotion) |
| PA-MPJPE ↓ [mm] | 75.3 | 80.4(UniEgoMotion) |
| 手部MPJPE ↓ [mm] | 174.6 | 184.2(UniEgoMotion) |
定性分析
- 局部关节精度:在自行车序列中,基线方法UniEgoMotion出现错误的身体关节和脚-地不一致问题,而RESELF借助几何感知的场景上下文恢复了更合理的局部姿态。
- 全局对齐精度:在烹饪序列中,UniEgoMotion虽然局部关节表现尚可,但存在显著的全局根节点漂移,RESELF能更好地保持根节点的位置与方向。
研究结论
RESELF在深度估计、相机跟踪和全身运动估计三项独立任务中均优于当前最先进的方法,验证了几何条件化运动合成与运动学反馈在联合重建中的互补作用。该项工作由香港理工大学和宁波东方理工研究院合作完成,相关论文以arXiv预印本形式发布(arXiv:2609.01276)。





