遇见数据集

UnrealEgo

收藏
arXiv2022-08-03 更新2024-06-21 收录
官方服务:

资源简介:

UnrealEgo是由马克斯·普朗克信息学研究所和庆应大学创建的大规模自然主义数据集,专为第一人称3D人体姿态估计设计。该数据集基于先进的概念,即配备两个鱼眼摄像头的眼镜,可在不受限制的环境中使用。UnrealEgo包含45万张野外立体图像(总计90万张图像),拥有现有第一人称数据集中最大的动作种类。数据集创建过程中,使用Unreal Engine设计虚拟原型,并将其附加到3D人体模型上以进行立体视图捕捉。UnrealEgo的应用领域包括XR技术和运动与健康分析,旨在解决在不受限制的环境中捕捉日常人体活动的问题。

UnrealEgo is a large-scale naturalistic dataset developed by the Max Planck Institute for Informatics and Keio University, specifically tailored for first-person 3D human pose estimation. Built on an advanced concept of eyeglasses equipped with two fisheye cameras, this dataset supports deployment in unconstrained environments. UnrealEgo contains 450,000 stereo images captured in the wild, totaling 900,000 images overall, and features the most diverse set of action categories among existing first-person datasets. During the dataset construction phase, Unreal Engine was employed to design virtual prototypes, which were then attached to 3D human body models for stereo view capture. The application domains of UnrealEgo include XR technologies, motion and health analysis, and it aims to address the challenge of capturing daily human activities in unconstrained environments.

创建时间:
2022-08-03
搜集汇总
数据集介绍
UnrealEgo 数据集图片
构建方式
UnrealEgo数据集基于一种先进的眼镜式捕捉概念构建,该眼镜配备了两个对称安装于镜架上的鱼眼相机。研究团队利用虚幻引擎(Unreal Engine)合成设计了这一虚拟眼镜原型,并将其附着于17个高保真度的三维人体模型(源自RenderPeople)上。通过Mixamo动作库生成并人工修正了超过45,000个自然动作,涵盖30种运动类别,包括日常活动与复杂运动(如霹雳舞与后空翻)。这些人体模型被随机放置于14种逼真的室内外三维环境中(如公园、办公室、京都小巷等),并使用鱼眼渲染插件以每秒25帧的速度捕获立体图像,最终生成了450,000组立体视图(总计900,000张图像),每帧分辨率为1024×1024像素。
特点
UnrealEgo是首个提供野外(in-the-wild)立体图像的自我中心数据集,具有现有数据集中最丰富的运动多样性。其关键特点包括:1)运动类型广泛,涵盖从站立、跳跃到体育运动的30种类别,且头部与足部关键点分布范围显著大于现有数据集(如xR-EgoPose);2)环境真实感强,包含多种光照条件(天空光、点光源、方向光)并启用光线追踪或光栅化渲染,模拟了动态的三维场景变化;3)支持多人物场景,通过随机放置算法平均每次渲染约5个人体模型,模拟真实拥挤环境;4)提供完整的元数据,包括三维关节点位置、相机位姿及鱼眼视图中的二维重投影坐标,便于多任务评估。
使用方法
UnrealEgo的数据集划分为训练集(3821个动作,约357,317组立体视图)、验证集(494个动作)与测试集(526个动作)。使用方法上,研究者可基于提供的立体RGB图像与深度图,开发自我中心三维人体姿态估计算法。论文提出的基准方法采用两阶段架构:首先通过共享权重的编码器(如ResNet18)处理立体输入,生成二维热图;随后利用多分支自编码器将其映射为三维关节点坐标。训练时需将图像与热图分别调整为256×256与64×64像素,并使用均方误差与关节位置误差作为损失函数。数据集还支持时序建模与全局姿态评估,适用于扩展现实(XR)与运动分析等应用场景。
背景与挑战
背景概述
在自我中心三维人体姿态估计领域,现有数据集受限于运动类型单一、环境建模不真实以及缺乏立体视觉数据等问题,严重制约了算法在无约束场景下的泛化能力。为突破这一瓶颈,马克斯·普朗克信息学研究所与庆应义塾大学的研究人员于2022年联合发布了UnrealEgo数据集。该数据集基于一种创新的眼镜式双鱼眼相机概念,利用虚幻引擎合成17个高保真三维人体模型在14种室内外场景中的45,520种自然运动,生成了45万对立体图像(共计90万张)。UnrealEgo首次提供了包含街舞、后空翻等复杂动作的大规模野外立体视图,其运动多样性远超现有自我中心数据集,为三维人体姿态估计研究树立了新的基准。
当前挑战
UnrealEgo所解决的领域挑战在于自我中心三维人体姿态估计中运动多样性与环境真实性的缺失,现有方法在复杂动作(如弯腰、翻滚)和遮挡场景下精度显著下降。构建过程中面临的技术挑战包括:1)利用控制绑定工具手动修正Mixamo原始动作中的自我穿透和手臂扭曲等异常,并通过调整运动速度、头部旋转等参数增强数据多样性;2)设计随机放置算法在三维环境中生成多人交互场景,同时利用物理引擎检测碰撞以避免模型穿透;3)在14种不同光照条件下渲染图像,并针对支持光线追踪的环境启用该技术以提升视觉真实感,最终以每秒2帧的速度完成大规模渲染。
常用场景
经典使用场景
在自我中心三维人体姿态估计领域,UnrealEgo数据集凭借其独特的眼镜式双目鱼眼相机设置,成为评估和训练算法的标杆平台。该数据集通过虚幻引擎合成450k张野外立体图像,涵盖从日常站立、跳跃到街舞、后空翻等复杂动作,极大丰富了运动多样性。研究者可基于其提供的同步双目视图与精确三维关节标注,开发鲁棒的姿态估计模型,尤其适用于应对自遮挡、动态背景及剧烈运动下的深度模糊挑战。
衍生相关工作
UnrealEgo催生了多项创新性研究,包括基于双目特征融合的二维热图估计模块、端到端三维姿态回归框架,以及针对鱼眼畸变的自动校准网络。其提供的运动分类标注(30种动作类型)促进了细粒度动作识别研究,而多人物体渲染算法则推动了社交场景下多人姿态估计的发展。此外,该数据集作为基准,验证了权重共享编码器相比独立编码器在特征学习上的优越性,启发了后续轻量化网络设计的研究方向。
数据集最近研究
最新研究方向
在自我中心三维人体姿态估计领域,UnrealEgo数据集的出现标志着研究范式的重要转变。该数据集基于眼镜式双目鱼眼相机设计,在虚拟引擎中构建了包含45万张野外立体图像的大规模资源,涵盖了从日常活动到高难度运动(如霹雳舞、后空翻)的丰富动作类型,极大突破了现有数据集在运动多样性和环境真实性上的局限。其前沿研究方向聚焦于利用双目立体视觉与共享权重的二维关键点估计网络,通过特征融合与热图回归显著提升三维姿态预测的精度,较此前最优方法在MPJPE指标上降低了13.5%。这一工作不仅为增强现实、运动分析等热点应用提供了更鲁棒的解决方案,也推动了自我中心感知向无约束、全天候场景的演进,具有重要的学术影响与产业价值。
相关研究论文
  • 1
    UnrealEgo: A New Dataset for Robust Egocentric 3D Human Motion Capture马克斯·普朗克信息学研究所 · 2022年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务