遇见数据集

Mobjaverse

收藏
arXiv2026-06-10 更新2026-06-12 收录
官方服务:

资源简介:

Mobjaverse是由清华大学等机构构建的大规模、结构多样化的运动数据集,旨在为学习拓扑无关的运动先验提供基础。该数据集包含超过5000种独特的骨骼拓扑结构和200万帧动画,其结构多样性超越了现有数据集两个数量级,数据源自Objaverse-XL并经过严格的运动学验证与语义过滤。数据集通过五阶段流水线精心构建,包括运动学树验证、运动标准化、基于视觉语言模型的语义过滤、人工验证以及纹理绑定,确保了数据的物理合理性与语义有效性。该数据集主要应用于通用动画生成研究,旨在解决传统运动捕捉方法因依赖特定物种模板而无法泛化至任意骨骼拓扑结构(如多足生物、无生命物体)的瓶颈问题,为零样本运动重定向提供关键的数据支撑。

Mobjaverse is a large-scale, structurally diverse motion dataset constructed by Tsinghua University and other institutions, aiming to lay a foundation for learning topology-agnostic motion priors. This dataset contains over 5,000 unique skeletal topologies and 2 million animation frames, with structural diversity two orders of magnitude higher than existing datasets. The data is sourced from Objaverse-XL and undergoes rigorous kinematic validation and semantic filtering. The dataset is meticulously constructed via a five-stage pipeline, including kinematic tree validation, motion normalization, visual-language-model-based semantic filtering, manual verification, and texture binding, ensuring the physical plausibility and semantic validity of the data. This dataset is primarily applied to general animation generation research, aiming to address the bottleneck problem where traditional motion capture methods, due to their reliance on specific species templates, cannot generalize to arbitrary skeletal topologies (e.g., multi-legged creatures, inanimate objects), providing critical data support for zero-shot motion retargeting.

创建时间:
2026-06-10
原始信息汇总

Mobjaverse 数据集概述

基本信息

  • 名称: Mobjaverse: A Large-Scale Rigged 3D Model Dataset with Skeletal Animations
  • 来源: 基于 Objaverse-XL 筛选得到
  • 用途: 骨骼动画理解、运动生成、铰接式3D形状分析
  • 规模:
    • 总模型数: 18,914
    • 骨骼拓扑结构: 5,006 种不同的骨架结构
    • 总运动帧数: 2,010,447
  • 数据格式: NumPy .npz 压缩包

数据存储结构

每个模型存储在 mobjaverse/{model_id}/raw_data.npz 路径下,包含以下数据:

网格数据

字段 形状 描述
vertices (N, 3) 合并后的网格顶点(编辑/静止姿态)
faces (F, 3) 三角形面索引
mesh_names (P,) 各网格部件名称

骨骼数据

字段 形状 描述
joint_names (J,) 骨骼关节名称
parents (J,) 父关节索引(根关节为-1)
matrix_local (J, 4, 4) 每个关节的局部静止姿态变换矩阵(Blender惯例)
matrix_basis (T, J, 4, 4) 每帧关节动画变换矩阵(T帧,J个关节)

蒙皮与外观数据

字段 形状 描述
skin (N, J) 线性混合蒙皮(LBS)权重
uvs (U, 2) UV纹理坐标
texture (H, W, 3) 漫反射纹理贴图(通常512×512)
texture_slot (U,) 每个UV坐标对应的纹理槽分配

数据集划分

  • 训练集: 存放于 datalist/train/ 目录,包含8个类别文件(每个类别对应一个 .txt 文件)
    • biped_128.txt(双足)
    • quadruped_128.txt(四足)
    • aquatic_128.txt(水生)
    • avian_128.txt(鸟类)
    • hexapod_128.txt(六足)
    • octopod_128.txt(八足)
    • serpentine_128.txt(蛇形)
    • others_128.txt(其他)
  • 验证集: 存放于 datalist/validate/ 目录,包含16个文件(8个类别 × 可见/不可见两个版本)

目录结构

Mobjaverse/ ├── README.md ├── requirements.txt ├── render.py ├── export.py ├── datalist/ │ ├── train/ │ └── validate/ ├── mobjaverse/ │ ├── 000001/ │ │ └── raw_data.npz │ ├── 000002/ │ │ └── raw_data.npz │ └── ... └── src/ └── ...

依赖环境

  • Python: 3.11
  • 核心依赖: numpy==2.2.6, bpy==4.2, trimesh, pyrender, imageio[ffmpeg]

相关资源

  • 论文: TopoCap(ACM Transactions on Graphics, SIGGRAPH 2026)
  • 基础数据集: Objaverse-XL(ODC-By v1.0 许可证)
搜集汇总
数据集介绍
Mobjaverse 数据集图片
构建方式
Mobjaverse数据集是从大规模开源3D资产库Objaverse-XL中经由严格的五阶段筛选流程构建而成。首先,通过运动学树验证,保留关节数量介于2至128之间且具有有效层级结构的骨架。其次,进行运动标准化处理,统一全局尺度并剔除冗余节点与零权重叶节点,同时合并时间上静止的帧。随后,借助视觉语言模型GPT-5.2对渲染视图进行语义判别,过滤掉缺乏动态意义的样本。进一步,由领域专家进行人工核查,移除存在严重蒙皮错误或拓扑不合理的资产。最后,利用Tripo3.0为缺失或低质量纹理的资产补充外观细节,从而增强视觉多样性。这一流水线最终产出了包含超过5000种独特骨架拓扑与200万帧动画的大规模运动数据集。
特点
Mobjaverse的核心特点在于其前所未有的拓扑多样性,其骨架结构种类超过现有动物运动数据集两个数量级。数据涵盖了从双足、四足到六足、八足乃至蛇形与水生生物等多种形态,并包含了非生物的铰接物体如家具与机器人。这种连续且广泛的形态谱系使得Mobjaverse成为学习拓扑无关运动先验的理想基石。尤为关键的是,数据集中存在着大量非标准运动链的长尾分布,为模型解耦运动动力学与骨架结构提供了丰富的训练信号。所有骨架均经过标准化处理,并配有统一的表示格式,确保了跨拓扑研究的可复现性与公平比较。
使用方法
Mobjaverse数据集主要用于训练和评估拓扑无关的运动捕捉与重定向模型。研究人员可将其与TopoCap框架结合使用,首先利用数据中的多样化骨架与运动序列训练图条件变分自编码器,以学习一个通用的运动流形。随后,通过条件流匹配模型,将视频特征与该流形对齐,实现从单目视频到任意骨架的零样本动画生成。数据集以标准的运动数据格式提供,包含骨架层级、局部旋转与弹性偏移参数,并附有渲染视频用于视觉条件训练。使用者可通过Hugging Face平台直接下载,并参照TopoCap的论文配置训练与测试流程,适用于通用3D动画与运动先验学习等研究场景。
背景与挑战
背景概述
随着生成式三维资产创作的蓬勃发展,对高效、普适的动画化技术的需求日益迫切。传统的运动捕捉方法,如依赖SMPL等参数化模板,在应对从奇幻生物到可动家具等形态各异的“长尾”三维内容时,显得捉襟见肘。为此,清华大学等机构的研究人员于2026年提出了Mobjaverse数据集。该数据集由Cheng-Feng Pu、Jia-Peng Zhang等人创建,旨在破解运动与骨骼拓扑结构之间的刚性耦合这一核心难题。Mobjaverse从Objaverse-XL中精心筛选,构建了包含超过5,000种独特骨骼拓扑结构和200万帧动画的庞大规模库,其结构多样性远超现有数据集两个数量级,为学习拓扑无关的通用运动先验奠定了坚实基础,有力推动了通用化三维动画领域的发展。
当前挑战
Mobjaverse数据集旨在解决的核心挑战在于,如何从单目视频中提取运动并泛化至任意且未见过的骨骼拓扑结构。传统方法受限于物种特定的参数化模板,无法应对形态各异的虚拟角色。该数据集构建过程中面临的挑战同样严峻:原始网络资产常存在层级结构错乱、关节退化或运动无意义等问题。为此,研究团队设计了包含五阶段过滤的严格管线,涉及运动学树验证、运动标准化、基于视觉语言模型的语义筛选以及专家人工核查,以剔除数以千计的退化样本。此外,还需解决异构运动数据在固定长度潜在空间中的统一编码问题,使模型能够将运动动力学与骨骼拓扑结构解耦,最终实现零样本的运动重定向与提取。
常用场景
经典使用场景
在计算机图形学与动画研究的浩瀚领域中,Mobjaverse数据集的核心使命在于为拓扑无关的运动先验学习提供海量且结构多样的训练素材。其最经典的使用场景是作为TopoCap框架的关键数据基石,用于训练能够从单目视频中提取运动并重定向至任意未知骨架拓扑的通用运动流形。该数据集汇聚了超过五千种独特的骨架拓扑结构与两百万帧动画序列,其拓扑多样性相较于现有动物运动数据集提升了两个数量级,这种前所未有的结构覆盖范围使得模型能够学习到跨越双足、四足、六足乃至飞行生物等不同形态的共享动力学表示,从而在零样本条件下实现对各类生成式3D资产的自动化动画驱动。
解决学术问题
Mobjaverse的诞生深刻回应了三维运动捕捉与分析领域长期悬而未决的结构壁垒困境。传统方法如SMPL或SMAL等参数化模板虽在人类与四足动物等特定物种上表现出色,却固守于固定的骨架假设,面对游戏、影视及虚拟现实中涌现的奇幻生物、可动家具等长尾3D内容时,往往因缺乏预设模板而全然失效。该数据集通过提供大规模、多种类的可动骨架与对应动画序列,首次让学界得以系统性地研究如何从视觉特征中解耦运动动力学与骨架拓扑结构,使得构建通用的运动先验模型成为可能。其发布不仅推动了拓扑无关运动生成的理论发展,更在根本上改变了数据驱动的运动重定向研究格局,为构建无需测试时优化的通用动画理解模型奠定了坚实的数据基础。
衍生相关工作
自Mobjaverse数据集发布以来,围绕其所构建的拓扑无关运动表征体系催生了多项重要的学术衍生工作。首当其冲的是TopoCap框架本身,它以图条件变分自编码器(Graph CVAE)与潜空间流匹配为核心,实现了对异构运动结构的高效压缩与生成。在此基础之上,研究者们进一步探索了诸如AnyTop等利用扩散模型处理任意拓扑角色动画的方法,推动了运动生成模型从特定物种向通用范式的跨越。同时,MoCapAnything等项目基于类似的数据理念,尝试将视频驱动的运动捕捉能力拓展至更为宽泛的骨架形态,这些工作共同指向了一个共同的研究趋势:即摆脱固定模板的束缚,迈向真正意义上的通用运动理解与合成,而Mobjaverse作为这一变革进程中的数据里程碑,持续激励着学界和工业界在数字人及数字生物动画领域的创新探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务