遇见数据集

Objaverse-XL-Rigged-Animated-Renders

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

Objaverse-XL Rigged & Animated — Renders 是 Objaverse-XL Rigged & Animated 数据集的视觉渲染伴侣,后者包含 7,373 个带骨架和动画的 GLB 资产。本数据集仅包含从这些资产渲染得到的多视角视频和静态姿势网格,用于预览动画、视觉语言模型字幕以及评估骨架资产。数据集包含两部分:glb_render/:10,355 个文件夹,每个对应一个动画剪辑,内含四个视角的 MP4 视频(前、后、左、右)及对应的 JSON 相机参数文件。视频分辨率 512×512,帧率 30 fps,渲染自 Blender EEVEE,覆盖每个剪辑的前 200 帧(约 6.7 秒),较长剪辑被截断。JSON 文件包含 NeRF 约定的相机参数。tpose/:7,373 个 PNG 文件,每个资产一个 1024×1024 的 2×2 网格,展示资产的静态姿势(前、后、左、右视图),用于在导入前评估资产体型。数据规模:MP4 文件共 41,420 个(2.2 GB),PNG 文件 7,373 个。渲染帧数:每视图 957,818 帧(约 8.9 小时),四个视图总计 3,831,272 帧。文件夹名称与资产仓库中的 stems 一致,便于关联元数据。许可:每个渲染继承上游资产的原许可,需通过 Objaverse-XL 注释查询具体许可。引用:该数据集是 UniML3D 训练语料的一部分,相关论文为 UniMate: One Unified Model to Animate Diverse Skeletons(SIGGRAPH Asia 2026)。

Objaverse-XL Rigged & Animated — Renders is the visual rendering companion to the Objaverse-XL Rigged & Animated dataset, which contains 7,373 rigged and animated GLB assets. This dataset contains only multi-view videos and static pose grids rendered from these assets, used for previewing animations, vision-language model captioning, and evaluating skeleton assets. It consists of two parts: glb_render/ (10,355 folders, each containing MP4 videos from four viewpoints (front, back, left, right) and corresponding JSON camera parameter files; video resolution 512x512, 30 fps, rendered with Blender EEVEE, covering the first 200 frames of each clip, longer clips truncated; JSON files follow NeRF camera conventions) and tpose/ (7,373 PNG files, each a 1024x1024 2x2 grid showing the assets static pose from four views, for evaluating body shape before import). Data size: 41,420 MP4 files (2.2 GB), 7,373 PNG files. Rendered frames: 957,818 per view (~8.9 hours), total 3,831,272 frames across four views. Folder names match asset stems in the repository for metadata linking. License: Each render inherits the original license of the upstream asset; refer to Objaverse-XL annotations for specific licenses. Citation: This dataset is part of the UniML3D training corpus, with the related paper UniMate: One Unified Model to Animate Diverse Skeletons (SIGGRAPH Asia 2026).

创建时间:
2026-09-01
原始信息汇总

Objaverse-XL Rigged & Animated — Renders 数据集详情

数据集简介

该数据集是 Linzhan/Objaverse-XL-Rigged-Animated 的可视化配套数据集,不包含原始3D资产生成文件,而是专注于预览运动辅助VLM生成描述以及快速检查绑定效果。该数据集为每个动画片段提供四视角视频渲染,并为每个资产生成静止姿态(rest-pose)网格图。

规模与规格

内容 数量
渲染片段目录 10,355个文件夹 · 41,420个MP4 (2.2GB)
静止姿态网格 7,373张PNG
渲染总帧数 每视角 957,818 帧(约8.9小时),四视角合计 3,831,272 帧
分辨率/帧率 512×512 · 30 fps

内容结构

glb_render/ 10,355个目录 每个骨架驱动片段的四视角视频渲染 tpose/ 7,373个.png 每个资产生成文件的静止姿态渲染网格

  • 命名规则与资产仓库严格一致,可直接与其中的 metadata.csv / animations.csv 关联。

渲染详情

视频渲染(glb_render/

  • 覆盖所有驱动骨架且至少运行5帧的动画片段,共10,355个(资产仓库animations.csv中16,190行中的一部分,其余仅驱动非关节节点或片段过短)。
  • 每个片段一个文件夹,命名格式为 {glb stem}-{action},内含四个视角的MP4文件(前、后、左、右)。
  • 使用Blender EEVEE引擎渲染,512×512分辨率,30 fps,水平仰角0°,H.264编码,透明帧平整至浅灰色背景。
  • 渲染覆盖片段前200帧(约6.7秒);2,150个超过此长度的片段会被截断,JSON文件中的frame_start/frame_end记录实际覆盖范围。
  • 每个视角配有一个JSON文件,包含NeRF约定的相机参数(方位角/仰角、分辨率、水平视场角、4×4相机到世界变换矩阵等)以及场景归一化参数。

静止姿态网格(tpose/

  • tpose/<stem>.png 为 1024×1024 的2×2网格图,从GLB中渲染资产静止姿态的前、后、左、右视图。
  • 曾存放于资产仓库,后迁移至此,便于无需导入即可对资产的骨架类型进行分类。

使用方法

可通过 huggingface_hubsnapshot_download 按需下载特定文件,例如仅下载静止姿态网格或单独片段的四视角视频。

应用场景

渲染结果用于 UniMate/data_process 开放流程中的描述生成与骨架分类阶段,该流程将配套资产生成仓库转化为处理后的运动数据集 UniML3D

许可与版权

  • 渲染内容描绘第三方资产,无统一许可证覆盖,每个渲染继承被展示资产的原始上游许可。
  • 使用或再分发前需通过Objaverse-XL注释查询对应object_id的许可信息,完整声明与移除流程详见资产仓库中的 NOTICE.md
  • 权利持有人可通过任一仓库提交问题以请求移除资产。

引用

该数据集是 UniML3D 训练语料库的一部分,来源论文为 UniMate: One Unified Model to Animate Diverse Skeletons(SIGGRAPH Asia 2026),引用详情见数据集页面提供的BibTeX条目。

搜集汇总
数据集介绍
Objaverse-XL-Rigged-Animated-Renders 数据集图片
构建方式
鉴于三维动画资产在训练与预览环节对视觉参考的迫切需求,Objaverse-XL-Rigged-Animated-Renders 数据集作为 Linzhan/Objaverse-XL-Rigged-Animated 的视觉伴生资源,被精心构筑而成。该数据集的构建过程依托 Blender EEVEE 渲染引擎,将 7,373 个经过骨骼绑定与动画处理的 GLB 资产,逐帧渲染为分辨率为 512×512、帧率为 30 fps 的四视角视频(前、后、左、右),每一动画片段皆被完整捕获,共生成 10,355 个片段文件夹,内含 41,420 个 H.264 编码的 MP4 文件。此外,每个资产还附带一张 1024×1024 的静止姿态栅格图,以 2×2 网格形式呈现前、后、左、右四个视角的渲染结果,便于快速审视资产体态。渲染过程覆盖动画片段的前 200 帧,对于超出此长度的片段,通过 JSON 文件准确记录实际覆盖的帧范围。所有文件命名与资产仓库严格对应,确保无缝对接。
特点
该数据集的核心特色在于其规模宏大且结构精巧,专为三维运动预览与视觉语言模型标注而优化。其拥有超过 1 万个动画片段的四视角视频,总计渲染帧数高达 383 万余帧,提供了丰富且连贯的动态视觉信息。每段视频均附带详尽的 NeRF 格式相机参数 JSON,涵盖视角、方位角、俯仰角、水平视场角及相机到世界的变换矩阵等,为精确的相机位姿恢复与三维重建奠定基础。同时,静止姿态栅格图集独立存放,便于对资产体态进行快速分类与筛选,而无需导入繁重的三维模型。该数据集与资产仓库分离存储,精简了资产库的体量,并使渲染数据能够独立应用于视频描述生成、运动质感评估等下游任务。
使用方法
该数据集的使用极为便捷,用户可通过 Hugging Face Hub 的 snapshot_download 函数,按需精准下载所需数据子集。若仅需获取所有资产的静止姿态栅格图,可利用 allow_patterns 参数指定 'tpose/*' 模式;若需单独下载某个动画片段的四视角视频,则可指定对应的 'glb_render/{glb_stem}-{action}/*' 路径模式,实现高效的数据获取。此外,用户可利用 FFmpeg 工具从 MP4 视频中提取单帧 PNG 图像,满足特定静态帧需求。该数据集的渲染结果已直接集成于 UniMate 开源数据处理管线中,作为三维资产生成运动描述与体态分类的关键视觉输入,促进了后续 UniML3D 运动数据集的构建。使用时需注意,渲染内容继承各自上游资产的原始许可,商业或再分发前须逐一核查 Objaverse-XL 的标注信息。
背景与挑战
背景概述
Objaverse-XL-Rigged-Animated-Renders数据集由Linzhan Mou等人于2026年构建,作为UniML3D训练语料库的可视化伴侣,旨在解决三维动画领域中缺乏大规模、高质量、可驱动骨架的动画资产及其多视角渲染的难题。该数据集源自Objaverse-XL,筛选出7,373个具有骨骼绑定和动画的GLB资源,并通过Blender EEVEE引擎生成涵盖四视角的10,355个动画片段渲染、41,420个MP4视频及7,373个静态姿态网格图,总计约383万帧图像。这些渲染数据支撑了视觉语言模型的字幕生成和体型分类,为文本到三维动画生成、多视角视频理解及骨骼运动分析等下游任务提供了关键基准。作为SIGGRAPH Asia 2026论文UniMate的组成部分,该数据集填补了现有三维资源库在动画运动预览与大规模处理流程间的空白,对推动统一骨骼动画模型的发展具有重要影响。
当前挑战
该数据集所应对的核心挑战源自三维动画领域的多重复杂性。在领域层面,文本到三维动画生成需同时理解语义、几何与运动控制,现有资源多关注静态模型或简单形变,缺乏对骨架驱动动画的精细捕捉和标准化描述,难以支持跨物种、跨结构的运动泛化。构建过程中面临的挑战尤为严峻:原始Objaverse-XL资源质量参差不齐,需设计严格筛选策略剔除无效或过短动画,最终仅保留10,355个可用片段(占全部动画行的64%);渲染环节须平衡视觉保真与数据规模,采用H.264压缩导致透明度信息丢失,不得不以浅灰背景替代,且因文件体积庞大将渲染和资产分离存储,并需通过每视角JSON记录相机参数(如NeRF约定的变换矩阵和视场角)确保三维一致性。此外,许可授权利于第三方原始资产,每帧渲染继承上游许可,要求使用者逐项溯源,增加了数据合规的复杂度,而部分长动画被截断至前200帧也引入了时间完整性折衷。
常用场景
经典使用场景
该数据集作为Objaverse-XL中带骨骼绑定与动画资产的视觉伴生资源,为三维物体动画研究提供了大规模、标准化的多视角视频渲染库。其核心用途在于支撑文本到三维生成、骨骼动画理解及多视角一致性学习等任务,研究者可借助四视角视频与静止姿态网格,对动画序列进行高效预览、视觉语言模型标注及骨骼配置分析,从而在无需加载原始三维模型的情况下开展大规模数据筛选与预处理工作。
衍生相关工作
该数据集作为UniMate体系的核心组成部分,衍生并推动了多项相关研究方向。其支撑了UniML3D等大规模动画训练语料的构建,进而催化了面向异构骨骼的统一动作合成模型、跨类别动作迁移算法等后续探索。这些工作依托该数据集提供的标准化渲染与标注资源,在提升动画生成泛化能力的同时,也为三维视觉与图形学交叉领域的基准评测与模型对比奠定了数据基础。
数据集最近研究
最新研究方向
在三维重建与生成模型迅猛演进的当下,Objaverse-XL-Rigged-Animated-Renders数据集以其大规模、多视角、骨骼动画的渲染视频为特色,成为连接静态三维资产与动态运动合成研究的桥梁。其核心价值在于为文本到三维生成、视觉语言模型(VLM)自动描述以及基于视频的运动理解提供高质量的视觉先验。最新研究趋势聚焦于利用该数据集训练可泛化的动画生成模型,通过对数万段覆盖多样骨骼结构的四视角动作片段进行学习,驱动模型掌握从静态形状到复杂动态的映射能力。同时,数据集提供的统一相机参数与姿态网格,为多视角一致性学习、神经渲染及三维运动重建等热点方向提供了规范化的训练与评测基准,其与UniMate等统一骨架动画模型的开源管线紧密结合,预示着未来三维内容创作将迈向自动化、动态化和跨类别迁移的新纪元。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务