遇见数据集

Diffusion4D-Animated-Raw

收藏
Hugging Face2026-07-01 更新2026-07-02 收录
官方服务:

资源简介:

Diffusion4D Animated Raw Assets是一个不断演进的、以元数据为先的3D动画资产镜像数据集,源自Diffusion4D/Objaverse-XL元数据。它专门收集被Diffusion4D/Objaverse-XL引用的动画3D资产,初始版本有意保持未过滤状态,保留了可能质量较低、语义不相关、技术无效、外观重复或难以导入的原始资产,旨在为研究人员提供完整的原始数据索引。数据内容包括原始3D动画资产文件(存储于assets/{format}/{asset_id}/{filename}路径)和可用的动画预览视频(存储于previews/glb/{preview_id}/preview.mp4),以Parquet格式提供分片数据表(data/train-*.parquet)、元数据快照(metadata/assets.parquet)和无损JSONL镜像(metadata/assets.jsonl)。元数据记录包含源URI、SHA-256哈希、源格式、下载状态、骨骼和动画统计信息、蒙皮和纹理标志、技术质量检查结果、预览路径以及视觉语言模型(VLM)注释占位符。数据集提供多种配置(如default、preview_sample、with_previews、video_sample和with_media),以增量方式上传,使用前需检查asset_available、preview_available和annotation_status字段。数据来源为Diffusion4D/Objaverse-XL元数据,资产来自多个上游存储库,许可证未统一规范化,用户需在重新分发或商业使用前检查上游许可证。未来计划包括添加四帧联系表、Qwen-VL对象和运动描述、语义类别等增强功能,适用于3D动画生成、运动合成、资产检索和多模态学习等研究任务。

Diffusion4D Animated Raw Assets is an evolving, metadata-first mirrored dataset of 3D animated assets derived from the Diffusion4D/Objaverse-XL metadata. It specifically collects animated 3D assets cited by Diffusion4D/Objaverse-XL. The initial release intentionally remains unfiltered, retaining raw assets that may be of low quality, semantically irrelevant, technically invalid, visually redundant, or difficult to import, with the goal of providing researchers with a complete raw data index. The dataset contents include raw 3D animated asset files (stored at the path assets/{format}/{asset_id}/{filename}) and usable animated preview videos (stored at previews/glb/{preview_id}/preview.mp4). It also provides sharded data tables in Parquet format (data/train-*.parquet), metadata snapshots (metadata/assets.parquet), and lossless JSONL mirrors (metadata/assets.jsonl). The metadata records include source URI, SHA-256 hash, source format, download status, skeletal and animation statistics, skinning and texture flags, technical quality inspection results, preview paths, and vision-language model (VLM) annotation placeholders. The dataset offers multiple configurations (e.g., default, preview_sample, with_previews, video_sample, and with_media), which are uploaded incrementally. Users should check the asset_available, preview_available, and annotation_status fields before using the dataset. The dataset is sourced from Diffusion4D/Objaverse-XL metadata, with assets originating from multiple upstream repositories. Licenses are not uniformly standardized, so users must verify upstream licenses before redistribution or commercial use. Future plans include adding enhanced features such as four-frame contact sheets, Qwen-VL object and motion descriptions, semantic categories, etc., making the dataset suitable for research tasks including 3D animation generation, motion synthesis, asset retrieval, and multimodal learning.

创建时间:
2026-06-29
原始信息汇总

数据集概览:Diffusion4D Animated Assets

基本信息

  • 数据集名称:Diffusion4D Animated Assets
  • 语言:英文
  • 标签:动画(animation)、3D(3d)、Objaverse(objaverse)、FBX(fbx)、GLB(glb)、glTF(gltf)、DAE(dae)
  • 配置:默认配置包含一个训练集(train),数据文件为 data/train-*.parquet

规模与格式

  • 默认训练集包含 67,988 行数据,每行包含:
    • 元数据(标识符、来源、文件格式、哈希值等)
    • 预览图片
    • 简短预览视频(可直接在 Hugging Face Data Studio 中浏览,无需下载原始 3D 文件)
    • 动画和骨骼统计信息(如可用)
    • 技术检测标记

内容说明

  • 数据集引用了 Diffusion4DObjaverse-XL 中的动画 3D 资产,以直接可浏览的格式提供。
  • 当前版本范围广泛,可能包含损坏、静态、重复或语义无关的资产。

策展进展

  • 目标:筛选出适合训练/评估运动与 3D 理解模型的高质量骨骼动画。
  • 正在使用 Qwen3-VL-30B-A3B-Instruct 对每个资产进行自动标注,基于来自动画的4帧采样。
  • 自动标注内容:
    • 宽泛语义类别和更具体的对象类别
    • 简短对象描述
    • 可见运动描述
    • 是否有意义动画及其强度
    • 视觉质量、可见缺陷和模型置信度
  • 标注为机器生成,非人工验证,失败或异常响应将在后续修复过程中处理。

计划发布的动画子集

  • 未来将发布一个独立的策展子集,包含动画动物、人形生物、机器人及其他关节角色
  • 子集选择将结合技术元数据、视觉检查和 Qwen 标注。
  • 计划为子集提供:
    • 多相机视角的渲染
    • 逐帧 DINO 视觉特征
    • 为 MocapAnything v2 等模型训练定制的数据排列

数据字段

  • 标识符与来源元数据
  • 文件格式与哈希值
  • 动画和骨骼统计信息(如可用)
  • 技术检测标记
  • 嵌入的预览媒体(图片和视频)
  • 后续将添加 Qwen 标注列

来源与许可

  • 记录和官方渲染来自 Diffusion4DObjaverse-XL
  • 原始资产来自多个上游仓库,没有统一的标准许可,原始来源 URL 保留。
  • 用户在使用前需自行检查每个上游资产的许可,数据集不重新许可第三方内容

引用与致谢

  • 使用数据集时需引用 Diffusion4DObjaverse-XL 原始项目。
  • 该仓库是一个独立的打包和策展工作
搜集汇总
数据集介绍
Diffusion4D-Animated-Raw 数据集图片
构建方式
Diffusion4D-Animated-Raw数据集由Diffusion4D与Objaverse-XL项目共同驱动构建,旨在以可直接浏览的格式呈现动画化三维资产。其默认分片包含67,988条记录,每条记录均融合了元数据、预览图像及短视频,使用户无需预先下载原始3D文件即可在Hugging Face Data Studio中进行初步审查。该数据集不仅镜像了可获取的原始资产,还保留了其原始来源链接与哈希值,确保了溯源的可信度。当前版本经过广泛收集,可能包含破损、静态、重复或语义无关的资产,这体现了其宽泛的构建策略。
特点
该数据集的核心特点在于其动态的、以动画为中心的设计理念。借助Qwen3-VL-30B-A3B-Instruct模型,团队从动画中采样四帧,为每个资产自动生成了丰富的语义标签,包括宽泛与具体的物体类别、简短描述、可见运动描述、动画的合理性及强度评估、视觉质量与缺陷标注。这些机器生成的标签虽未经过人工验证,但为大规模筛选高质量骨骼动画提供了有力支撑。此外,数据包含了文件格式、哈希值、动画与骨架统计、技术检查标志及嵌入式预览媒体,便于用户进行细致筛选与过滤。
使用方法
使用该数据集时,建议优先依据可用性(availability)与质量(quality)字段进行过滤,以确保选取的行对应有效且适合训练的三维资产。用户可直接通过Hugging Face Data Studio浏览预览图像与视频,快速评估资产质量。对于需要原始动画数据的任务,可下载原始3D文件并参考提供的源链接与哈希值进行验证。未来计划发布的精选子集将进一步提供多视角渲染、逐帧DINO视觉特征及适配MocapAnything v2等模型的数据格式,为动画与三维理解模型的研究者提供更便捷的数据接口。
背景与挑战
背景概述
在三维视觉与动画生成领域,动态三维内容的获取与建模一直是制约模型发展的关键瓶颈。2024年,依托Diffusion4D与Objaverse-XL两大项目,研究团队构建了Diffusion4D-Animated-Raw数据集,旨在为动画化三维资产的理解与生成提供大规模数据支撑。该数据集由多个机构联合开发,核心研究问题聚焦于如何系统性地收集、标注并筛选具备骨骼动画的高质量三维模型,以推动运动理解、三维重建与生成式模型的发展。其影响力体现在为后续如MocapAnything v2等模型提供了训练基准,并填补了动态三维数据集的空白。当前版本囊括67,988条资产记录,虽规模庞大但尚未经过精细清洗,意图通过自动化标注与人工筛选逐步提升数据质量。
当前挑战
该数据集面临多维度挑战。在领域问题层面,动态三维内容的语义理解与运动模式建模长期受限于数据稀缺,现有静态数据集无法满足动画化模型的训练需求,而动态资产的采集、对齐与标注尚未形成标准化流程。构建过程中的挑战更为突出:原始资产来源分散,涵盖FBX、GLB、GLTF等多种格式,且来自不同上游仓库,其许可协议各异,用户需自行核查版权合规性。此外,自动化标注环节依赖Qwen3-VL-30B-A3B-Instruct模型,从动画中稀疏采样四帧进行语义分类与运动描述,导致标签准确性有限,部分资产可能存在断裂、静态、重复或无意义动画等质量问题,亟需后续多轮修复与人工验证才能形成可可靠训练子集。
常用场景
经典使用场景
Diffusion4D-Animated-Raw数据集在三维动画与计算机视觉交叉领域中,核心用途在于为四维内容生成模型提供大规模、多样化的动态三维资产素材。研究者利用其包含的67,988条可浏览动画资源,通过预览图像与短视频高效筛选,以训练能够理解并生成连贯运动序列的扩散模型。该数据集直接服务于从静态三维建模向动态场景生成的演进,是推动四维感知与动画先验学习的基础性数据支柱。
解决学术问题
该数据集着力解决了三维动画研究中高质量、可标注的动态数据稀缺这一关键瓶颈。通过系统化汇聚Objaverse-XL等上游资源中的动画资产,并辅以Qwen3-VL大模型进行语义分类、运动描述与质量评估的自动标注,为无监督或弱监督条件下的运动理解、骨架动画生成和四维场景重建等学术任务提供了可量化评估的基准。其意义在于降低了获取大规模动态三维数据的门槛,促进了从静态物体识别向动态实体交互理解的学术范式转变。
衍生相关工作
围绕该数据集已衍生出一系列具有影响力的工作,其中最核心的便是Diffusion4D模型本身,它利用此类动态资产训练出能够生成连贯四维内容的扩散框架。此外,计划中基于该数据策划的动画子集,将直接支撑MocapAnything v2等运动捕捉与迁移模型的训练,推动无需复杂动捕设备的无标记点姿态估计技术。Qwen3-VL自动标注流程的引入,也启发了多模态大模型在三维数据质量评估与筛选中的新应用范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务