遇见数据集

3d-wm-atomic-v3

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

3D-WM Atomic — v3(批次b07–b14)是一个合成的CAD构造视频数据集,每帧都配有原子操作动作,专门用于训练视频到动作(逆动力学)以及图像到视频的世界模型。该数据集是v2版本(批次b01–b06)的扩展,保持了相同的格式和约定。数据集采用v2-continuous-mm格式,包含原始的浮点毫米操作参数(未量化),每个视频片段都经过平移规范化处理,使得最终网格的边界框位于世界坐标系原点。每个片段包括一系列256×256像素的构造动画帧(PNG格式)、记录尺度、相机参数、规范化信息及每帧操作跨度的meta.json文件,以及存储原子操作元组(原始毫米浮点数)和人类可读操作描述的ops.json文件。每个案例提供5个不同的视角(等距、前、侧、顶和随机),这些视角共享相同的自动拟合尺度锚点,仅相机角度存在差异。数据生成阶段实施了严格的质量控制,确保几何有效性和视觉可见性,过滤无效或自相交实体以及接近空白的案例。数据集规模约为每批次8000个案例,共8个批次,每个案例5个视角,总计约30万个视频片段。

3D-WM Atomic — v3 (batches b07–b14) is a synthetic CAD construction video dataset paired with atomic operation actions for each frame, specifically designed for training video-to-action (inverse dynamics) and image-to-video world models. This dataset is an extension of the v2 release (batches b01–b06), retaining the same format and conventions. Adopting the v2-continuous-mm format, the dataset contains raw floating-point millimeter-scale operation parameters (unquantized). Each video clip undergoes translation normalization to align the bounding box of the final mesh with the origin of the world coordinate system. Each clip includes a sequence of 256×256 pixel construction animation frames in PNG format, a meta.json file that records scale, camera parameters, normalization information, and per-frame operation spans, as well as an ops.json file that stores atomic operation tuples (raw floating-point millimeter values) and human-readable operation descriptions. Each case provides 5 distinct viewpoints (isometric, front, side, top, and random), which share the same auto-fitted scale anchor with only differences in camera angles. Strict quality control was implemented during the data generation phase to ensure geometric validity and visual visibility, filtering out invalid or self-intersecting entities as well as nearly blank cases. The dataset has approximately 8,000 cases per batch, totaling 8 batches, with 5 viewpoints per case, amounting to around 300,000 video clips in total.

创建时间:
2026-06-01
原始信息汇总

数据集概述:3D-WM Atomic — v3

  • 数据集名称:3D-WM Atomic v3(批次 b07–b14)
  • 用途:用于训练视频→动作(逆动力学)和图像→视频世界模型的合成CAD构建视频,每帧配有原子动作操作。
  • 版本说明:v3 在 v2(批次 b01–b06)基础上扩展了 b07–b14,格式和约定与 v2 相同。

数据格式(v2-continuous-mm)

  • 参数类型:原始浮点毫米操作参数,未量化。
  • 规范化:每个片段经过平移规范化,使得最终网格边界框中心位于世界原点。
  • 完整模式:原子操作词汇表、缩放/相机元数据等详细说明见配套文档 dataset_spec.md

数据布局

  • 存储结构

    • 每个源批次一个前缀目录(data_hula_b07data_hula_b14)。
    • 每个批次索引下包含 b0000 ... bNNNN/train/shard-*.tar 的 tar 分片,每个分片约包含25个片段,每批次索引约10个分片。
  • 每个片段(一个 case, view 组合)包含

    • 0000.png ... NNNN.png:逐操作构建动画帧(分辨率256×256)。
    • meta.json:缩放、相机、规范化信息及每帧的操作跨度(op_spans)。
    • ops.json:原子操作元组(原始毫米浮点数)及可读操作描述(ops_human)。
  • 多视角:每个 case 有5个视角(等轴测/正面/侧面/顶部/随机),共享相同的自动适配缩放锚点(world_diag_mm / approx_mm_per_pixel),仅相机角度不同。

质量控制(生成时)

  • 几何有效性:使用 OCC BRepCheck 检查,无效或自相交的实体被丢弃。
  • 非空白过滤:在所有视角下渲染为近空白的 case(有效但极小的实体)被丢弃。
  • 结果:每个发布的片段都是有效且可见非空白的实体。

规模

  • 约8000 cases/批次 × 8 批次 × 5 视角 ≈ 30万个片段
搜集汇总
数据集介绍
3d-wm-atomic-v3 数据集图片
构建方式
3D-WM Atomic v3 数据集是基于合成计算机辅助设计(CAD)构建视频与逐帧原子操作动作标签的配对数据,旨在服务于视频到动作的逆动力学建模以及图像到视频的世界模型训练。该数据集在 v2 版本(批次 b01–b06)的基础上扩展了 b07–b14 八个批次,总计约 8000 个案例每批次,每个案例包含五种视角(等轴、正面、侧面、顶部及随机视角),最终生成约 30 万个剪辑片段。构建过程中,数据采用原始浮点毫米级操作参数(未经量化),并对每个剪辑进行平移归一化处理,使得最终网格的包围盒中心位于世界坐标系原点。每个案例的五种视角共享一个自动适配的比例锚点,即统一的 world_diag_mm 与 approx_mm_per_pixel 值,仅相机角度存在差异,从而保证了多视角下尺度的一致性。
特点
该数据集的核心特点在于其严格的生成质量控制与精细的原子操作语义标注。生成过程中设置了几何有效性检查,利用 OpenCascade 的 BRepCheck 工具剔除无效或自相交的实体;同时,通过中性调色板对所有视角下的渲染图像进行近空白检测,确保每个剪辑均为有效且视觉上非空白的实体。数据采用 v2-continuous-mm 格式,提供原始浮点毫米级操作参数与可读的 ops_human 字段,并附有完整的架构文档 dataset_spec.md,详细说明了原子操作词汇表、比例与相机元数据以及深度自由度限制等关键信息。此外,每个剪辑包含逐帧的操作跨度信息(op_spans),为细粒度动作识别与视频理解提供了丰富的时间维度标注。
使用方法
数据集以 tar 分片形式组织,每个批次对应一个前缀文件夹(如 data_hula_b07),内部按案例索引(b0000–bNNNN)划分训练子目录,每个分片约包含 25 个剪辑,每批次约 10 个分片。每个剪辑的文件夹内包含逐帧的 256×256 PNG 图像序列、meta.json 文件(记录比例、相机参数、归一化信息及逐帧操作跨度)以及 ops.json 文件(存储原子操作元组及可读描述)。用户可加载 meta.json 中的 scale/camera 元数据进行多视角数据处理,利用 ops_human 进行动作语义理解,或结合 op_spans 实现视频到动作的逆动力学建模。建议在读取时使用近空白过滤器以筛选有效数据。
背景与挑战
背景概述
在计算机视觉与机器人学习交汇的前沿,视频理解与动作预测任务的发展长期受限于缺乏精确、可扩展的合成数据。3D-WM Atomic 数据集于近年由研究机构构建,旨在弥合视觉观测与底层物理动作之间的鸿沟,通过生成合成CAD构建视频并逐帧标注原子动作操作(atomic action ops),为逆动力学模型与世界模型的学习提供了坚实基础。该数据集的核心研究问题是:如何从连续的视频帧中精确推断离散/连续的物理操作参数,进而推动视频到动作映射与图像到视频预测的前沿。v3版本扩展了此前v2的数据规模,新增约300k视频片段,显著提升了训练的多样性与鲁棒性,已成为视频动作理解领域向结构化解耦范式转型的重要数据支撑。
当前挑战
该数据集所应对的领域挑战聚焦于从高维视觉序列中解耦并识别底层连续动作,传统方法往往依赖手工特征或弱监督信号,难以泛化至复杂几何构造场景。构建过程中的挑战同样严峻:每段视频需确保几何有效性,通过OpenCASCADE的BRepCheck剔除自交或无效实体,同时精细处理近空白帧以避免视觉信息缺失;此外,采用连续毫米级浮点参数而非量化表示,要求极高精度的标注对齐与尺度标准化,各视角间的参数共享与相机位姿协调亦需精心设计,最终在约8000例/批次的大规模数据生成中维持一致的质量控制标准。
常用场景
经典使用场景
3D-WM Atomic v3数据集是面向三维计算机视觉与机器人学交叉领域的一座里程碑,其以合成CAD构建动画为基石,精心配准了每帧的原子动作操作参数。该数据集最经典的使用场景在于驱动视频到动作的逆动力学建模以及图像到视频的世界模型学习。研究者可藉由海量、多视角的构建过程序列,训练模型从视觉帧中反向推断出底层原子操作,从而在细粒度上理解三维物体从零到一的生成逻辑。
实际应用
从实际应用层面审视,该数据集为工业级智能设计系统注入了强劲动力。借助其提供的原子动作元数据与多视角渲染帧,研发团队可构建实时的三维感知-动作管线,服务于机械臂操作规划、自动装配线质量检测以及增强现实中的虚拟物体构建等场景。其围绕单一缩放锚点设计的规范布局,更使得迁移至不同尺度与分辨率的硬件系统变得无缝而高效,赋能数字孪生与智能制造的落地部署。
衍生相关工作
基于该数据集,诸多经典工作得以萌发与深化。在逆动力学领域,研究者利用其序列化动作标注训练了端到端的视频到动作解析网络,实现了从像素直接映射至构建指令的范式跃迁。世界模型方面,后续工作通过该数据集的可控视角与连续动作参数,催化了面向三维物体的幻视生成与未来帧预测模型的涌现。此外,其明确的质量过滤准则与规范格式,也为合成数据集在可信度与可重复性上树立了标杆,催生了更广泛的多模态联合推理研究体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务