遇见数据集

3d-wm-atomic-v2

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

3d-wm-atomic-v2 是一个合成计算机辅助设计(CAD)构建视频数据集,专门用于训练视频到动作(逆动力学,IDM)和图像到下一帧(视频生成)模型。数据集包含从 CadQuery 构建程序生成的每操作动画帧序列,每个帧都带有连续原始毫米单位的原子操作标签。数据来源于 filapro/cad-recode 数据集的训练分割,并经过重新渲染以生成每操作动画。每个数据片段对应一个(案例,视角)对,从五个兄弟视角(等轴测、前视、侧视、顶视、随机)渲染,共享相同的物理毫米/像素锚点。数据以压缩包形式组织,包含 256x256 像素的 PNG 渲染帧、元数据文件(如 meta.json、ops.json 和 frame_codes.json)。数据规模在 10 万到 100 万样本之间,原子操作词汇表包含 10 种操作类型(如 SKETCH_BEGIN、SEGMENT 等),每个操作有稳定的 ID 和连续毫米参数。元数据提供了详细的场景信息,包括摄像机角度、世界边界框、规范化偏移和每帧操作进度。数据集经过坐标规范化处理,使最终网格边界框以世界原点为中心,便于模型学习。兄弟视角共享相同的比例和边界框,仅视角不同,支持视角不变特征训练。数据集格式为 v2-continuous-mm,适用于 CAD 相关的视频分类、逆动力学建模和视频生成等任务。

3d-wm-atomic-v2 is a synthetic computer-aided design (CAD) construction video dataset specifically designed for training video-to-action (inverse dynamics, IDM) and image-to-next-frame (video generation) models. The dataset contains per-operation animation frame sequences generated from CadQuery build programs, with each frame labeled with continuous atomic operations in raw millimeter units. The data is sourced from the training split of the filapro/cad-recode dataset and has been re-rendered to produce per-operation animations. Each data clip corresponds to a (case, viewpoint) pair, rendered from five sibling viewpoints (isometric, front, side, top, random), sharing the same physical millimeter/pixel anchor with only camera angles differing. The data is organized in compressed packages, including 256x256 pixel PNG rendered frames, metadata files (meta.json with per-frame operation spans, etc.), a complete atomic operation sequence file (ops.json), and per-frame partial CadQuery code files (frame_codes.json). The dataset scale ranges from 100,000 to 1 million samples. The atomic operation vocabulary includes 10 operation types (e.g., SKETCH_BEGIN, SEGMENT, ARC, SKETCH_EXTRUDE), each with stable IDs and continuous millimeter parameters without quantization. Metadata provides detailed scene information, including camera angles, world bounding boxes, normalization offsets, and per-frame operation progress (op_progress), which may exceed 1.0 to provide negative feedback signals. The dataset is processed with coordinate normalization, centering the final mesh bounding box at the world origin for easier model learning. Sibling viewpoints share the same scale and bounding box, differing only in viewpoint, supporting viewpoint-invariant feature training. The dataset format is v2-continuous-mm (since 2026-05-29), with earlier versions being gradually migrated. Downstream usage suggestions include coordinate normalization methods and video frame standardization. This dataset is suitable for CAD-related tasks such as video classification, inverse dynamics modeling, and video generation.

创建时间:
2026-05-28
原始信息汇总

数据集概述:3d-wm-atomic-v2

该数据集是合成CAD构建视频数据集,专为训练视频→动作(逆动力学,IDM)图像→下一帧(视频生成) 模型设计。每个视频片段对应于一个CAD程序在特定视角下的逐帧动画,并带有每帧的原子操作标签(以连续毫米为单位)。

  • 格式版本v2-continuous-mm(2026-05-29之后)。
  • 许可协议:CC-BY-4.0。
  • 数据规模100K < n < 1M 个样本。
  • 任务类别:视频分类、其他。
  • 标签:CAD、3D、逆动力学、视频生成。

数据结构与组织

数据集采用分片存储形式,每个分片包含多个(case, view)对。数据目录结构如下:

data_*/{bNNNN}/train/shard-NNNNNN.tar └── {case_uid}_v{NN}/ ├── 0000.png .. NNNN.png # 256x256 渲染帧 ├── meta.json # 所有元数据 + 每帧操作跨度 (op_spans) ├── ops.json # 完整原子操作序列 └── frame_codes.json # 每帧的部分 CadQuery 代码

  • case:一个CAD程序,从5个不同的兄弟视角(iso、front、side、top、random)渲染。同一个case的5个视角共享相同的物理坐标(毫米/像素),仅摄像机角度不同。
  • clip:每个(case, view)对构成一个视频片段,包含一系列PNG图像。

原子操作词汇表

所有操作参数均使用连续毫米格式,无量化。操作ID是稳定的,稀疏ID(0,1,2,5,6,7)为保留项。

op_id 名称 参数(按模式顺序)
8 SKETCH_BEGIN plane_idx (int), origin_xyz (3×float mm), start_xy (2×float mm)
9 SEGMENT x, y (2×float mm)
10 ARC mid_xy, end_xy (4×float mm)
11 LOOP_BREAK start_xy (2×float mm) — 打开新的草图循环
12 SKETCH_CLOSE — (无参数)
13 SKETCH_EXTRUDE h (float mm), kind (int: 0=fresh, 1=union, 2=cut)
14 END_SKETCH — 终止标记
15 SKETCH_CIRCLE r (float mm)
3 FILLET edge_idx (int: 0=
4 CHAMFER edge_idx (int), r (float mm)

分类字母表

  • plane_idx["XY", "YZ", "ZX"]
  • extrude_kind["fresh", "union", "cut"]
  • edge_idx["|Z", "|X", "|Y"]

操作元组示例

python [8, 1, -30.0, 0.0, 0.0, 16.0, -20.0] # SKETCH_BEGIN plane=YZ origin=(-30,0,0) start=(16,-20) [15, 30.0] # SKETCH_CIRCLE r=30.0 [12] # SKETCH_CLOSE [13, 32.0, 0] # SKETCH_EXTRUDE h=32.0 kind=fresh [14] # END_SKETCH

meta.json 关键字段

字段 类型 含义
format_version str 始终为 "v2-continuous-mm"
uid / base_uid / view_idx / view_name 标识符 clip ID, case ID, 视角索引, 视角名称 (e.g., iso)
n_frames int 该clip中的PNG帧数
frame_size int 图像尺寸(像素,正方形)
cam_elev_azim_deg [elev, azim] 球面摄像机角度(度)
camera_zoom float 固定值0.62(Open3D set_zoom值)
world_bbox_min / world_bbox_max [x,y,z] mm 场景锚定边界框(最终网格+草图覆层)经过平移归一化后的值
world_bbox_padded_* [x,y,z] mm 经过15%/5mm填充后的场景锚定边界框
world_diag_mm float mm 填充后边界框的3D对角线长度
approx_mm_per_pixel float mm/px world_diag_mm × camera_zoom / frame_size
canonicalize_offset_mm [x,y,z] mm 原始坐标 = 归一化坐标 + 偏移(反向平移)
op_spans array 每帧一个操作跨度条目
code str 该clip的完整CadQuery程序(归一化坐标系)
exec_ok bool 最终状态的CadQuery程序是否执行成功

op_spans 每帧条目格式

每帧有且仅有一个操作跨度。对于动画拉伸帧,action_op 中的 SKETCH_EXTRUDE 的高度为 full_h × op_progress,使得每帧拥有不同的数值目标。

json { "frame_idx": 5, "op_idx": 4, "op_type": "SKETCH_EXTRUDE", "op_progress": 0.864, "kind": "extrude", "keyframe": false, "action_op": [13, 27.65, 0], "action_op_human": "SKETCH_EXTRUDE(h=27.65, kind=fresh)" }

op_progress 表示该帧已完成的全长拉伸的比例,主要集中在(0, 1.0]。约有30%的概率,倒数第二帧的拉伸会超调(1.0, 1.3],为逆动力学模型提供显式的负反馈信号。

关键设计特性

  • 平移归一化:渲染器会将每个case的最终网格边界框中心平移到世界坐标系(0, 0, 0)。两个仅在世界平移上有差异的case将生成相同的PNG图像和操作元组,差异仅记录在canonicalize_offset_mm中。未应用旋转或缩放归一化。
  • 坐标帧:连续参数(长度/坐标)均采用归一化坐标系毫米。摄像机位置采用球面坐标系统。
  • 缩放一致性:同一个base_uid下的所有兄弟clip共享相同的world_bbox_*world_diag_mmapprox_mm_per_pixel,仅cam_elev_azim_deg不同。此约定可用于训练视角不变的特征。
  • 格式过渡说明:该数据集于2026-05-29迁移至v2-continuous-mm。旧版扁平前缀已被移除。data_hula_b01..b06前缀正在逐步重新渲染并覆盖为v2版本。在此期间,少数bNNNN分片可能仍包含旧版bin-quantized整数编码(长度 [0,60] mm @ 128 bins, 坐标 [-30,30] mm @ 128 bins)。务必根据meta["format_version"]进行分支处理。

推荐的归一化与使用方法

从PNG像素恢复物理毫米

python mm_per_px = meta["approx_mm_per_pixel"] mm_offset_from_image_center = pixel_offset × mm_per_px

如果meta["reference_bbox_diag"]非空,则渲染器强制整个数据集使用恒定的world_diag_mm,从而获得恒定的毫米/像素比。

IDM训练(根据视频帧预测action_op)的归一化方法

python half_extent = max( max(abs(c) for c in meta["world_bbox_min"]), max(abs(c) for c in meta["world_bbox_max"]), ) def normalize_coord(mm): return mm / half_extent # -> [-1, 1] def normalize_length(mm): return mm / (half_extent * 2) # -> [0, 1]

在采样/推理时应用逆运算。对于视频帧,标准做法是使用ImageNet统计数据或数据集内统计数据进行 (x / 255 - mean) / std 归一化。

数据来源

case解析自数据集filapro/cad-recode的训练集拆分,并重新渲染生成逐帧动画。

搜集汇总
数据集介绍
3d-wm-atomic-v2 数据集图片
构建方式
3d-wm-atomic-v2数据集是基于CadQuery构建程序合成生成的CAD构造视频数据集。每个样本对应一个CAD程序与一个特定视角的渲染结果,每个case通过五个视角(等轴测、前视、侧视、顶视、随机视角)进行渲染,所有视角共享相同的物理毫米/像素比例,仅相机角度不同。数据以分片tar包形式存储,每个分片包含多个case的渲染帧序列图、元数据文件、原子操作序列及每帧对应的部分CadQuery代码。原子操作词汇表涵盖了从草图开始、线段、圆弧、环断开、草图闭合、拉伸、结束草图、圆、圆角与倒角等十种操作类型,参数采用连续毫米值表示,未做量化处理。
使用方法
数据集支持两类主要应用:视频到动作的逆动力学建模与图像到下一帧的视频生成。对于逆动力学训练,推荐使用dataset-wide或per-clip的归一化方法:基于world_bbox_min/max计算半幅值half_extent,将坐标映射至[-1,1]区间,长度映射至[0,1]区间。对于视频帧,可采用ImageNet统计量进行标准归一化处理。从像素坐标恢复物理毫米时,利用meta.json中的approx_mm_per_pixel字段乘以像素偏移量。若需还原原始世界坐标,需将规范化坐标与canonicalize_offset_mm相加。使用时需注意检查format_version字段,仅信任标记为v2-continuous-mm的分片,以区分旧版量化编码数据。
背景与挑战
背景概述
在计算机视觉与三维建模的交叉领域,从视频序列中逆向推理构造操作(逆动力学)以及生成连续帧序列(视频生成)是极具挑战性的前沿课题。3d-wm-atomic-v2数据集由filapro团队于2026年创建,旨在为这些任务提供精细化的训练素材。该数据集基于CadQuery构造程序,生成了包含逐帧原子操作标签(以连续毫米为单位)的合成CAD构建动画视频,覆盖了从草图绘制到拉伸、倒角等完整构造流程。通过提供256×256渲染帧、元数据及操作序列,该数据集填补了三维几何构造与动态视觉理解之间的空白,为研究从视频直接学习构造逻辑的模型奠定了数据基础,对自动化设计、机器人装配等领域具有重要推动作用。
当前挑战
数据集面临的核心挑战包括:其一,所解决的领域问题涉及从二维视频帧中精确还原三维构造操作序列,这要求模型不仅具备空间几何感知能力,还需理解构造步骤的时序依赖与物理约束,例如拉伸进度与帧间对应关系的推断。其二,构建过程中需处理连续毫米级参数的精确标注与多视角一致性,数据集通过5个孪生视图共享锚点坐标但仅摄像机角度不同,确保物理尺度跨视角不变,这对渲染和元数据对齐提出了极高要求。此外,数据集还引入了约30%的超调帧作为逆动力学模型的负反馈信号,增加了数据复杂性和训练难度。同时,从旧版二进制量化编码到连续毫米格式的迁移过程需严格区分元数据版本,以确保数据可用性,这给数据使用者也带来了额外的处理负担。
常用场景
经典使用场景
该数据集专为三维计算机辅助设计(CAD)领域的逆动力学建模与视频生成任务而设计。其核心使用场景在于,通过提供从CadQuery程序逐帧渲染的合成视频片段,以及每帧精确对应的原子操作标注(如草图绘制、拉伸、圆角等连续毫米级参数),训练模型从视频像素序列反向推理出构造操作(video→action),或从当前帧预测下一帧的图像(image→next frame)。这种端到端的监督学习范式,使得机器能够像人类工匠一样,从视觉观察中理解三维物体的构造逻辑。
解决学术问题
该数据集解决了三维感知领域中一个长期存在的学术难题:如何从二维视频中无监督或弱监督地学习到连续、结构化、可复现的三维构造操作序列。传统方法多依赖昂贵的点云标注或重渲染损失,难以捕捉精细的局部几何变更。3d-wm-atomic-v2通过提供物理精确的连续毫米级空间参数(例如拉伸高度、圆角半径),使模型能够学习到跨视角不变的、与绝对尺度解耦的构造动因。这一突破为逆向图形学、程序化建模及可解释的几何推理研究提供了标准化训练基准。
实际应用
在实际工业应用中,该数据集支撑着从静态图像或操作视频反向生成完整CAD程序包的自动化流水线,大幅降低设计重绘与数字孪生构建的人力成本。机械设计师可通过拍摄三个正交视图,借助训练好的逆动力学模型直接输出可编辑的CadQuery脚本,实现物理零件的逆向重建与快速迭代。此外,在机器人装配场景中,该数据集训练的视觉伺服模型能够实时解析操作视频,预测下一帧的刀具路径与参数,指导机械臂完成高精度铆接、打磨等复杂工序。
数据集最近研究
最新研究方向
该数据集聚焦于合成CAD构建视频的逆动力学与视频生成前沿方向。通过提供逐帧连续的原子操作标注,结合毫米级精度的空间参数,为构建从视觉序列到三维建模动作的映射模型提供了关键训练资源。当前研究热点包括利用该数据集训练能够从渲染帧中预测CadQuery操作流(如拉伸、圆角)的反向动力学模型,以及开发基于图像序列预测下一帧的视频生成模型。特别地,数据集中引入的30%超调帧设计,旨在模拟模型对负面反馈信号的鲁棒性学习,这一特性直接呼应了具身智能领域中关于误差修正与闭环控制的前沿探讨。该数据集通过规范化坐标与视角对齐策略,为跨视角不变性特征学习奠定了基础,对推动自动化CAD、机器人演示学习及三维理解等关联领域的发展具有重要科学意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务