遇见数据集

3d-dlp-repro-genericshapes-rgb

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

GenericShapes-RGB是一个合成RGB体素数据集,专为复现ICML 2026论文《3D-DLP: Self-supervised 3D Object-centric Scene Representation Learning》而构建。它重现了论文附录B.2中描述但未发布的GenericShapes语料库的RGB彩色变体,遵循论文协议和作者提供的生成器结构。数据集包含40,000个桌面场景,每个场景包含3-6个随机放置的几何基元(如立方体、球体、圆柱体、圆锥体、胶囊体),这些基元具有随机尺寸(6-14厘米)和随机偏航角,无碰撞地放置在0.8×0.6米的平面上。点云表面采样添加了2毫米高斯传感器噪声,每个物体被赋予每场景饱和色调,桌面为灰褐色。点云使用论文代码库的VoxelGridXYZ体素化为64³的avg_rgb网格,采用固定全局边界(-0.42,-0.32,-0.02)至(0.42,0.32,0.22),以确保关键点坐标在不同场景间可比。每个场景包含三个文件:体素文件(存储稀疏体素网格)、元数据文件(包含体素化参数)和标签文件(提供每个体素的真实实例ID,用于评估无监督分解性能)。数据集提供两种颜色模式:distinct(每个物体使用不同色调,颜色本身即可识别实例)和palette(色调从固定8色调色板中独立重复抽取,物体可能共享颜色)。数据集格式与原始论文代码库的VoxelDataset完全兼容,包含预定义的80%训练、10%验证、10%测试划分。标签文件仅用于评估无监督分解指标(如FG-ARI、mBO、FG/BG IoU),模型训练为纯自监督重建任务。数据集附带可重现的生成脚本和设置文件,确保数据可完全复现。

GenericShapes-RGB is a synthetic RGB voxel dataset built specifically for reproducing the ICML 2026 paper 3D-DLP: Self-supervised 3D Object-centric Scene Representation Learning. It recreates the RGB color variant of the GenericShapes corpus described but not released in Appendix B.2 of the paper, following the protocol and generator structure provided by the authors. The dataset contains 40,000 tabletop scenes, each with 3-6 randomly placed geometric primitives (cube, sphere, cylinder, cone, capsule) with random sizes (6-14 cm) and random yaw angles, placed collision-free on a 0.8×0.6 meter plane. Point cloud surface sampling adds 2 mm Gaussian sensor noise, each object is assigned a per-scene saturated hue, and the tabletop is beige. The point cloud is voxelized into a 64³ avg_rgb grid using the VoxelGridXYZ from the papers codebase, with a fixed global bounding box from (-0.42,-0.32,-0.02) to (0.42,0.32,0.22) to ensure keypoint coordinates are comparable across scenes. Each scene includes three files: a voxel file (storing the sparse voxel grid), a metadata file (containing voxelization parameters), and a label file (providing ground-truth instance IDs per voxel for evaluating unsupervised decomposition performance). The dataset offers two color modes: distinct (each object uses a different hue, where color alone can identify instances) and palette (hues are independently and repeatedly sampled from a fixed 8-color palette, so objects may share colors). The dataset format is fully compatible with the original papers codebase VoxelDataset, and includes a predefined 80% training, 10% validation, and 10% test split. The label files are only used for evaluating unsupervised decomposition metrics (FG-ARI, mBO, FG/BG IoU), with model training being purely self-supervised reconstruction. The dataset comes with reproducible generation scripts and configuration files to ensure full data reproducibility.

创建时间:
2026-07-25
原始信息汇总

数据集概述:GenericShapes-RGB

基本信息

  • 数据集名称:GenericShapes-RGB
  • 许可证:MIT
  • 任务类别:图像分割(image-segmentation)
  • 标签:object-centric, 3d, voxels, icml2026, open-reproductions, reproduction
  • 数据规模:10K < n < 100K
  • 发布地址:https://huggingface.co/datasets/rvt832/3d-dlp-repro-genericshapes-rgb

背景与用途

该数据集是为复现ICML 2026论文 《3D-DLP: Self-supervised 3D Object-centric Scene Representation Learning》(论文链接:https://arxiv.org/abs/2606.19451)而构建的合成训练/评估语料库。论文中描述的GenericShapes语料库(附录B.2)未公开,且作者发布的生成器仅生成无色的点云,本数据集根据论文协议和生成器结构,重新创建了论文中提及的“RGB彩色变体”。

数据内容

场景结构

  • 总场景数:40,000个桌面场景
  • 每场景物体:3-6个基本几何体(立方体/球体/圆柱体/圆锥体/胶囊体)
  • 物体属性:随机尺度(6-14厘米)、随机偏航角、无碰撞放置
  • 桌面尺寸:0.8 × 0.6 米平面桌
  • 点云采样:表面采样至点云,加入2毫米高斯传感器噪声
  • 颜色分配:每个物体赋予饱和的场景内色调,桌面为哑光灰褐色
  • 体素化:点云被体素化为 64³ avg_rgb 网格,全局边界固定为 (-0.42,-0.32,-0.02) 到 (0.42,0.32,0.22),确保关键点坐标跨场景可比

文件构成

文件 内容
NNNNNN_voxels.pt 稀疏字典:{compressed, shape=(3,64,64,64), coords int16 [N,3], values fp16 [N,3]},可通过仓库的load_voxel() 扩展为稠密 [3,64,64,64] float32
NNNNNN_meta.pt 包含 {W,H,D,pmin,pmax,voxel_size} 的元数据字典
NNNNNN_labels.pt 真实体素实例ID:{coords, labels int16, shape}0 = 桌面/背景,1..K = 物体

标签文件用途

标签文件仅用于评估无监督分解结果(FG-ARI、mBO、FG/BG IoU),训练过程 train_dlp_voxel.py 完全不读取标签,训练为纯自监督重建。

数据划分

数据集采用确定的 0.8 / 0.1 / 0.1 训练/验证/测试划分,按排序后的ID进行,与论文所述比例一致。

颜色模式

数据集提供两种颜色模式,可通过 --colour-mode 参数选择:

模式 行为 重要性
distinct 每个物体赋予不同的色调 颜色本身即可区分实例——在CIELAB上进行简单K-means聚类即可获得FG-ARI 0.932,远超模型性能
palette 从固定的8色调色板中有放回地随机抽取色调 物体可能共享颜色,因此颜色本身无法区分实例

使用 palette 模式可以确保分割指标衡量的是分组能力而非颜色查找能力。

重要更正(2026-07-26)

首次发布的数据集不可复现。原始生成器调用 trimesh.sample_surface(...)未设置随机种子,导致表面采样依赖操作系统熵源,无法通过 --seed 参数复现。现已修复:生成器从自身RNG为每个物体派生显式种子,并验证了两次运行可达到字节级复现性。首次发布的Claim-1数据无法被任何人(包括作者)精确复现。

数据集生成

数据集随附 gen_genericshapes_rgb.pysettings.json 以及60个场景的 sample/ 样本。可通过以下命令复现全部40,000场景(约7.7 GB,32核心运行数分钟):

bash pip install torch trimesh numpy git clone https://github.com/Eubooks3003/3d-dlp.git repo for s in $(seq 0 31); do python gen_genericshapes_rgb.py --out genericshapes_rgb --scenes 1667 --start $((s*1667)) --seed $((1234+s)) --colour-mode distinct done; wait

复现日志

复现结果、训练好的模型检查点及完整方法描述详见: https://huggingface.co/spaces/rvt832/repro-3d-dlp-self-supervised-3d-object-centric-scene-representation-learning

搜集汇总
数据集介绍
3d-dlp-repro-genericshapes-rgb 数据集图片
构建方式
该数据集旨在复现ICML 2026论文中提及的GenericShapes-RGB变体,填补原始发布中缺失的RGB彩色点云数据。构建过程严格遵循论文所述协议及作者提供的生成器框架,生成了40,000个桌面场景,每个场景包含3至6个随机缩放与偏航的几何体(立方体、球体、圆柱、圆锥、胶囊),并确保物体间无碰撞地分布于0.8×0.6米的平面桌面上。表面点云附加2毫米高斯传感器噪声后,经由论文仓库中的VoxelGridXYZ模块体素化为64³的avg_rgb网格,固定全局边界使关键点坐标跨场景可比。生成器现已修正为确定性随机种子,确保完整数据集可精确复现。
特点
该数据集的核心特色在于提供了两种着色模式:distinct模式下每个物体拥有独立色调,颜色本身即可区分实例;palette模式下颜色从固定八色调色板中可重复抽取,物体间可能共享颜色,迫使分割度量专注于分组能力而非颜色查找。此外,数据集包含三种文件:存储稀疏体素数据的pt文件、记录网格元数据的pt文件,以及仅用于评估的逐体素真实实例标签文件。训练过程完全基于自监督重建,无需标签参与。数据集采用扁平目录结构,与论文仓库的VoxelDataset加载方式无缝兼容。
使用方法
数据集可直接作为论文仓库中VoxelDataset的输入,仅需指定ds为voxel并设置root路径即可。对于训练,应使用palette着色模式以评估模型真正的物体分组能力;distinct模式则适用于需要颜色辅助的基准测试。预定义的数据集划分(训练/验证/测试比例为0.8/0.1/0.1)基于排序后的ID顺序,与论文陈述一致。如需全量复现,可通过提供的生成脚本配合多进程并行运行,利用确定性种子生成所有场景。标签文件仅在评估无监督分解性能时使用,训练过程中不应读取。
背景与挑战
背景概述
该数据集由研究者在2026年创建,旨在复现ICML 2026论文《3D-DLP: Self-supervised 3D Object-centric Scene Representation Learning》中的实验。原始论文描述的GenericShapes数据集未公开,且其官方代码仅生成无色点云,而RGB彩色变体则缺失。为填补这一空白,研究者严格遵循论文协议与代码结构,构建了包含40,000个合成桌面场景的RGB体素数据集。每个场景包含3至6个随机缩放与旋转的几何体,并赋予每场景饱和色调,体素化至64³网格。该数据集对自监督3D场景表示学习领域具有重要支撑作用,为验证和推广3D-DLP方法提供了标准化基准。
当前挑战
该数据集面临多重挑战。首先,它解决了领域内自监督3D场景分解中的关键问题:如何在不依赖标签的情况下,从RGB体素中学习物体为中心的表示。原始论文中颜色方案的选择会显著影响分割指标,实验中观察到使用不同颜色模式(如每物体独特色调与固定调色板重复采样)会导致结果差异,需谨慎设计以避免颜色信息泄露。其次,构建过程中遇到重大挑战:最初生成器因未设置随机种子导致表面采样不可重复,无法确保数据集的精确复现。经修复后,通过基于种子显式推导每物体随机性,实现了字节级可复现性。此外,数据集生成需平衡计算效率与场景多样性,在约32核环境下耗时数分钟生成7.7 GB数据。
常用场景
经典使用场景
在三维场景理解与自监督表征学习的研究领域中,该数据集专为评估无监督物体中心场景分解方法而构建。经典使用场景涵盖将RGB体素化点云输入自编码器或基于Transformer的架构,通过重建、对比或互信息最大化等目标,学习解耦的物体级表征。研究者可直接利用其预定义的体素网格格式与元数据,调用官方代码库中的VoxelDataset进行训练与评估,从而复现或改进ICML 2026原始论文的核心实验。
解决学术问题
该数据集精准解决了三维自监督物体中心学习中合成基准数据匮乏的困境。原始论文虽描述了GenericShapes语料库但未公开其RGB变体,且官方生成器仅输出无色点云,严重阻碍了实验复现与方法公平比较。本数据集通过严格遵循论文协议并完善色彩模式策略,首次提供了一个完全可复现的标准化测试平台,使得研究者能独立验证物体分割与场景分解算法的泛化能力,推动了三维无监督学习领域的可重复性进步。
衍生相关工作
围绕该数据集已衍生出一系列重要工作:研究者基于其提供的完全可复现合成场景,系统性地探究了体素分辨率、色彩变异性与传感器噪声对无监督物体分割性能的交互效应;在此基础上,后续工作进一步提出了对称感知的三维场景表征模型,以及利用对比学习增强物体边界感知的变分自编码器。该数据集亦成为三维场景图构建、物体重排规划及生成式场景编辑等前沿方向的基准测试平台,持续推动着三维视觉理解社区的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务