遇见数据集

3D-IDE-data

收藏
Hugging Face2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

3D-IDE训练数据集是用于CVPR 2026论文《3D-IDE》的完整、已验证的训练数据,与原始实验服务器数据字节级相同。该数据集包含三个主要部分:核心数据包(3d_ide_data.zip,4.3 GB),内含processed、metadata、benchmark、balanced、embodiedscan等处理后的数据文件夹及配置文件;ScanNet原始数据(约60 GB),包括带姿态的图像、掩码和带物体包围框的点云数据,这些数据来源于ScanNet数据集,使用时需遵守其许可条款;以及预提取的VGGT视觉特征(9个分卷,每卷约43 GB)。数据集旨在支持3D场景理解、多模态学习及相关任务的研究与实验。用户可通过提供的MD5清单文件验证数据完整性,确保与原始训练环境完全一致。注意:LLaVA-Video-7B-Qwen2模型和VGGT-1B模型检查点需从指定链接单独下载。

The 3D-IDE training dataset is a complete and verified training corpus for the CVPR 2026 paper titled *3D-IDE*, which is byte-for-byte identical to the data stored on the original experimental server. This dataset comprises three core components: 1. The core data package (3d_ide_data.zip, 4.3 GB), which includes processed data directories and configuration files such as `processed`, `metadata`, `benchmark`, `balanced`, and `embodiedscan`; 2. The raw ScanNet data (approximately 60 GB), containing pose-registered images, segmentation masks, and point cloud data with object bounding boxes. This data is sourced from the ScanNet dataset, and users must adhere to its licensing terms when utilizing it; 3. The pre-extracted VGGT visual features, split into 9 volumes with each volume being approximately 43 GB. This dataset is intended to support research and experimental work on 3D scene understanding, multimodal learning, and related tasks. Users can validate the data integrity using the provided MD5 manifest file to guarantee full consistency with the original training environment. Note: The checkpoints for the LLaVA-Video-7B-Qwen2 and VGGT-1B models need to be downloaded separately via the specified links.

创建时间:
2026-06-11
原始信息汇总

3D-IDE 训练数据集概述

该数据集是为 CVPR 2026 论文 3D-IDE 提供的完整、经过验证的训练数据,与论文实验中使用数据完全一致(字节相同)。

数据集内容

核心数据文件

文件 大小 内容说明 解压目标
3d_ide_data.zip 4.3 GB 包含 processed/metadata/benchmark/balanced/embodiedscan/multi.yaml data/
scannet/scannet_posed_images_part1.zip ~25 GB ScanNet 姿态图像前半部分 data/scannet/
scannet/scannet_posed_images_part2.zip ~25 GB ScanNet 姿态图像后半部分 data/scannet/
scannet/scannet_mask_pcd.zip ~10 GB 包含 mask/pcd_with_object_aabbs/ data/scannet/
vggt_features/vggt_features_part{1..9}.zip 9 × ~43 GB VGGT 特征文件 (vggt_sliced.npy) data/scannet/posed_images_3d_feature_vggt/

验证文件

  • md5_manifest.txt3d_ide_data.zip 中所有文件的 MD5 校验值
  • md5_manifest_scannet.txtscannet/ 目录下所有原始文件的 MD5 校验值

数据布局结构

3D-IDE/ ├── data/ │ ├── balanced/ │ ├── benchmark/ │ ├── embodiedscan/ │ ├── metadata/ │ ├── models/LLaVA-Video-7B-Qwen2/ # 需单独下载 │ ├── processed/ │ ├── multi.yaml │ └── scannet/ │ ├── mask/ │ ├── pcd_with_object_aabbs/ │ ├── posed_images/ │ └── posed_images_3d_feature_vggt/ └── VGGT_checkpoints/model.pt # 需单独下载

数据提取与验证

解压命令

bash cd 3D-IDE unzip 3d_ide_data.zip -d data/ unzip scannet_posed_images_part1.zip -d data/scannet/ unzip scannet_posed_images_part2.zip -d data/scannet/ unzip scannet_mask_pcd.zip -d data/scannet/ mkdir -p data/scannet/posed_images_3d_feature_vggt for i in 1 2 3 4 5 6 7 8 9; do unzip vggt_features_part$i.zip -d data/scannet/posed_images_3d_feature_vggt/ done

数据验证命令

bash cd 3D-IDE/data md5sum -c md5_manifest.txt md5sum -c md5_manifest_scannet.txt

注意事项

  • ScanNet 使用许可scannet/ 相关档案和部分元数据源自 ScanNet,下载即表示同意 ScanNet 使用条款。
  • 需单独下载的依赖
搜集汇总
数据集介绍
3D-IDE-data 数据集图片
构建方式
3D-IDE-data数据集的核心构建源于对三维室内场景理解任务的深度优化,其设计以精确性与可复现性为首要追求。该数据集完整收录了CVPR 2026论文《3D-IDE》实验中所使用的全部训练数据,确保与原始训练服务器的字节级完全一致。数据构成上,主干压缩包`3d_ide_data.zip`包含经过预处理的特征、元数据、基准测试集及均衡采样数据;此外,数据集还集成了ScanNet的大规模原始图像、掩码与点云数据,以及基于VGGT模型提取的三维特征切片。所有文件均附有MD5校验清单,用户可通过比对哈希值验证本地副本的完整性,从根本上规避了因传输损坏或版本偏差导致的实验误差。
特点
本数据集最为显著的特征在于其端到端的工程化验证能力与极低的部署门槛。通过提供`md5_manifest.txt`与`md5_manifest_scannet.txt`两份完整性校验清单,研究者无需重新下载即可精准定位本地数据与官方训练副本间的任何差异。此外,`3d_ide_data.zip`内部的`processed/`、`metadata/`、`benchmark/`、`balanced/`等核心文件夹均以松散形式镜像于仓库根目录,便于用户按需单独下载,免去整体解压的冗余操作。这种双轨并行的分发策略,在确保数据原子性一致的同时,赋予了科研工作流高度的灵活性与资源效率。
使用方法
建议用户在3D-IDE项目根目录下执行标准化的解压流程。首先通过`unzip 3d_ide_data.zip -d data/`释放主干数据,随后依次将ScanNet的原始图像、点云与掩码归档解压至`data/scannet/`路径下。对于VGGT特征,需预先创建`data/scannet/posed_images_3d_feature_vggt/`目录,并循环解压九个分卷压缩包至该目录,注意归档文件内部不含外层包装目录。完成数据部署后,建议运行`md5sum -c md5_manifest.txt`与`md5sum -c md5_manifest_scannet.txt`命令进行全局校验,以确保局部文件与官方训练环境严格一致。用户还需额外下载LLaVA-Video-7B-Qwen2模型权重与VGGT-1B检查点,并按照最终目录结构放置。
背景与挑战
背景概述
三维场景理解是计算机视觉领域的核心议题,其目标在于从传感器数据中解析物体的几何结构与语义信息,为机器人导航、增强现实及自动驾驶等应用提供关键支撑。然而,现有数据集多聚焦于单一模态或受限场景,难以满足多视角、多尺度及精细化三维交互任务的需求。为此,研究者于2026年在CVPR会议上提出了3D-IDE模型,并附带发布了3D-IDE-data数据集。该数据集由Chushan Zhang等研究人员主导构建,依托于ScanNet等公开资源,整合了经过严格验证的多模态训练数据,涵盖处理后的点云、图像、掩码及体素特征等,旨在推动实例分割、场景解析与三维重建等任务的统一基准建立。其发布为大规模三维数据的高效利用提供了重要支撑,显著提升了三维视觉研究的可复现性与标准化水平。
当前挑战
该数据集所解决的领域问题首先表现为三维场景理解中多模态数据融合的复杂性:不同传感器获取的点云、图像与特征数据在分辨率、坐标系及语义粒度上存在巨大差异,而现有方法难以在此异构数据上实现鲁棒的特征对齐与联合学习。其次,在构建过程中,数据集面临数据规模庞大且来源异构的挑战:原始ScanNet数据需经姿态对齐、掩码生成与点云分割等多步骤处理,单一文件的体积动辄数十GB,分布于多个压缩包中,对存储与校验提出了极高要求。此外,为确保训练数据的纯净性与可复现性,研究团队设计了完整的MD5校验机制,逐文件比对本地副本与服务器原始数据,任何字节差异均会导致失败,这在大规模分发与协作场景中尤显棘手。最终,外部模型检查点(如LLaVA-Video与VGGT)的独立依赖也为数据集的完整部署增添了横向依赖管理的难度。
常用场景
经典使用场景
3D-IDE-data数据集由CVPR 2026收录的3D-IDE工作提供,是专为三维室内场景理解与交互式语义编辑设计的训练数据。该数据集以ScanNet为基础,融合了多视角图像、点云掩码以及VGGT提取的稠密三维特征,形成了从感知到建模的完整数据链路。其经典使用场景包括训练能够对三维室内场景进行实例分割、物体检测和空间关系推理的深度学习模型,同时支持基于文本指令的精细编辑操作,如物体替换、移除或重新布局。通过提供经过严格校验的标注与特征预计算数据,该数据集为研究者提供了可复现的基准,推动了三维视觉与语言联合理解领域的发展。
实际应用
在实际应用中,3D-IDE-data数据集赋能了多项前沿的虚拟现实与智能设计工具。基于该数据训练的模型可被部署于室内装修辅助系统,用户仅需输入自然语言描述即可实时调整家具布局或墙面材质,大幅降低设计门槛。在游戏与影视行业,它能加速三维场景的自动生成与修改流程,减少手工建模的人力成本。此外,该数据还支撑着机器人导航中的动态环境理解,使机器人能够依据语音指令完成物体抓取与空间重构。其提供的标准化评估基准和高效推理框架,为从学术研究到产业落地的平滑过渡提供了可靠保障。
衍生相关工作
3D-IDE-data数据集的发布催生了一系列富有影响力的衍生工作。在方法层面,研究者基于该数据发展了多模态指令微调的三维大语言模型,将文本驱动的编辑能力扩展至全局场景风格迁移与物理合理性约束。在数据层面,相关工作借鉴其构建流程,将特征预计算与数据校验策略迁移至室外场景和动态物体处理,形成了新的数据生产范式。在评估体系方面,该数据集支持的基准评测激发了针对三维编辑一致性、语义保真度的细化度量研究,推动了更严谨的模型比较框架的建立。这些衍生成果共同构成了围绕三维交互编辑的学术生态,持续拓展着计算机视觉与图形学交叉领域的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务