遇见数据集

VQVAE_DATA

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

VQVAE_DATA 是一个用于 TRELLIS SLAT VQ-VAE 模型训练的公共数据集,整合了来自 3D-FUTURE、HSSD 和 ABO 三个来源的 3D 数据。数据集包含两类文件:特征归档(features/dinov2_vitl14_reg/<sha256>.npz)提供 DINOv2 的 patch tokens 及稀疏体素索引;渲染归档(renders/<sha256>/)提供多视角 RGBA 图像、相机变换矩阵和网格模型。总数据量约为 1.12 TB,其中部分渲染文件因体积过大而被拆分为多个分片,需按说明拼接后使用。该数据集仅用于训练目的,使用者需自行审查各上游数据集的许可条款。

VQVAE_DATA is a public dataset for training the TRELLIS SLAT VQ-VAE model, integrating 3D data from three sources: 3D-FUTURE, HSSD, and ABO. The dataset contains two types of files: feature archives (features/dinov2_vitl14_reg/<sha256>.npz) providing DINOv2 patch tokens and sparse voxel indices; and rendering archives (renders/<sha256>/) providing multi-view RGBA images, camera transformation matrices, and mesh models. The total data size is approximately 1.12 TB, with some rendering files split into multiple shards due to large size, requiring concatenation according to instructions before use. This dataset is intended solely for training purposes; users must review the licensing terms of each upstream dataset.

创建时间:
2026-08-05
原始信息汇总

数据集概述

VQVAE_DATA 是一个公开的数据集仓库,用于 TRELLIS SLAT VQ-VAE 训练产物。

数据集内容

该数据集包含以下文件:

文件 大小(字节)
3D-FUTURE_features_dinov2_vitl14_reg.tar 204,869,898,240
3D-FUTURE_renders.tar.part-000 161,061,273,600
3D-FUTURE_renders.tar.part-001 132,927,508,480
HSSD_features_dinov2_vitl14_reg.tar 160,182,384,640
HSSD_renders.tar.part-000 161,061,273,600
HSSD_renders.tar.part-001 44,782,643,200
ABO_features_dinov2_vitl14_reg.tar 103,953,633,280
ABO_renders.tar 151,330,170,880

总计: 1,120,168,785,920 字节(约 1.12 TB)

文件结构说明

  • 特征文件(Feature archives):包含 features/dinov2_vitl14_reg/<sha256>.npz,内含稀疏体素索引和 DINOv2 patch tokens。
  • 渲染文件(Render archives):包含 renders/<sha256>/,内含多视角 RGBA 图像、相机变换和网格数据。

特殊说明

  • 两个最大的渲染档案(HSSD_renders.tar3D-FUTURE_renders.tar)被按字节拆分,以保持单个 Hub 文件低于 200 GB。使用前需重新拼接: bash cat HSSD_renders.tar.part-000 HSSD_renders.tar.part-001 > HSSD_renders.tar cat 3D-FUTURE_renders.tar.part-000 3D-FUTURE_renders.tar.part-001 > 3D-FUTURE_renders.tar

许可与使用注意

  • 数据集的许可证为 other(其他)。
  • 源数据集具有不同的上游许可证和使用条款。在使用或重新分发这些产物前,需审查各来源的重分发条款。
搜集汇总
数据集介绍
VQVAE_DATA 数据集图片
构建方式
VQVAE_DATA数据集是为TRELLIS SLAT VQ-VAE训练而精心构建的公共数据仓库,汇聚了来自3D-FUTURE、HSSD与ABO三大三维数据集的多模态训练产物。其构建流程涵盖多视图渲染与特征提取两大核心环节:借助DINOv2 ViT-L/14模型对每个物体进行稀疏体素索引与patch token的特征抽取,并以TAR归档形式分别存储渲染影像与特征数据。针对部分大型渲染档案,数据集采用字节分割技术,将超过200 GB的归档拆分为多个部分文件,以确保在HuggingFace Hub上的高效托管与传输,用户需通过cat命令对分割文件进行合并后方可解压使用,这一精细化的组织方式保障了数据完整性与可用性。
使用方法
用户获取该数据集后,首要步骤是对字节分割的渲染档案执行重组操作,通过特定命令将多个part文件拼接还原为完整的TAR归档,随后即可按需解压访问其中内容。特征档案可直接加载,其中涵盖的稀疏体素索引与DINOv2特征向量可无缝对接VQ-VAE模型的输入层,用于训练三维表征学习的潜变量编码器。由于源数据集的授权各异,使用前应逐一评估其再分发与商用许可,确保在合规前提下开展科研或应用开发。此外,数据集的庞大体积要求使用者规划充足的存储空间与计算资源,其多模态格式亦为跨模态学习、三维生成等前沿探索提供了理想的数据基础。
背景与挑战
背景概述
VQVAE_DATA数据集由TRELLIS团队于近期创建,旨在支持SLAT(Sparse Latent Attention Transformer)中VQ-VAE模型的训练。该数据集整合了3D-FUTURE、HSSD和ABO三个主流三维数据集,通过DINOv2视觉特征提取和多视图渲染技术,生成包含稀疏体素索引与语义特征的高质量训练样本。其核心研究问题在于为三维形状的离散化表示提供大规模、多源异构的训练数据,以促进VQ-VAE在三维生成任务中的性能提升。该数据集的发布为三维深度学习领域提供了关键的数据基础设施,推动了稀疏潜在表示学习在三维场景理解与生成中的应用。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。领域层面,三维数据的稀疏性与高维性使得离散化编码困难,且多源数据集(如3D-FUTURE、HSSD、ABO)在尺度、类别、质量标准上存在显著差异,增加了VQ-VAE学习的复杂性和泛化难度。构建过程中,数据规模庞大(总计超1TB),需要处理大文件的分卷存储与重建;同时,多视图渲染与特征提取需保证视角覆盖和特征一致性,而不同来源数据集的许可限制也要求严格的合规审查,以确保再分发的合法性。
常用场景
经典使用场景
VQVAE_DATA数据集作为TRELLIS SLAT(Sparse Latent Actor-critic Transformer)系统中矢量量化变分自编码器(VQ-VAE)训练的核心资产,其经典使用场景聚焦于三维稀疏体素特征的离散化编码。该数据集融合了3D-FUTURE、HSSD和ABO三大主流三维模型库,提供DINOv2视觉特征与多视图渲染图像,为训练VQ-VAE模型提供了丰富的配对数据,使模型能够学习从高维连续特征映射到紧凑离散码本的有效映射,从而支撑高质量的三维形状生成与重建任务。
解决学术问题
该数据集解决了三维表征学习中连续特征难以高效存储与处理的学术难题。通过引入DINOv2预训练特征作为感知信号,并配套稀疏体素索引,研究者得以探索在稀疏三维网格上进行矢量量化学习的方法论,显著降低了三维数据的内存占用与计算复杂度。其大规模多源数据整合,为跨域三维特征泛化研究提供了基准,促进了三维生成模型在离散潜空间上的理论发展,对三维视觉与图形学的交叉研究具有里程碑式的意义。
实际应用
在实际应用中,VQVAE_DATA数据集驱动的模型可广泛用于游戏、影视与VR/AR领域的三维内容快速生成。基于其在稀疏体素上的高效编码特性,开发者能够利用训练后的VQ-VAE将高分辨率三维资产压缩为紧凑的码本表示,实现实时传输与动态加载。此外,结合多视图渲染数据,该数据集为三维物体检索、场景理解与自动驾驶仿真等工业级应用提供了可靠的训练基础,缩短了从设计到部署的周期。
数据集最近研究
最新研究方向
当前三维生成领域正朝着大规模、多源数据融合与高保真结构化表征的方向演进。VQVAE_DATA作为TRELLIS SLAT框架的核心训练资产,汇聚了3D-FUTURE、HSSD与ABO三大主流数据集的渲染图像与DINOv2特征,其以稀疏体素索引与语义补丁令牌构建的潜在表征,为神经压缩与离散潜在扩散模型提供了坚实基石。该数据集的发布标志着研究重心从单一场景理解转向跨域泛化的三维生成预训练,尤其在高分辨率多视角重建与纹理几何协同建模上具有开拓性意义。其分卷存储策略亦反映出对海量数据工程化部署的考量,有望推动后续工作在可扩展性与分布式训练上的创新,并为统一三维世界模型奠定数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务