遇见数据集

spatialencoder_full

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

spatialencoder_full是一个为训练SpatialEncoder模型准备的大规模多模态数据集,于2026年5月25日构建完成。它作为SpatialEncoder训练流程的输入数据树(通过环境变量BOX_DATA_PATH和BOX_DATA_VAL_PATH指定),由三个主要子集构成:CA-1M(包含2966个训练项)、hyperism(包含560个训练项)和ADT(Aria Digital Twin,包含64个训练项)。整个数据集包含391,760个清单条目,逻辑存储容量(不包括目录条目)约为2044.28 GiB。数据以特定的目录结构组织,包含用于训练的压缩视频包(.tar文件)、序列化元数据文件(.pkl文件)以及用于验证的标注文件(.json文件)。该数据集专用于SpatialEncoder模型的训练任务,支持对三个子集进行按权重配比的混合训练,以优化模型性能。

spatialencoder_full is a large-scale multimodal dataset prepared for training the SpatialEncoder model, completed on May 25, 2026. It is intended to serve as the input data tree for the SpatialEncoder training pipeline (specified via environment variables BOX_DATA_PATH and BOX_DATA_VAL_PATH). The dataset consists of three main subsets: CA-1M (containing 2,966 training items), hyperism (containing 560 training items), and ADT (Aria Digital Twin, containing 64 training items). The entire dataset includes 391,760 manifest entries, with a logical storage capacity (excluding directory entries) of approximately 2044.28 GiB. Data is organized in a specific directory structure, containing compressed video packages (.tar files) for training, serialized metadata files (.pkl files), and annotation files (.json files) for validation. This dataset is dedicated to training tasks for the SpatialEncoder model, supporting mixed training with weighted proportions across the three subsets to optimize model performance.

创建时间:
2026-05-25
原始信息汇总

数据集概述:spatialencoder_full

基本信息

  • 数据集名称:spatialencoder_full
  • 准备日期:2026-05-25
  • 总大小:约 2044.28 GiB(约 2 TiB)
  • 数据集用途:作为 SpatialEncoder 训练所需的 BOX_DATA_PATH / BOX_DATA_VAL_PATH 输入树

数据集组成

数据子集 训练项数量
CA-1M 2966
hyperism 560
ADT 64
逻辑总大小(不含目录项) 2044.28 GiB
Manifest 条目数 391760
目录项数 64

目录结构

${BOX_DATA_PATH}/ ├── CA-1M/ │ ├── train/ │ │ └── ca1m-train-<video_id>.tar │ ├── val/ │ │ └── ca1m-val-<video_id>.tar │ └── val-unzip/ ├── hyperism/ │ └── hyperism/ ├── aria_digital_twin/ │ └── ADT/ ├── pickle/ │ └── CA-1M/ │ └── train.pkl ├── BoxFromMotion/ │ └── dataset/ │ ├── CA-1M.json │ ├── hyperism.json │ └── ADT.json ├── json_wo_pose/ └── val-json/

使用环境变量配置

bash export BOX_DATA_PATH=/path/to/spatialencoder_full export BOX_DATA_VAL_PATH=/path/to/spatialencoder_full/BoxFromMotion/dataset

下载方式

通过 Hugging Face CLI 下载,保持仓库路径结构:

bash pip install -U "huggingface_hub[cli]" DATA_ROOT=/mnt/nvme6/jieneng/data/spatialencoder_full mkdir -p "$DATA_ROOT" huggingface-cli download qicq1c/spatialencoder_full --repo-type dataset --local-dir "$DATA_ROOT" --local-dir-use-symlinks False

需确保目标文件系统有至少 2 TiB 的可用空间。

后处理步骤

解压打包附加文件

若下载包含 pickle.ziphyperism-train-json.ziphyperism-val-json.zip,需在数据根目录解压:

bash cd "$DATA_ROOT" for z in pickle.zip hyperism-train-json.zip hyperism-val-json.zip; do if [ -f "$z" ]; then unzip -o "$z" -d "$DATA_ROOT" fi done

展开 Hyperism 分片

若下载包含 hyperism_required_shards/*.tar,需将其展开到 Hyperism 帧目录:

bash mkdir -p "$DATA_ROOT/hyperism/hyperism/unzip" if [ -d "$DATA_ROOT/hyperism_required_shards" ]; then for shard in "$DATA_ROOT"/hyperism_required_shards/*.tar; do tar -xf "$shard" -C "$DATA_ROOT/hyperism/hyperism/unzip" done fi

训练验证要求

训练前需确认以下文件与目录存在:

  • $BOX_DATA_PATH/CA-1M/train
  • $BOX_DATA_PATH/CA-1M/val
  • $BOX_DATA_PATH/pickle/CA-1M
  • $BOX_DATA_PATH/hyperism/hyperism
  • $BOX_DATA_PATH/aria_digital_twin/ADT
  • $BOX_DATA_VAL_PATH/CA-1M.json
  • $BOX_DATA_VAL_PATH/hyperism.json
  • $BOX_DATA_VAL_PATH/ADT.json

预期结果:

  • CA-1M/train 包含多个 ca1m-train-*.tar 文件
  • pickle/CA-1M 包含 CA-1M 可迭代训练元数据
  • BoxFromMotion/dataset/ 下存在 CA-1M.jsonhyperism.jsonADT.json
  • Hyperism 和 ADT 帧路径引用存在于 BOX_DATA_PATH

训练配置

训练样本权重设置

合并训练配置按以下权重采样数据集:

trainer.data.train.dataset.weights = [CA-1M, hyperism, ADT]

单数据集烟雾测试

  • CA-1M 专用:trainer.data.train.dataset.weights=[1,0,0]
  • Hyperism 专用:trainer.data.train.dataset.weights=[0,1,0]
  • ADT 专用:trainer.data.train.dataset.weights=[0,0,1]

混合训练权重示例

bash trainer.data.train.dataset.weights=[0.4,0.2,0.4]

默认工作线程数

  • 完整设置:num_train_workers=16
  • 调试设置:num_train_workers=2

注意事项

  • 首次批次加载可能较慢(约 1-2 分钟),因数据加载器工作线程在填充缓存
  • 后续步骤 Data Time 应接近零
  • 若训练卡住,检查数据加载器工作线程是否仍在启动
  • 若单数据集失败,使用对应 one-hot 权重重新运行以隔离缺失文件
  • use_fa3=true 失败,可尝试使用 trainer.model.use_fa3=false 排除数据问题
搜集汇总
数据集介绍
spatialencoder_full 数据集图片
构建方式
spatialencoder_full数据集是为SpatialEncoder模型训练而精心构建的大规模多源融合数据集。其构建方式整合了CA-1M、hyperism与ADT三大子集,总逻辑体量达2044.28 GiB,涵盖391760条清单条目。数据采用层级化目录结构组织,保留原始文件布局,训练代码可直接将数据集根目录作为BOX_DATA_PATH与BOX_DATA_VAL_PATH输入。子集以压缩包或分片形式分发,用户需通过Hugging Face CLI下载后执行解包与展开操作,最终形成包含视频帧、元数据pickle文件及JSON标注文件的完整训练树。
特点
该数据集的核心特色在于其多源异构数据的统一封装与灵活配置能力。CA-1M提供大规模视频帧与迭代训练元数据,hyperism与ADT分别贡献特定场景下的空间编码样本,三者以tar归档和JSON清单协同管理,支持按权重比例混合采样。数据集中还包含预分割的验证集与packed add-ons,便于快速验证。此外,数据集与SpatialEncoder训练管线深度耦合,通过环境变量与配置文件实现无缝对接,并兼容SAM 3.1检查点加载,凸显其工程化设计的高效性与可复现性。
使用方法
使用该数据集进行训练需依次完成下载、解压与路径配置。首先通过huggingface-cli下载至目标目录,解压pickle.zip等附加档案并展开hyperism分片。随后设置BOX_DATA_PATH与BOX_DATA_VAL_PATH环境变量指向数据根目录及JSON子目录,并确保CA-1M/train等必要路径存在。推荐先以单子集烟雾测试验证各分支可输出损失,再启动多GPU混合训练。训练命令通过YAML配置文件调用,可调整子集权重(如[0.4,0.2,0.4])、批处理参数及日志频率,实现高效调试与产能训练。
背景与挑战
背景概述
spatialencoder_full数据集于2026年5月25日构建,由研究人员Qicq1c及其团队精心整合,旨在为空间编码器(SpatialEncoder)模型的训练提供统一的输入数据源。该数据集汇聚了CA-1M、hyperism及ADT三大子集,涵盖约39万条清单条目,逻辑大小超过2TB,是针对三维空间感知与场景理解领域的前沿资源。通过规范化的文件布局和清单管理,该数据集为研究空间关系编码、运动推断及数字孪生技术奠定了坚实的数据基础,显著推动了具身智能与空间智能交叉领域的发展。
当前挑战
spatialencoder_full面临的核心挑战在于多源异构数据的整合与高效训练。领域方面,该数据集旨在解决空间编码器在复杂三维场景中从不同数据源(如CA-1M的视频数据、hyperism的图像帧、ADT的数字孪生)中一致学习空间表征的难题,以应对真实世界中光照、视角及动态物体的多样性。构建过程中,挑战集中在近2TB数据的下载、解压与验证,包括处理pickle、JSON与shard等不同格式文件的扩展,以及确保清单路径正确、数据完整性可复现,同时需在混合训练中平衡子集权重以避免过拟合或欠拟合,对存储I/O与计算资源提出极高要求。
常用场景
经典使用场景
spatialencoder_full数据集专为空间编码器(SpatialEncoder)模型的训练而构建,其经典使用场景是作为大规模多源空间感知数据的统一训练与验证输入树。该数据集整合了CA-1M、Hyperism和ADT三大子集,共计约2TB的标注视频帧与元数据,通过精心设计的目录结构(包括训练/验证分割、pickle文件、JSON标注及打包压缩扩展),为模型提供从大规模视频序列中学习空间几何与深度信息所需的完整数据流。研究者可利用该数据集直接配置BOX_DATA_PATH环境变量,启动端到端的深度估计任务训练,尤其适用于需要融合不同场景、光照与运动模式下空间特征的多任务学习范式。
衍生相关工作
该数据集催生了一系列衍生研究方向与经典工作。在数据层面,研究者基于其标准化目录结构开发了动态采样权重调整算法,实现了跨子集自适应训练策略;在模型架构方面,SpatialEncoder本身作为核心工作,衍生出结合SAM 3.1语义分割先验的空间深度联合估计框架,以及利用FA3加速的内存高效Transformer变体。进一步地,CA-1M子集的pickle格式元数据引发了可迭代数据加载器的优化研究,而Hyperism与ADT的JSON标注则推动了多视角几何一致性损失函数的创新。这些工作共同构建了从数据准备、模型训练到部署优化的完整工具链生态,持续影响着空间智能领域的前沿探索。
数据集最近研究
最新研究方向
当前,三维空间理解与场景感知已成为计算机视觉领域的前沿热点,尤其在大规模空间编码与多源数据融合方面备受瞩目。spatialencoder_full数据集应运而生,凝聚了CA-1M、Hyperism与ADT三大子集的精髓,总规模逾2 TiB,旨在为空间编码器(SpatialEncoder)提供标准化的训练与验证输入。其开创性的混合训练策略——通过可调整的权重比例(如0.4:0.2:0.4)深度融合不同数据源,使得模型能够在复杂场景中兼顾几何结构与运动线索,显著提升了空间推理的鲁棒性。该数据集的出现,不仅推动了空间表征学习向更大规模、更高质量演进,也为增强现实、自主导航等热点应用提供了坚实的数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务