spatialencoder_full
收藏资源简介:
spatialencoder_full是一个为训练SpatialEncoder模型准备的大规模多模态数据集,于2026年5月25日构建完成。它作为SpatialEncoder训练流程的输入数据树(通过环境变量BOX_DATA_PATH和BOX_DATA_VAL_PATH指定),由三个主要子集构成:CA-1M(包含2966个训练项)、hyperism(包含560个训练项)和ADT(Aria Digital Twin,包含64个训练项)。整个数据集包含391,760个清单条目,逻辑存储容量(不包括目录条目)约为2044.28 GiB。数据以特定的目录结构组织,包含用于训练的压缩视频包(.tar文件)、序列化元数据文件(.pkl文件)以及用于验证的标注文件(.json文件)。该数据集专用于SpatialEncoder模型的训练任务,支持对三个子集进行按权重配比的混合训练,以优化模型性能。
spatialencoder_full is a large-scale multimodal dataset prepared for training the SpatialEncoder model, completed on May 25, 2026. It is intended to serve as the input data tree for the SpatialEncoder training pipeline (specified via environment variables BOX_DATA_PATH and BOX_DATA_VAL_PATH). The dataset consists of three main subsets: CA-1M (containing 2,966 training items), hyperism (containing 560 training items), and ADT (Aria Digital Twin, containing 64 training items). The entire dataset includes 391,760 manifest entries, with a logical storage capacity (excluding directory entries) of approximately 2044.28 GiB. Data is organized in a specific directory structure, containing compressed video packages (.tar files) for training, serialized metadata files (.pkl files), and annotation files (.json files) for validation. This dataset is dedicated to training tasks for the SpatialEncoder model, supporting mixed training with weighted proportions across the three subsets to optimize model performance.
数据集概述:spatialencoder_full
基本信息
- 数据集名称:spatialencoder_full
- 准备日期:2026-05-25
- 总大小:约 2044.28 GiB(约 2 TiB)
- 数据集用途:作为 SpatialEncoder 训练所需的
BOX_DATA_PATH/BOX_DATA_VAL_PATH输入树
数据集组成
| 数据子集 | 训练项数量 |
|---|---|
| CA-1M | 2966 |
| hyperism | 560 |
| ADT | 64 |
| 逻辑总大小(不含目录项) | 2044.28 GiB |
| Manifest 条目数 | 391760 |
| 目录项数 | 64 |
目录结构
${BOX_DATA_PATH}/ ├── CA-1M/ │ ├── train/ │ │ └── ca1m-train-<video_id>.tar │ ├── val/ │ │ └── ca1m-val-<video_id>.tar │ └── val-unzip/ ├── hyperism/ │ └── hyperism/ ├── aria_digital_twin/ │ └── ADT/ ├── pickle/ │ └── CA-1M/ │ └── train.pkl ├── BoxFromMotion/ │ └── dataset/ │ ├── CA-1M.json │ ├── hyperism.json │ └── ADT.json ├── json_wo_pose/ └── val-json/
使用环境变量配置
bash export BOX_DATA_PATH=/path/to/spatialencoder_full export BOX_DATA_VAL_PATH=/path/to/spatialencoder_full/BoxFromMotion/dataset
下载方式
通过 Hugging Face CLI 下载,保持仓库路径结构:
bash pip install -U "huggingface_hub[cli]" DATA_ROOT=/mnt/nvme6/jieneng/data/spatialencoder_full mkdir -p "$DATA_ROOT" huggingface-cli download qicq1c/spatialencoder_full --repo-type dataset --local-dir "$DATA_ROOT" --local-dir-use-symlinks False
需确保目标文件系统有至少 2 TiB 的可用空间。
后处理步骤
解压打包附加文件
若下载包含 pickle.zip、hyperism-train-json.zip 或 hyperism-val-json.zip,需在数据根目录解压:
bash cd "$DATA_ROOT" for z in pickle.zip hyperism-train-json.zip hyperism-val-json.zip; do if [ -f "$z" ]; then unzip -o "$z" -d "$DATA_ROOT" fi done
展开 Hyperism 分片
若下载包含 hyperism_required_shards/*.tar,需将其展开到 Hyperism 帧目录:
bash mkdir -p "$DATA_ROOT/hyperism/hyperism/unzip" if [ -d "$DATA_ROOT/hyperism_required_shards" ]; then for shard in "$DATA_ROOT"/hyperism_required_shards/*.tar; do tar -xf "$shard" -C "$DATA_ROOT/hyperism/hyperism/unzip" done fi
训练验证要求
训练前需确认以下文件与目录存在:
$BOX_DATA_PATH/CA-1M/train$BOX_DATA_PATH/CA-1M/val$BOX_DATA_PATH/pickle/CA-1M$BOX_DATA_PATH/hyperism/hyperism$BOX_DATA_PATH/aria_digital_twin/ADT$BOX_DATA_VAL_PATH/CA-1M.json$BOX_DATA_VAL_PATH/hyperism.json$BOX_DATA_VAL_PATH/ADT.json
预期结果:
CA-1M/train包含多个ca1m-train-*.tar文件pickle/CA-1M包含 CA-1M 可迭代训练元数据BoxFromMotion/dataset/下存在CA-1M.json、hyperism.json、ADT.json- Hyperism 和 ADT 帧路径引用存在于
BOX_DATA_PATH下
训练配置
训练样本权重设置
合并训练配置按以下权重采样数据集:
trainer.data.train.dataset.weights = [CA-1M, hyperism, ADT]
单数据集烟雾测试
- CA-1M 专用:
trainer.data.train.dataset.weights=[1,0,0] - Hyperism 专用:
trainer.data.train.dataset.weights=[0,1,0] - ADT 专用:
trainer.data.train.dataset.weights=[0,0,1]
混合训练权重示例
bash trainer.data.train.dataset.weights=[0.4,0.2,0.4]
默认工作线程数
- 完整设置:
num_train_workers=16 - 调试设置:
num_train_workers=2
注意事项
- 首次批次加载可能较慢(约 1-2 分钟),因数据加载器工作线程在填充缓存
- 后续步骤
Data Time应接近零 - 若训练卡住,检查数据加载器工作线程是否仍在启动
- 若单数据集失败,使用对应 one-hot 权重重新运行以隔离缺失文件
- 若
use_fa3=true失败,可尝试使用trainer.model.use_fa3=false排除数据问题




