wan22-openvid-stage1-81f480x832-latents
收藏资源简介:
# Wan2.2 OpenVid Stage1 81f/480x832 Latent Cache ## 内容 这是 Wan2.2 OpenVid perception stage1 的高分辨率 latent/text cache,用于训练 RGB/mask/depth 联合预测的 I2V/TI2V perception 视频生成模型。 - 样本数:82,869 - 帧数:81 - 分辨率:480x832 - latent shape:`[144, 21, 30, 52]` - 模态顺序:`["rgb", "mask", "depth"]` - 模态通道:`[48, 48, 48]` - text embedding:Wan2.2 UMT5 XXL,`float16 [512, 4096]` - negative text embedding:已预计算,文件为 `negative_text_embedding.pt` ## 文件结构 ```text manifest_rank00000.jsonl summary_rank00000.json ... summary_rank00003.json text_embedding_summary.json negative_text_embedding.pt negative_text_embedding.pt.json modelscope_reshard_summary.json shards/ part-00000-of-00028-*.h5 ... ``` 原始 cache 的 4 个 HDF5 shard 每个约 307GB,超过 ModelScope 单文件 50GB 限制。发布版本已重新切成 28 个可直接训练使用的 HDF5 shard,每个 shard 约 44.5GB,manifest 中的 `shard_path` 使用相对路径。 ## 训练用法 下载后将训练脚本的 cache root 指向本目录即可: ```bash WAN22_STAGE1_CACHE_ROOT=/path/to/wan22-openvid-stage1-81f480x832-latents \ WAN22_STAGE1_BATCH_SIZE=1 \ WAN22_STAGE1_GRAD_ACCUM_STEPS=2 \ WAN22_STAGE1_GRADIENT_CHECKPOINTING=true \ WAN22_STAGE1_GRADIENT_CHECKPOINTING_RATIO=0.75 \ tools/launch_wan22_openvid_stage1_train_tmux.sh \ --run <run_name> ``` 该 cache 只包含预处理后的 latent、RGB condition image、caption、text embedding 和必要 metadata,不包含原始 OpenVid RGB/mask/depth 文件,也不包含 Wan2.2 官方基础模型权重。 ## 生成信息 源目录: ```text runs/wan22_openvid_stage1_cache_build/openvid_all_81f_480x832_encode ``` 重分片命令: ```bash cosmos-predict2.5/.venv/bin/python tools/reshard_wan22_stage1_cache.py \ --source-root runs/wan22_openvid_stage1_cache_build/openvid_all_81f_480x832_encode \ --output-root runs/modelscope_upload/wan22-openvid-stage1-81f480x832-latents \ --max-rows-per-shard 3000 \ --batch-rows 32 \ --overwrite ```



