RAEv2-data
收藏资源简介:
RAEv2数据集是为论文《Improved Baselines with Representation Autoencoders》(RAEv2)准备的预处理数据集和预训练编码器集合。该数据集包含五个经过统一预处理至256x256分辨率的子集,适用于文本到图像生成和无条件图像生成等任务。具体子集包括:1) imagenet-256:基于ImageNet-1k数据集的标准图像分类数据;2) blip3o-256:使用BLIP3o模型标注的图像-文本对数据集,包含视觉描述;3) render-text-256:渲染文本图像数据集,包含合成生成的文本视觉内容;4) scale-rae-256:基于FLUX模型生成的合成图像数据集;5) recon-256:机器人导航帧数据集,包含机器人视角的导航场景图像。数据集采用Arrow和WebDataset(WDS)两种格式存储,以确保高效加载。此外,还提供了RAEv2模型使用的预训练视觉编码器和分词器权重,包括DINOv3、EUPE、iJEPA、MAE、MoCov3和SDVAE等主流模型。所有原始数据权利归属于相应所有者,预处理和打包层遵循CC BY-NC 4.0许可证。
The RAEv2 dataset is a preprocessed dataset and collection of pretrained encoders prepared for the paper Improved Baselines with Representation Autoencoders (RAEv2). It includes five subsets uniformly preprocessed to 256x256 resolution, suitable for tasks such as text-to-image generation and unconditional image generation. Specific subsets are: 1) imagenet-256: standard image classification data based on the ImageNet-1k dataset; 2) blip3o-256: an image-text pair dataset annotated using the BLIP3o model, containing visual descriptions; 3) render-text-256: a rendered text image dataset with synthetically generated text visual content; 4) scale-rae-256: a synthetic image dataset generated based on the FLUX model; 5) recon-256: a robot navigation frame dataset containing navigation scene images from a robots perspective. The dataset is stored in both Arrow and WebDataset (WDS) formats to ensure efficient loading. Additionally, it provides pretrained vision encoder and tokenizer weights used by the RAEv2 model, including mainstream models such as DINOv3, EUPE, iJEPA, MAE, MoCov3, and SDVAE. All original data rights belong to their respective owners, and the preprocessing and packaging layers follow the CC BY-NC 4.0 license.
数据集概述
RAEv2 Data 是专为 RAEv2(Representation Autoencoders 改进基线)项目预处理的数据集和编码器集合。所有数据版权归原始所有者,具体归属见各子集说明。
数据集结构
数据以 256x256 分辨率预处理,仓库目录如下:
imagenet-256/:ImageNet-1k 数据(Arrow 格式)blip3o-256/:BLIP3o 图像-描述对(WDS 格式)render-text-256/:渲染文本图像(WDS 格式)scale-rae-256/:合成 FLUX 图像(WDS 格式)recon-256/:机器人导航帧(WDS 格式)pretrained_models/:预训练视觉编码器和 SDVAE 权重
各子集详情
| 子集 | 任务 | 来源 | 格式 | 备注 |
|---|---|---|---|---|
| imagenet-256 | ImageNet | ImageNet | Arrow | 可替换为自有 ImageNet 数据 |
| blip3o-256 | 文生图(T2I) | BLIP3o | WDS | 图像-描述配对数据 |
| render-text-256 | 文生图(T2I) | RenderedText | WDS | 渲染文本图像 |
| scale-rae-256 | 文生图(T2I) | Scale-RAE | WDS | 合成 FLUX 图像 |
| recon-256 | 世界模型导航(NWM) | RECON | WDS | 机器人导航帧 |
预训练模型
包含 RAEv2 使用的预训练视觉编码器和分词器权重(DINOv3、EUPE、iJEPA、MAE、MoCov3、SDVAE),所有权归原始作者。
许可与归属
- 上游数据适用其原始许可条款。
- 本仓库的打包层依据 RAEv2 代码库的 CC BY-NC 4.0 许可发布。




