遇见数据集

RAEv2-data

收藏
Hugging Face2026-05-27 更新2026-05-28 收录
官方服务:

资源简介:

RAEv2数据集是为论文《Improved Baselines with Representation Autoencoders》(RAEv2)准备的预处理数据集和预训练编码器集合。该数据集包含五个经过统一预处理至256x256分辨率的子集,适用于文本到图像生成和无条件图像生成等任务。具体子集包括:1) imagenet-256:基于ImageNet-1k数据集的标准图像分类数据;2) blip3o-256:使用BLIP3o模型标注的图像-文本对数据集,包含视觉描述;3) render-text-256:渲染文本图像数据集,包含合成生成的文本视觉内容;4) scale-rae-256:基于FLUX模型生成的合成图像数据集;5) recon-256:机器人导航帧数据集,包含机器人视角的导航场景图像。数据集采用Arrow和WebDataset(WDS)两种格式存储,以确保高效加载。此外,还提供了RAEv2模型使用的预训练视觉编码器和分词器权重,包括DINOv3、EUPE、iJEPA、MAE、MoCov3和SDVAE等主流模型。所有原始数据权利归属于相应所有者,预处理和打包层遵循CC BY-NC 4.0许可证。

The RAEv2 dataset is a preprocessed dataset and collection of pretrained encoders prepared for the paper Improved Baselines with Representation Autoencoders (RAEv2). It includes five subsets uniformly preprocessed to 256x256 resolution, suitable for tasks such as text-to-image generation and unconditional image generation. Specific subsets are: 1) imagenet-256: standard image classification data based on the ImageNet-1k dataset; 2) blip3o-256: an image-text pair dataset annotated using the BLIP3o model, containing visual descriptions; 3) render-text-256: a rendered text image dataset with synthetically generated text visual content; 4) scale-rae-256: a synthetic image dataset generated based on the FLUX model; 5) recon-256: a robot navigation frame dataset containing navigation scene images from a robots perspective. The dataset is stored in both Arrow and WebDataset (WDS) formats to ensure efficient loading. Additionally, it provides pretrained vision encoder and tokenizer weights used by the RAEv2 model, including mainstream models such as DINOv3, EUPE, iJEPA, MAE, MoCov3, and SDVAE. All original data rights belong to their respective owners, and the preprocessing and packaging layers follow the CC BY-NC 4.0 license.

创建时间:
2026-05-15
原始信息汇总

数据集概述

RAEv2 Data 是专为 RAEv2(Representation Autoencoders 改进基线)项目预处理的数据集和编码器集合。所有数据版权归原始所有者,具体归属见各子集说明。

数据集结构

数据以 256x256 分辨率预处理,仓库目录如下:

  • imagenet-256/:ImageNet-1k 数据(Arrow 格式)
  • blip3o-256/:BLIP3o 图像-描述对(WDS 格式)
  • render-text-256/:渲染文本图像(WDS 格式)
  • scale-rae-256/:合成 FLUX 图像(WDS 格式)
  • recon-256/:机器人导航帧(WDS 格式)
  • pretrained_models/:预训练视觉编码器和 SDVAE 权重

各子集详情

子集 任务 来源 格式 备注
imagenet-256 ImageNet ImageNet Arrow 可替换为自有 ImageNet 数据
blip3o-256 文生图(T2I) BLIP3o WDS 图像-描述配对数据
render-text-256 文生图(T2I) RenderedText WDS 渲染文本图像
scale-rae-256 文生图(T2I) Scale-RAE WDS 合成 FLUX 图像
recon-256 世界模型导航(NWM) RECON WDS 机器人导航帧

预训练模型

包含 RAEv2 使用的预训练视觉编码器和分词器权重(DINOv3、EUPE、iJEPA、MAE、MoCov3、SDVAE),所有权归原始作者。

许可与归属

  • 上游数据适用其原始许可条款。
  • 本仓库的打包层依据 RAEv2 代码库的 CC BY-NC 4.0 许可发布。
搜集汇总
数据集介绍
RAEv2-data 数据集图片
构建方式
RAEv2-data数据集专为表征自编码器(RAEv2)的预训练与评估而构建,整合了多个来源的高质量图像数据。其构建过程涉及将原始数据统一预处理至256x256分辨率,并针对不同下游任务组织了五个子集:imagenet-256源自ImageNet-1k,用于无条件图像生成;blip3o-256来自BLIP3o,包含文本-图像配对;render-text-256源自RenderedText,聚焦于渲染文本图像;scale-rae-256利用合成FLUX图像以扩充训练规模;recon-256则采集自机器人导航框架,服务于世界模型训练。数据格式上,imagenet-256采用Arrow格式以支持高效读取,其余子集均采用WebDataset(WDS)格式,便于大规模流式加载。此外,数据集还附带了RAEv2所需的预训练视觉编码器与SDVAE分词器权重,确保了一站式的开箱即用体验。
特点
该数据集的一个显著特点是其多元性与模块化设计,涵盖了ImageNet分类、文本到图像生成、字符渲染、合成图像增强及机器人场景理解等多种任务,为表征学习提供了丰富的视觉上下文。每个子集均以统一分辨率标准化处理,大幅降低了数据预处理的重复成本。尤其值得注意的是,blip3o-256与scale-rae-256子集分别引入了文本引导的隐空间对齐与大尺度合成数据,有效拓展了原始数据分布,对提升生成模型在长尾场景下的鲁棒性具有重要贡献。另外,数据集提供了灵活的下载策略,用户可根据研究需求仅获取特定子集,避免了不必要的数据传输开销。所有数据均遵循原始所有者的版权许可,而封装层则在CC BY-NC 4.0协议下发布,兼顾了学术友好性与版权合规性。
使用方法
使用RAEv2-data时,用户可通过Hugging Face的`hf download`命令行工具快速获取数据。推荐将所有子集下载至`data/`目录下以保持RAEv2代码库的默认路径结构,命令为`hf download nanovisionx/RAEv2-data --local-dir data/`。若只需特定子集,可取消对应行的注释,例如使用`--include "imagenet-256/**"`仅下载ImageNet数据。预训练模型权重可通过`--include "pretrained_models/**"`单独获取。数据集加载时,需要根据子集格式选择合适的工具:Arrow格式的数据可直接通过Hugging Face Datasets库读取,而WDS格式的数据则建议使用WebDataset库配合PyTorch的DataLoader进行流式训练。对于RAEv2的原生训练流程,项目仓库已内置了与这些子集对应的数据加载器配置,用户仅需确保本地数据存放路径与之匹配即可无缝启动训练或微调。
背景与挑战
背景概述
RAEv2-data数据集由Singh等研究人员于2026年创建,隶属于RAEv2项目,旨在为表征自编码器提供经过预处理的训练数据与预训练编码器。该数据集整合了来自ImageNet、BLIP3o、RenderedText、Scale-RAE及RECON等多个来源的256×256分辨率图像,覆盖文本到图像生成、无条件图像生成及机器人导航帧等任务,为扩散模型和表征学习研究提供了标准化的数据支撑。其发布显著推动了视觉表征学习领域的发展,尤其在提升潜在扩散模型生成质量与效率方面具有重要影响力。
当前挑战
RAEv2-data所面对的领域挑战在于,扩散模型在生成高保真图像时往往依赖大规模、多样化的训练数据,而现有数据集在语义对齐、场景覆盖及数据一致性上存在瓶颈。构建过程中,研究者需克服多源异构数据的标准化难题,包括将不同分辨率、格式与标注方式的图像统一为256×256大小并转换为Arrow或WDS格式,同时平衡合成图像与真实图像的分布差异,确保训练数据的代表性与鲁棒性。
常用场景
经典使用场景
在视觉表征学习与生成式模型交叉领域,RAEv2-data作为支撑表征自编码器训练与评估的核心数据集,经典使用场景集中于扩散模型骨干网络的预训练与微调。该集合囊括了ImageNet-1k语义分类图像、BLIP3o图文对数据、渲染文本图像、合成FLUX图像以及机器人导航帧等多源异构数据,为表征自编码器提供了丰富的视觉先验。研究者可借助各子集分别完成从类别识别到文本条件生成、从文字渲染到场景重建的跨越式训练,从而系统性提升隐空间表征的泛化能力。
解决学术问题
RAEv2-data有针对性地解决了扩散模型在隐空间表征学习中的两大核心瓶颈:一是如何获得高质量、多场景的预训练数据以提升表征的鲁棒性,二是如何在不同模态和任务间统一隐空间结构以避免过拟合。通过整合语义分类、图文生成、文字渲染、机器导航等多源数据,该数据集推动了表征自编码器从单一视觉域向跨域迁移的学术演进,显著增强了模型在小样本、零样本及分布外场景下的表现,为构建更高效、更通用的生成式基座模型奠定了数据基础。
衍生相关工作
围绕RAEv2-data衍生的经典工作涵盖表征自编码器改进(如RAEv2)、跨模态生成模型优化以及视觉基座模型的轻量化研究。该数据集为Diffusion Transformers与表征混合架构的融合提供了标准化的训练与评估基准,催生了诸如Scale-RAE等大规模合成数据生成流水线。同时,基于该数据集的预训练编码器(如DINOv3、EUPE)被广泛迁移至下游细分任务,推动了视觉表征学习在低资源场景下的生态扩展,相关成果在CVPR、ICLR等顶会中持续涌现。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务