遇见数据集

LAXMAYDAY/pdm-pae-dinov2l-d32-imagenet256-train-full

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于PDM项目的PAE潜在缓存,包含从ImageNet-1k训练集(经过256x256 ADM风格裁剪)提取的DINOv2-L d32潜在表示。缓存包含1,281,167个样本,每个样本的潜在张量形状为[32, 16, 16],总大小为41.992 GB,以safetensors格式存储,分为313个分片。数据文件包含标签、潜在表示及其翻转版本。这是一个从ImageNet-1k训练图像派生的潜在缓存,使用时需遵守上游ImageNet条款及相关模型许可。

This dataset is a PAE latent cache for the PDM project, containing DINOv2-L d32 latent representations extracted from the ImageNet-1k training set (cropped in 256×256 ADM-style). The cache holds 1,281,167 samples, each with a latent tensor shape of [32, 16, 16], with a total size of 41.992 GB. It is stored in safetensors format and split into 313 shards. The data files include labels, latent representations, and their flipped versions. This is a latent cache derived from ImageNet-1k training images, and its use must comply with the upstream ImageNet terms and relevant model licenses.

提供机构:
LAXMAYDAY
搜集汇总
数据集介绍
LAXMAYDAY/pdm-pae-dinov2l-d32-imagenet256-train-full 数据集图片
构建方式
本数据集是面向图像生成任务中潜在特征缓存需求的产物,基于PAE(Probabilistic Autoencoder)框架与DINOv2-L视觉表征模型构建而成。具体而言,数据集的构建以ImageNet-1k训练集为源头,采用ADM风格裁剪技术将所有图像统一缩放至256×256分辨率,随后通过PAE编码器提取潜在表示,形成维度为[32, 16, 16]的潜在张量。整个处理过程生成了313个分片文件,共计1,281,167个样本,并以safetensors格式存储,同时提供了水平翻转后的潜在特征变体,作为数据增强的补充。
特点
该数据集的核心特点在于其高度工程化的潜在特征缓存设计,显著提升了大规模图像生成模型训练的效率。每个样本的潜在张量形状统一,便于批量加载与并行计算;数据集包含丰富的元数据,如分片级别的样本数量与张量维度记录,以及完整的构建溯源信息,包括PAE配置与提交版本哈希。此外,数据集还集成了数据增强所需的翻转潜在特征,减少训练时的重复计算开销。
使用方法
使用者可直接通过safetensors库加载数据分片,利用提供的shard键获取标签、潜在特征及翻转潜在特征张量。推荐在模型训练脚本中按分片索引循环读取,并结合缓存摘要文件合理分配计算资源。需注意,本数据集为派生潜在缓存,不包含原始ImageNet图像,使用时应遵循上游ImageNet的使用条款及模型许可协议。
背景与挑战
背景概述
PDM PAE DINOv2-L d32 ImageNet-256 Train Latent Cache数据集由PDM研究团队于近期构建,依托DINOv2-L这一强大的自监督视觉特征提取模型,结合PAE(Probabilistic Autoencoder)技术,为大规模图像潜在表示学习提供了高效的数据支撑。该数据集的核心研究对象为ImageNet-1k训练集中经过256×256 ADM风格裁剪的图像,旨在生成紧凑的潜在缓存(latent cache),从而服务于下游生成模型(如扩散模型)的训练与推理。通过将每张图像编码为尺寸[32,16,16]的潜在张量,该数据集在保持丰富语义信息的同时显著降低了存储与计算开销。其发布填补了高效潜在缓存在高分辨率图像生成领域的空白,推动了图像生成与表示学习交叉方向的发展,对提升模型训练效率与资源利用具有重要影响。
当前挑战
该数据集着力解决两大领域核心挑战:其一,图像生成模型在处理高分辨率数据集(如ImageNet-256)时,原始像素空间的巨大维度导致训练周期冗长、显存占用高昂,严重制约了模型迭代速度与可扩展性。数据集通过预计算并存储低维潜在表示,实现了训练阶段对图像特征的高效复用,从根本上缓解了这一瓶颈。其二,在构建过程中,团队面临如何保证潜在表示空间对原始图像信息的高保真压缩,避免过度离散化或语义丢失的难题。此外,来自不同来源的数据后处理版本需与上游ImageNet许可及模型使用条款保持合规,同时确保大规模数据分片(313个分片)的完整性与一致性,以及通过本地完整性校验(如full-train状态与smoke4096门控测试)保障缓存质量,这些均构成了构建阶段的重要挑战。
常用场景
经典使用场景
该数据集是PAE(Pseudo-AutoEncoder)与DINOv2-L大模型深度融合的产物,为ImageNet-1K训练集在256×256分辨率下提供了高效的潜变量缓存。其经典使用场景在于加速大规模图像生成与表征学习模型的训练流程——研究人员可直接加载预计算的PAE潜变量及数据增强翻转版本,无需重复执行高成本的前向推理步骤,从而显著缩短实验迭代周期。这些32通道的紧凑潜变量编码保留了语义丰富的视觉特征,特别适用于扩散模型、自回归生成模型及对比学习框架中的高效训练环节。
实际应用
在实际应用层面,该数据集为工业级图像生成系统(如高分辨率纹理合成、风格迁移工具)提供了即插即用的高效训练基础。通过预置的PAE潜变量与标签映射,开发者可以快速微调扩散模型或变分自编码器,从而在GPU资源受限的边缘设备上实现接近实时的高质量图像生成。此外,其64翻转增强机制天然适配数据扩充需求,在医学影像分析、遥感图像修复等对标注数据敏感的领域,可被改造为低资源快速原型的基石模块。
衍生相关工作
该数据集的发布催生了一系列衍生研究方向:一方面,基于其潜变量缓存框架,研究者提出了适配不同编码器(如CLIP、SAM)的通用缓存协议,形成了多模态潜特征生态;另一方面,围绕该缓存的可压缩性与传输效率,衍生出稀疏化潜编码、量化压缩感知等优化策略,进一步降低了存储和加载开销。此外,该缓存机制已被整合到部分开源扩散训练库(如Hugging Face Diffusers),作为标准预处理流水线的核心组件,推动了生成模型训练流程的标准化与可复现性建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务