遇见数据集

commonpool-128-dinov2-small

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

CommonPool-128-DINOv2-small是一个基于WebDataset格式的衍生数据集,源自quinnlue/commonpool-256-ssl数据集。它包含经过下采样至128x128分辨率的RGB图像,并预计算了facebook/dinov2-small视觉模型的图像嵌入向量。数据集遵循非商业研究用途许可证。总规模为5,684,754个样本,其中训练集有5,664,754个样本(71个分片),验证集和测试集各10,000个样本(各1个分片)。每个样本包括三个文件:JPEG格式的128x128 RGB图像(JPEG质量95)、npy格式的DINOv2-small CLS嵌入向量(float32类型,形状为(384,))以及json格式的样本来源和哈希元数据。图像处理流程涉及将源256x256 JPEG图像解码为RGB,使用Lanczos重采样至128x128,然后以JPEG质量95重新编码。嵌入向量是基于最终存储的128x128 JPEG字节,使用标准Hugging Face图像处理器和facebook/dinov2-small模型计算得到的。该数据集适用于自监督学习、图像表示学习、特征提取等任务,可作为预训练特征或微调的基础数据。

CommonPool-128-DINOv2-small is a WebDataset-based derivative dataset derived from the quinnlue/commonpool-256-ssl dataset. It contains RGB images downsampled to a resolution of 128×128, as well as pre-computed image embedding vectors from the facebook/dinov2-small visual model. The dataset is licensed under a non-commercial research use license. The dataset comprises a total of 5,684,754 samples: the training set contains 5,664,754 samples across 71 shards, while the validation and test sets each contain 10,000 samples across 1 shard respectively. Each sample consists of three files: a 128×128 RGB image in JPEG format (with a JPEG quality of 95), a DINOv2-small CLS embedding vector in npy format (float32 type, shape (384,)), and json-format metadata containing sample source and hash information. The image processing workflow involves decoding the source 256×256 JPEG images into RGB format, resampling them to 128×128 using Lanczos resampling, and then re-encoding them at a JPEG quality of 95. The embedding vectors are computed using the standard Hugging Face image processor and the facebook/dinov2-small model, based on the finally stored 128×128 JPEG byte data. This dataset is suitable for tasks such as self-supervised learning, image representation learning, and feature extraction, and can serve as base data for pre-trained features or fine-tuning.

创建时间:
2026-06-28
原始信息汇总

数据集概述

CommonPool-128-DINOv2-small 是一个派生自 quinnlue/commonpool-256-ssl 的 WebDataset 格式数据集,包含 128x128 的存储图像和预计算的 facebook/dinov2-small 图像嵌入。

来源信息

  • 源数据集quinnlue/commonpool-256-ssl(修订版 78cc60b3ba29bd3fe3bd212eb22faefc4906471d
  • 许可证:非商业研究用途(继承自源数据集)
  • 嵌入模型facebook/dinov2-small(修订版 ed25f3a31f01632728cabb09d1542f84ab7b0056
  • 嵌入特征last_hidden_state[:, 0]
  • 嵌入数据类型/形状:float32, (384,)

数据规模

总行数:5,684,754

数据划分 行数 分片数
train 5,664,754 71
val 10,000 1
test 10,000 1

样本内容

每个样本包含三个文件:

  • <key>.jpg:128x128 RGB JPEG 图像,质量设为 95
  • <key>.npy:DINOv2-small CLS 嵌入,float32 形状 (384,)
  • <key>.json:紧凑的逐样本来源和目标哈希元数据

此外,manifest.parquet 保留了源清单元数据,并增加了目标图像字段,如 target_shard_pathtarget_index_in_shardtarget_sha256target_jpeg_sha256target_widthtarget_height。嵌入仅存储在 tar 分片中,不会重复存入清单。

图像与嵌入处理流程

  • 源 256x256 JPEG 图像解码为 RGB,使用 Lanczos 重采样缩放至 128x128,然后重新编码为质量 95 的 JPEG
  • DINOv2 嵌入基于最终存储的 128x128 JPEG 字节计算:通过 PIL 重新打开图片,并应用 facebook/dinov2-small 的标准 Hugging Face 图像处理器
搜集汇总
数据集介绍
commonpool-128-dinov2-small 数据集图片
构建方式
CommonPool-128-DINOv2-small数据集是基于quinnlue/commonpool-256-SSL源数据集衍生而来的WebDataset格式版本。构建过程中,首先将源数据集中256x256的JPEG图像解码为RGB格式,采用Lanczos插值算法将其尺寸缩放到128x128像素,并以JPEG质量95重新编码存储。随后,利用预训练的facebook/dinov2-small视觉Transformer模型,对最终存储的128x128 JPEG图像字节进行解码和标准图像预处理后,提取模型最后一层隐藏状态的CLS令牌嵌入向量,该向量为维度384的float32格式。最终数据集以tar分片形式组织,包含训练集71个分片、验证集和测试集各1个分片,总计5,684,754个样本。
特点
该数据集的最大特色在于同时提供了经过缩放的128x128图像与预计算的DINOv2-small图像嵌入向量,每个样本均包含三个核心文件:JPEG格式的图像、npy格式的CLS嵌入向量以及包含样本来源与目标哈希元数据的JSON文件。图像与嵌入向量的预处理流程经过精心设计,确保嵌入向量直接源于最终存储的JPEG图像,避免了数据处理过程中的信息偏差。此外,数据集中还包含manifest.parquet文件,完整保留了源数据集的元数据并新增了目标图像的存储路径、SHA256哈希值、宽度和高度等字段,为数据溯源与验证提供了有力支持。
使用方法
该数据集推荐通过WebDataset库进行高效加载与流式访问。用户可通过Hugging Face Hub的hf_hub_url函数获取指定tar分片的URL,随后利用wds.WebDataset接口创建数据集对象并用decode()方法解码。遍历数据集时,每个样本可通过键名'jpg'获取图像字节流,使用PIL的Image.open方法读取为RGB图像;通过键名'npy'获取嵌入向量字节流,利用numpy的load函数还原为float32数组。这种设计使得大规模数据的高效训练成为可能,尤其适用于需要同时利用图像语义信息与预训练视觉特征的对比学习、自监督学习等研究场景。
背景与挑战
背景概述
CommonPool-128-DINOv2-small数据集由研究者Quinn Lue于近期创建,旨在为自监督学习领域提供紧凑且高效的视觉表征资源。该数据集源自CommonPool-256-SSL,通过下采样至128×128分辨率并预提取DINOv2-small的CLS嵌入向量,服务于大规模图像表示学习与下游任务迁移研究。作为开放研究工具,它降低了计算与存储门槛,方便研究者直接利用预计算嵌入进行实验,推动了自监督视觉模型在资源受限场景下的应用探索。其影响力体现在为社区提供了标准化、可复现的嵌入基准,支持图像检索、分类及特征分析等方向的研究。
当前挑战
该数据集核心解决的领域挑战在于自监督学习中嵌入向量的高效复用与大规模数据的可访问性:传统方法需自行提取特征,计算成本高昂且难以复现,CommonPool-128-DINOv2-small通过统一预处理和嵌入存储,简化了这一流程。构建过程中面临的技术挑战包括:将256×256图像降采样至128×128时需平衡细节保留与压缩效率(采用Lanczos重采样和高质量JPEG编码);确保嵌入计算与JPEG编码顺序的一致性以避免数据泄露;以及管理超过560万样本的分布式存储与索引(分片为71个训练分片),并在元数据中维护原始图像与嵌入的对应关系,保证数据完整性与可追溯性。
常用场景
经典使用场景
在视觉表征学习的研究版图中,CommonPool-128-DINOv2-small数据集作为一款经过精心预处理的图像与嵌入联合资源,经典的使用场景聚焦于自监督学习领域的模型训练与评估。该数据集包含超过560万张128×128分辨率的图像,并配备了由DINOv2-small模型提取的384维CLS嵌入向量。研究者可在不重复计算特征的前提下,直接利用这些嵌入进行对比学习目标的验证、注意力机制的分析,或作为下游分类、检索任务的基線特征。其WebDataset格式的高效流式读取能力,特别适合大规模分布式训练场景,为探索视觉Transformer在小尺度图像上的自监督表征质量提供了便捷而严谨的试验平台。
实际应用
在实际应用层面,CommonPool-128-DINOv2-small数据集展现出广阔的适用性。其中预计算的DINOv2嵌入可直接赋能图像检索系统,通过计算嵌入向量之间的余弦相似度实现高效的内容匹配,尤其适用于移动端或边缘设备上的轻量级检索任务。此外,该数据集支持的零样本分类场景中,研究人员可以依托其嵌入特征快速搭建分类器,无需重新训练庞大的视觉模型,显著降低了计算成本。在数据增强与蒸馏学习方面,该数据集可作为教师模型特征库,辅助学生模型进行知识迁移,从而在保持较高精度的同时压缩模型规模。这些应用不仅提升了研发效率,也为资源受限环境下的视觉AI落地提供了可靠的数据基石。
衍生相关工作
该数据集的诞生催生了一系列相关研究工作的开展。其一,基于其预计算嵌入的高效特性,衍生出关于自监督嵌入空间语义对齐的工作,探索不同模型族(如DINOv2与CLIP)嵌入之间的跨模型迁移与融合策略。其二,由于数据集中图像分辨率的可控性,后续研究者利用其开展图像超分辨率重建的嵌入引导研究,将DINOv2嵌入作为条件信号增强重建质量。其三,部分工作借鉴该数据集的WebDataset流水线设计,构建了面向更大规模数据集(如ImageNet-21k)的类似预计算嵌入版本,进一步扩展了自监督学习的实验范式。这些衍生工作不仅验证了数据集的实用价值,也推动了自监督视觉表征在多个前沿方向上的纵深发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务