遇见数据集

bulk-cc12m-features

收藏
Hugging Face2026-07-31 更新2026-08-01 收录
官方服务:

资源简介:

bulk-cc12m-features 是一个为 CLIP 蒸馏研究设计的预计算图像特征数据集。它包含了来自两个教师模型——CLIP ViT-B/16(LAION-2B 训练)和 SigLIP base-patch16-384——对 CC12M 数据集中 10,968,539 张图像提取的图像塔特征。CLIP 特征为 512 维,SigLIP 特征为 768 维,均以 fp16 格式存储且未归一化。数据集还包含了每张图像对应的原始描述文本(caption),其中 CLIP 配置包含 caption,SigLIP 配置可通过 key 与 CLIP 配置关联。数据总大小约 30 GB,远小于原始图像(1.18 TB)。每个塔的特征以两种形式提供:紧凑的 fp16 .pt 文件(2,176 个,与源 WDS 分片编号一致)和合并的 parquet 文件(64 个,便于通过 datasets 库加载)。使用示例展示了如何通过 huggingface_hub 下载 .pt 文件并获取特征和 caption。该数据集旨在减少蒸馏计算开销,学生模型无需对教师进行推理即可训练。数据来源于 pixparse/cc12m-wds 镜像,遵循 Google Conceptual 12M 的许可条款,仅限研究用途。

bulk-cc12m-features is a dataset of precomputed image features designed for CLIP distillation research. It contains image tower features extracted from two teacher models—CLIP ViT-B/16 (trained on LAION-2B) and SigLIP base-patch16-384—for 10,968,539 images from the CC12M dataset. CLIP features are 512-dimensional and SigLIP features are 768-dimensional, both stored in fp16 format without normalization. The dataset also includes the original caption for each image; the CLIP configuration contains captions, while the SigLIP configuration can be linked to CLIP via keys. The total data size is approximately 30 GB, significantly smaller than the original images (1.18 TB). Features for each tower are provided in two formats: compact fp16 .pt files (2,176 files, corresponding to source WDS shard indices) and merged parquet files (64 files for easy loading via the datasets library). Usage examples demonstrate how to download .pt files and retrieve features and captions via huggingface_hub. The dataset aims to reduce distillation computational overhead, allowing student models to train without needing to run inference on the teacher. The data originates from the pixparse/cc12m-wds mirror and is subject to the Google Conceptual 12M license terms, for research purposes only.

创建时间:
2026-07-27
原始信息汇总

bulk-cc12m-features 数据集概述

基本信息

  • 数据集名称: bulk-cc12m-features
  • 数据规模: 约1.1亿特征向量(100M<n<1B)
  • 数据来源: CC12M数据集的10,968,539张图像(覆盖全部2,176个分片)
  • 许可证: 自定义许可证(cc12m-derived),遵循Google Conceptual 12M的条款
  • 用途: 面向知识蒸馏研究,提供预计算图像塔特征

核心内容

该数据集包含十个独立教师模型的预计算特征一个派生共识目标

配置 教师模型 维度 特征空间
clip_b16_laion2b CLIP ViT-B/16 (LAION-2B) 512 CLIP投影
clip_b16_openai CLIP ViT-B/16 (OpenAI) 512 CLIP投影
clip_b32_openai CLIP ViT-B/32 (OpenAI) 512 CLIP投影
clip_b32_laion2b CLIP ViT-B/32 (LAION-2B) 512 CLIP投影
clip_b32_datacomp CLIP ViT-B/32 (DataComp-XL) 512 CLIP投影
clip_l14_openai CLIP ViT-L/14 (OpenAI) 768 CLIP投影
clip_l14_laion2b CLIP ViT-L/14 (LAION-2B) 768 CLIP投影
clip_l14_datacomp CLIP ViT-L/14 (DataComp-XL) 768 CLIP投影
siglip_b16_384 SigLIP base-384 768 SigLIP投影
dinov3_l16 DINOv3 ViT-L/16 1024 CLS隐藏状态
consensus_gpa 派生——五个B级CLIP塔的GPA均值 512 共识空间(已预归一化)

技术特点

  • 存储格式: 所有提取的塔均以fp16格式存储,且未归一化(加载时需进行L2归一化);consensus_gpa例外,已归一化
  • 键连接: 所有塔覆盖完全相同的键集,但不同塔之间行顺序不同,必须通过键(key)进行连接,不能按位置连接
  • 共识目标: consensus_gpa为派生目标,通过广义普氏分析(GPA)对五个B级CLIP塔进行对齐和均值计算,已发布的学生模型基于此目标训练

数据形式

形式 路径 说明
Parquet {config}/train-*.parquet(64个文件) 支持数据集查看器、load_dataset和流式加载
分片 {config}/features_0000.pt … features_2175.pt 与源WDS分片1:1对应,fp16紧凑格式
拼接 {config}/all_concat.pt 整个塔保存在单一张量中(包含键和嵌入)

十个提取塔支持全部三种形式;consensus_gpa仅有Parquet和拼接形式。

预处理细节

各塔的预处理策略不同:

  • CLIP B/16、B/32、L/14(OpenAI + DataComp): 短边Resize(224) + 中心裁剪,使用CLIP均值/标准差
  • clip_l14_laion2b: 与上述几何变换相同,但使用均值/标准差0.5(其open_clip配置明确声明)
  • siglip_b16_384: Resize(384,384)双三次扭曲,无裁剪,使用均值/标准差0.5
  • dinov3_l16: Resize(224,224)双线性扭曲,使用ImageNet均值/标准差

其他关键常量:CLIP塔使用普通GELU而非QuickGELU,fp32计算;CLIP/SigLIP读取get_image_features(CLS→视觉投影),DINOv3读取CLS。

数据质量

  • 提取时间:2026-07-27至07-31,主塔为8.1小时流式处理
  • 零解码错误、零下载失败(覆盖全部2,176个分片)
  • 进行完整库完整性检查:所有文件可加载,键/标题/嵌入计数一致,无非有限值
  • 每个分片包含5,040-5,041个样本

使用说明

python from datasets import load_dataset ds = load_dataset("AbstractPhil/bulk-cc12m-features", "clip_l14_laion2b", split="train", streaming=True) row = next(iter(ds)) # {key, features: [768 floats]}

正确的行对齐方式: python order = {k: i for i, k in enumerate(tower_a["keys"])} b_aligned = tower_b["emb"][[order[k] for k in tower_b["keys"]]]

许可说明

该数据集包含派生特征和标题,而非图像。CC12M图像仍归其所有者所有;标题和底层URL列表来自Google的Conceptual 12M。供研究用途使用。

二维码
社区交流群
二维码
科研交流群
商业服务