apple/DataCompDR-12M
收藏资源简介:
DataCompDR-12M是一个图像-文本数据集,是DataComp数据集的增强版。通过多模态数据集强化策略,我们生成了DataCompDR-1B和DataCompDR-12M,分别强化了DataComp-1B(BestPool过滤)和12.8M样本的均匀子集。我们使用OpenCLIP中的`coca_ViT-L-14`模型为每张图像生成5个合成标题,并进行强随机图像增强(DataCompDR-1B为10次,DataCompDR-12M为30次)。我们计算了两个强教师模型(`ViT-L-14`和OpenCLIP中的openai)在增强图像以及真实和合成标题上的嵌入。嵌入是1536维的,由2x768维向量连接而成。DataCompDR中的一个样本是一个随机增强的图像、一个真实标题和一个随机选取的合成标题的三元组。
DataCompDR-12M是一个图像-文本数据集,是DataComp数据集的增强版。通过多模态数据集强化策略,我们生成了DataCompDR-1B和DataCompDR-12M,分别强化了DataComp-1B(BestPool过滤)和12.8M样本的均匀子集。我们使用OpenCLIP中的`coca_ViT-L-14`模型为每张图像生成5个合成标题,并进行强随机图像增强(DataCompDR-1B为10次,DataCompDR-12M为30次)。我们计算了两个强教师模型(`ViT-L-14`和OpenCLIP中的openai)在增强图像以及真实和合成标题上的嵌入。嵌入是1536维的,由2x768维向量连接而成。DataCompDR中的一个样本是一个随机增强的图像、一个真实标题和一个随机选取的合成标题的三元组。
数据集概述
数据集名称: DataCompDR-12M
数据集描述: DataCompDR-12M是一个增强版的图像-文本数据集,通过对原始DataComp数据集进行多模态数据增强策略的强化而创建。该数据集包含合成标题、嵌入和元数据,用于训练和评估图像-文本相关的模型。
数据集特点:
- 合成标题生成: 每张图像生成5个合成标题,使用
coca_ViT-L-14模型。 - 图像增强: 对图像进行强随机增强,DataCompDR-12M中每张图像进行30次增强。
- 嵌入计算: 使用两个强教师模型(
ViT-L-14与datacomp_xl_s13b_b90k和openai预训练权重)计算增强图像、真实和合成标题的嵌入。 - 嵌入维度: 1536维,由2个768维向量串联而成。
数据集结构:
- url.txt: 图像URL(字符串)
- syn.json: 合成文本列表(列表[字符串])
- paug.json: 增强参数列表(列表[列表[联合[整数,浮点数]]])
- npz: 图像和文本嵌入列表(列表[列表[浮点数]])
- json: 图像-文本样本的UID和SHA256哈希(字符串)
许可证: 自定义Apple许可证
语言: 英语
任务类别: 文本到图像、图像到文本
数据集使用
训练效果:
- 使用DataCompDR-12M进行训练,在单节点8×A100 GPU配置下,一天内可达到61.7%的零样本分类准确率。
- 与标准CLIP训练相比,DataCompDR显示出显著的学习效率提升。
引用信息
bibtex @InProceedings{mobileclip2024, author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel}, title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training}, booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)}, month = {June}, year = {2024}, }




