apple/DataCompDR-1B
收藏资源简介:
DataCompDR-1B是一个图像-文本数据集,是对DataComp数据集的增强。通过多模态数据集增强策略,生成了DataCompDR-1B和DataCompDR-12M两个版本。数据集包含合成标题、嵌入和元数据,这些元数据是通过在DataComp-1B上使用预训练的图像-文本模型生成的。每个图像生成5个合成标题,并使用两个强大的教师模型计算增强图像以及真实和合成标题的嵌入。数据集的结构包括图像URL、合成标题、增强参数、图像嵌入和文本嵌入等字段。
DataCompDR-1B是一个图像-文本数据集,是对DataComp数据集的增强。通过多模态数据集增强策略,生成了DataCompDR-1B和DataCompDR-12M两个版本。数据集包含合成标题、嵌入和元数据,这些元数据是通过在DataComp-1B上使用预训练的图像-文本模型生成的。每个图像生成5个合成标题,并使用两个强大的教师模型计算增强图像以及真实和合成标题的嵌入。数据集的结构包括图像URL、合成标题、增强参数、图像嵌入和文本嵌入等字段。
数据集概述
数据集名称: DataCompDR-1B
数据集描述: DataCompDR-1B是一个增强版的图像-文本数据集,旨在通过多模态数据增强策略强化原始的DataComp数据集。该数据集通过使用预训练的图像-文本模型生成合成标题、嵌入和元数据。每个图像生成5个合成标题,并计算增强图像以及真实和合成标题的嵌入。
数据集特征:
- url.txt: 图像URL,数据类型为字符串。
- syn.json: 包含合成文本的结构,其中
syn_text是一个字符串列表。 - paug.json: 包含参数增强的结构,其中
param_aug是一个字符串。 - npz: 包含图像和文本嵌入的结构,其中
image_emb和text_emb都是浮点数列表的列表。 - json: 包含元数据的结构,其中
uid和sha256都是字符串。
任务类别:
- 文本到图像
- 图像到文本
语言: 英语
许可证: 自定义Apple许可证,详细信息可在此处查看。
数据集用途:
- 用于训练图像-文本模型,显示出比标准CLIP训练更高的学习效率。
- 在单个节点上使用8×A100 GPUs,通过在DataCompDR-12M上训练ViT-B/16基础的CLIP,可以在大约一天内达到61.7%的零样本分类准确率。
数据集结构:
- 每个样本包括一个随机增强的图像、一个真实标题和一个随机选择的合成标题。
引用信息: bibtex @InProceedings{mobileclip2024, author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel}, title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training}, booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)}, month = {June}, year = {2024}, }




