apple/DataCompDR-12M-bf16
收藏资源简介:
DataCompDR-12M-BFloat16数据集是DataComp数据集的增强版本,包含合成标题、嵌入和元数据。该数据集通过多模态数据集增强策略生成,使用OpenCLIP模型生成每张图像的5个合成标题,并计算增强图像和真实/合成标题的嵌入。数据集结构包括图像URL、合成标题、增强参数、图像和文本嵌入等信息。数据集主要用于训练CLIP模型,展示了显著的学习效率提升。
DataCompDR-12M-BFloat16数据集是DataComp数据集的增强版本,包含合成标题、嵌入和元数据。该数据集通过多模态数据集增强策略生成,使用OpenCLIP模型生成每张图像的5个合成标题,并计算增强图像和真实/合成标题的嵌入。数据集结构包括图像URL、合成标题、增强参数、图像和文本嵌入等信息。数据集主要用于训练CLIP模型,展示了显著的学习效率提升。
数据集概述
数据集名称: DataCompDR-12M-BFloat16
数据集描述: DataCompDR是一个增强版的图像-文本数据集,通过多模态数据增强策略对原始DataComp数据集进行强化。该数据集包含12M样本,通过使用预训练的图像-文本模型生成合成标题、嵌入和元数据。每个图像生成5个合成标题,并计算增强图像、真实和合成标题的嵌入。
数据集特征:
- url.txt: 图像URL,数据类型为字符串。
- syn.json: 包含合成文本列表,数据类型为字符串列表。
- paug.json: 包含增强参数,数据类型为字符串。
- pth.gz: 包含图像和文本嵌入,数据类型为Bfloat16的列表。
- json: 包含图像的SHA256哈希值,数据类型为字符串。
任务类别:
- 文本到图像
- 图像到文本
语言: 英语
许可证: 自定义Apple许可证
数据集结构:
- 每个样本包括一个随机增强的图像、一个真实标题和一个随机选择的合成标题。
使用情况:
- 使用DataCompDR进行训练相比标准CLIP训练显示出显著的学习效率提升。例如,使用8×A100 GPU的单节点在约一天内可达到61.7%的零样本分类准确率。
引用信息: bibtex @InProceedings{mobileclip2024, author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel}, title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training}, booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)}, month = {June}, year = {2024}, }




