TripletData
收藏资源简介:
TripletData是一个用于TripletCLIP模型的高质量子集,旨在通过合成视觉语言负样本改进CLIP的组合推理能力。
TripletData is a high-quality subset designed for the TripletCLIP model, which aims to improve the compositional reasoning capabilities of CLIP via synthetic vision-language negative samples.
TripletCLIP 数据集概述
数据集简介
TripletCLIP 数据集是为论文《TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives》提供的。该数据集包含用于训练和推理的预训练模型检查点、数据生成脚本以及训练代码。
数据集内容
- 预训练模型检查点:提供了在 CC3M 和 CC12M 数据集上训练的多个模型的检查点,包括 LaCLIP、LaCLIP+HN、NegCLIP、NegCLIP++ 和 TripletCLIP。
- 微调模型检查点:提供了基于 TripletCLIP 和 OpenCLIP 的微调模型检查点。
数据集状态
- 已完成:
- 高质量子集 TripletData 的发布。
- 所有预训练和微调检查点的发布。
- OpenCLIP 适配版本的发布。
- 待完成:
- 数据生成脚本的发布。
- 完整 TripletData 的发布。
- 原始 TripletCLIP 训练脚本的发布。
引用
如果使用 TripletCLIP 数据集,请引用以下论文: bibtex @article{patel2024tripletclip, author = {Patel, Maitreya and Kusumba, Abhiram and Cheng, Sheng and Kim, Changhoon and Gokhale, Tejas and Baral, Chitta and Yang, Yezhou}, title = {TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives}, journal={Advances in neural information processing systems}, year = {2024}, }




