VLM-150M
收藏资源简介:
VLM-150M数据集是由中国科学技术大学和腾讯微信视觉的研究人员创建的,包含1.5亿高质量图像文本对,每个图像文本对都由最新的视觉语言模型生成四个互补文本:长正面描述、长负面描述、短正面标签和短负面标签。该数据集旨在提高图像文本对的匹配质量,用于训练和测试视觉语言模型。VLM-150M数据集的创建过程是通过使用GPT-4o对10,000个高质量的图像文本对进行重写,并使用开源的视觉语言模型进行监督微调,以生成丰富的文本描述。该数据集的应用领域包括零样本分类、跨模态检索和细粒度视觉理解任务。通过在多个数据集上的实验,HQ-CLIP模型展示了在零样本泛化、跨模态检索和细粒度视觉理解任务上的卓越性能,甚至超过了使用2亿数据进行训练的标准CLIP模型。
The VLM-150M dataset was developed by researchers from the University of Science and Technology of China and Tencent WeChat Vision. It contains 150 million high-quality image-text pairs, with each pair paired with four complementary textual descriptions generated by state-of-the-art vision-language models: long positive description, long negative description, short positive label, and short negative label. This dataset aims to enhance the matching quality of image-text pairs, and is designed for training and evaluating vision-language models. The construction pipeline of the VLM-150M dataset involves rewriting 10,000 high-quality image-text pairs using GPT-4o, followed by supervised fine-tuning with open-source vision-language models to generate rich textual descriptions. Application scenarios of this dataset include zero-shot classification, cross-modal retrieval, and fine-grained visual understanding tasks. Through experiments conducted on multiple datasets, the HQ-CLIP model has exhibited exceptional performance across zero-shot generalization, cross-modal retrieval, and fine-grained visual understanding tasks, even outperforming standard CLIP models trained on 200 million data samples.
HQ-CLIP数据集概述
基本信息
- 数据集名称: HQ-CLIP
- 发布机构: 中国科学技术大学 & 腾讯微信视觉团队
- 发布时间: 2025年
- 相关论文: HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models
- 会议: ICCV 2025
数据集内容
- 衍生数据集:
- VLM-150M (147M样本)
- VLM-1B
- 数据来源: 基于DFN-Large数据集精炼
- 标注类型:
- 长正面描述
- 长负面描述
- 短正面标签
- 短负面标签
关键技术
- 核心方法:
- LVLM驱动的数据精炼管道
- 硬负样本识别(HNI)机制
- 短标签分类(STC)损失
- 训练范式: 扩展传统对比学习,整合负面描述和短标签作为监督信号
模型表现
- 基准测试: 在38个基准数据集上评估
- 主要优势:
- 零样本分类SOTA
- 跨模态检索性能超越10倍数据量训练的模型
- 作为LVLM视觉骨干(如LLaVA-1.5)表现优异
衍生模型
- 预训练模型:
- CLIP-B-16 (VLM-150M)
- CLIP-L-14-CLIPA (VLM-1B)
- CLIP-L-14-OPENAI (VLM-1B)
- 重标注模型: Qwen2VL
核心贡献
- 提出高效LVLM数据精炼管道,创建多粒度标注数据集VLM-150M
- 开发HQ-CLIP框架,整合HNI和STC创新机制
- 实现超越10倍数据量模型的跨模态检索能力
- 验证作为LVLM视觉骨干的优越性
获取信息
- 状态: 代码/模型/数据集将在论文发表后公开
- 版权: © 2025 HQ-CLIP项目团队




