MSCOCO视觉关联数据集
收藏资源简介:
哥伦比亚大学的研究人员开发了一个新的数据集,用于挖掘图像中显著视觉元素的上下文关联,扩展了MSCOCO数据集,增加了1.7百万个具有抽象层次的创意标题。数据集通过结合视觉语言模型和大型语言模型,自动挖掘视觉元素的上下文关联,并生成不同抽象程度的创意标题。该数据集可用于训练视觉语言模型,在诗歌和隐喻可视化等创意领域提高零样本图像-文本检索的性能。
Researchers from Columbia University developed a novel dataset for excavating contextual associations of salient visual elements in images, which extends the MSCOCO dataset by adding 1.7 million creative captions with multiple levels of abstraction. The dataset automatically excavates contextual associations between visual elements and generates creative captions with varying abstraction levels by combining vision-language models and large language models (LLMs). It can be employed to train vision-language models to improve the performance of zero-shot image-text retrieval in creative fields including poetry and metaphor visualization.
数据集概述:mining_visual_associations
数据来源
- 基础数据来自COCO数据集的训练集和验证集的标注及图像,需从COCO官网下载:https://cocodataset.org/#download
数据生成流程
-
初始格式化
- 使用
get_associations_format.py脚本处理COCO训练和验证集的标注及图像,生成关联文件。 - 输入:COCO训练/验证集标注、图像目录、具体性评分文件、密集描述文件。
- 输出:训练和验证集的格式化文件。
- 使用
-
关联格式化
- 使用
format_associations.py脚本处理上一步生成的关联文件。 - 输入:训练/验证集关联文件、COCO训练/验证集标注。
- 输出:格式化提示文件。
- 使用
-
生成创意标注
- 使用
generate_creative_captions.py脚本生成创意标注。 - 输入:格式化提示文件、COCO数据集划分、距离标签、环境缓存路径。
- 输出:创意标注文件。
- 使用
模型训练流程
-
准备环境
- Fork OpenCLIP仓库:https://github.com/mlfoundations/open_clip
- 将
model_train.py文件移至指定目录。
-
训练模型
- 使用
model_train.py脚本,输入创意标注文件(不同距离标签)和模型检查点保存路径。
- 使用
模型评估任务
-
任务1:诗歌生成评估
- 下载诗歌语料库:https://github.com/researchmm/img2poem/blob/master/data/multim_poem.json
- 使用
eval_poem.py脚本进行评估。
-
任务2:视觉隐喻评估
- 下载视觉隐喻语料库:https://github.com/tuhinjubcse/VisualMetaphors
- 使用
eval_met_task2.py脚本进行评估。
-
任务3:隐喻文件评估
- 使用
eval_met_task3.py脚本,输入隐喻文件和模型检查点路径。
- 使用
数据集与模型
- 数据集和模型下载地址:https://drive.google.com/drive/folders/15aK4YeX8QUUpLoHr8zkCh0ewF6-hrwOf?usp=sharing

- 1Mining Contextualized Visual Associations from Images for Creativity Understanding哥伦比亚大学 · 2025年



