遇见数据集

Flickr30k多模态图像-文本对齐数据集

收藏
官方服务:

资源简介:

Flickr30k 数据集是一个重要的多模态数据集,用于图像描述生成、视觉问答、图像检索等任务的研究。它包含了丰富的图像数据以及与之相关的文本描述,旨在帮助研究人员开发能够理解和描述图像内容的模型。图像数据:Flickr30k 包含了31,783张来自Flickr网站的图像。这些图像涵盖了多样化的日常生活场景,提供了丰富的视觉内容和上下文信息。文本描述:每张图像都附带了5个不同的英文描述,共计158,915条描述。这些描述是由人工编写的,旨在详细而准确地描述图片内容,有助于模型学习到多种表述同一场景的方式。

提供机构:
海南大学
搜集汇总
数据集介绍
Flickr30k多模态图像-文本对齐数据集 数据集图片
背景与挑战
背景概述
Flickr30k是一个多模态数据集,包含31,783张日常生活场景图像,每张图像配有5个人工编写的英文描述,共计158,915条文本。该数据集旨在支持图像描述生成、视觉问答等任务的研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务