The dataset is a public dataset with a total of 25,000 image-text pairs, of which 24 semantic labels are correlated with sample pairs. The feature representation dimensions of images and text are 150
该数据集旨在通过测试其将查询与相关图像匹配的能力来评估视觉检索器的性能。每个示例包含一个文本查询和一个关联的图像,该图像是从基础论文“Attention is All You Need”中扫描的页面。数据集的目的是促进视觉检索器的评估,其中检索模型应准确地将每个查询与其对应的页面链接起来。数据集包含3个示例,图像类型为学术论文页面,适用于测试检索模型,特别是那些专注于跨模态检索的模型。数据集的预期