登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Mtoper/Flicker30k_CN
Mtoper/Flicker30k_CN
收藏
Hugging Face
2024-06-03 更新
2024-06-12 收录
图像文本匹配
中文多模态理解
数据链接:
https://hf-mirror.com/datasets/Mtoper/Flicker30k_CN
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
许可证:Apache 2.0
应用场景:
提供机构:
Mtoper
原始信息汇总
数据集许可证
许可证类型:Apache-2.0
相关数据集
LAION-400M
多模态学习
图像文本匹配
LAION-400M是由尤利希超级计算中心等机构创建的一个包含4亿对图像-文本数据的大型公开数据集。该数据集通过筛选自Common Crawl的图像及其对应的文本描述,并应用CLIP模型进行过滤,确保数据的质量和相关性。数据集创建过程中,采用了分布式处理和单节点后处理相结合的方法,以高效地从庞大的原始数据中提取和整理出高质量的图像-文本对。LAION-400M的应用领域广泛,主要用于训练多模态语言
arXiv
2021-11-03 更新
309
0
Nano1337/CLOVE-scores-negative-VQAnotCLIP
视觉问答
图像文本匹配
该数据集包含100个训练样本,每个样本包含uid、image、caption、CLIPscore、VQAscore、CLIPscore_percentile、VQAscore_percentile和percentile_difference等特征。其中,uid是字符串类型,image是图像类型,caption是字符串类型,CLIPscore、VQAscore、CLIPscore_percentil
Hugging Face
2024-06-16 更新
20
0
RoCOCO
图像文本匹配
模型鲁棒性评估
RoCOCO数据集是由首尔国立大学电气与计算机工程学院的研究人员创建的,旨在通过对抗性文本和图像来评估图像文本匹配模型的鲁棒性。数据集包含50,000条数据,其中一半是原始的MS-COCO数据,另一半是通过在文本中替换单词或在图像中混合不同图像生成的对抗性数据。该数据集的应用领域主要集中在提高视觉语言模型的鲁棒性,以及开发更多样化的跨模态检索任务的压力测试方法。
arXiv
2023-07-14 更新
15
0
Crisscrossed Captions
图像文本匹配
疾病语义相似性
Crisscrossed Captions (CxC) 包含247,315个人类标注的注释,包括图像对、标题对和图像-标题对之间的正负关联。该数据集扩展了MS-COCO(Karpathy分割的开发和测试集),增加了新的语义相似性判断,以解决现有数据集中跨模态关联的限制。
github
2024-01-16 更新
38
0
mair-lab/vismin
视觉语言
图像文本匹配
VisMin数据集由四种类型的最小变化组成——对象、属性、计数和空间关系——这些变化存在于两个图像-描述对之间。评估任务要求模型在给定两种情况下预测正确的图像-描述匹配:1)两张图片和一个描述,2)两个描述和一张图片。VisMin基准包含2,084个样本,分为579个对象、294个属性、589个计数和622个关系。
Hugging Face
2024-11-28 更新
19
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广