遇见数据集

MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning

收藏
Zenodo2026-05-27 更新2026-05-29 收录
官方服务:

资源简介:

A multimodal dataset comprising of: 141,364 images 981,947 image-level captions 1,742,264 region-level captions 1,391,779 bounding box annotations

本多模态数据集包含以下组成部分: 141,364 张图像 981,947 条图像级字幕(image-level captions) 1,742,264 条区域级字幕(region-level captions) 1,391,779 个边界框标注(bounding box annotations)

提供机构:
Zenodo
创建时间:
2026-05-27
二维码
社区交流群
二维码
科研交流群
商业服务