MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning
收藏官方服务:
资源简介:
A multimodal dataset comprising of: 141,364 images 981,947 image-level captions 1,742,264 region-level captions 1,391,779 bounding box annotations
提供机构:
Zenodo创建时间:
2026-05-27



