Awesome-Remote-Sensing-Cross-Modal-Image-Text-Retrieval
收藏资源简介:
这是一个专注于遥感领域跨模态图像-文本检索(RSCMIT)的资源合集,收集了相关的研究论文、数据集、基准测试、代码和模型权重。合集涵盖了遥感图像-文本检索模型、视觉-语言模型、大规模预训练数据集以及该领域的综述文献,旨在为研究者和开发者提供全面的资源索引和参考。
This is a curated resource collection focused on remote sensing cross-modal image-text retrieval (RSCMIT). It gathers relevant research papers, datasets, benchmark tests, code, and model weights. The collection covers remote sensing image-text retrieval models, vision-language models, large-scale pre-trained datasets, and review literature in this field, aiming to provide comprehensive resource indexing and references for researchers and developers.
数据集与基准
该页面汇总了遥感跨模态图像-文本检索(RSCMIT)领域的相关数据集、基准、代码及模型权重。核心数据集包括:
- UCM-Captions:613张图像,尺寸256×256。
- Sydney-Captions:2,100张图像,尺寸500×500。
- RSICD:10,921张图像,尺寸224×224。
- RSITMD:4,743张图像,尺寸256×256。
- NWPU-Captions:31,500张图像,尺寸256×256。
- RS5M:超过500万张图像,全分辨率,附带预训练模型GeoRSCLIP。
- SkyScript:超过520万张图像,全分辨率,附带预训练模型SkyCLIP。
- ChatEarthNet:163,488 + 10,000个样本,数据集待公开。
- GEOBench-VLM:超过10,000个样本,附带基准测试集GEOBench-VLM。
- VRSBench:29,614张图像,包含29,614条人工验证的详细描述、52,472个对象引用和123,221个问答对(NeurIPS 2024)。
综述论文
页面列举了10篇遥感跨模态检索及视觉-语言模型领域的综述论文,发表于2023年至2025年期间,涵盖了来自同济大学、国防科技大学、西北工业大学、东京大学、南京航空航天大学等机构的早期研究。
模型分类
页面将模型分为三大类:
- 遥感跨模态图像-文本检索模型:共收录超过40个模型(截至更新日期),时间跨度从2018年至2026年,涉及多种方法论如对比学习、注意力机制、提示工程等。代表性模型包括DCCA、CMER、PGRN、FGVLA、CFITR、PERSVL、RemoteCLIP等,论文主要发表在TGRS、JSTARS、ACMMM等会议和期刊上。
- 遥感视觉-语言模型(面向更多任务):包含用于图像分割(如FIANet)和场景分类(如FedRSClip)的模型。
- 遥感视觉-语言大模型与基础模型:共收录9个模型,包括VHM、TeoChat、RingMoGPT、GeoChat、EarthGPT、RemoteCLIP、RSGPT、GeoRSCLIP和GRAFT,主要发表于2023年至2024年期间。
相关项目
页面包含指向相关项目的链接,但具体项目名称和链接内容在提供的README文件中未完整显示。
更新动态
页面定期更新,最近一次更新于2026年3月1日,最近新增或更新的内容涉及DCCA(2026)、FGVLA(2025)、SPCA-Net(2025)等。



