遇见数据集

Awesome-RS-VL-Data

收藏
github2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

这是一个关于遥感视觉-语言数据集的精选合集,旨在为开发遥感大型视觉-语言模型提供高质量的数据集推荐。该合集通过GitHub Issues进行管理,并使用标签对数据集进行分类,覆盖了综合数据、综合基准、任务特定数据、元数据等多个领域,以支持遥感视觉-语言领域的研究和应用。

This is a curated collection of remote sensing vision-language datasets, designed to provide high-quality dataset recommendations for developing large-scale vision-language models tailored for remote sensing. This collection is managed via GitHub Issues, with datasets categorized using tags, covering multiple domains including comprehensive datasets, comprehensive benchmarks, task-specific datasets, and metadata, to support research and applications in the remote sensing vision-language field.

创建时间:
2025-03-23
原始信息汇总

遥感视觉-语言数据集资源库

该仓库旨在为遥感领域的大型视觉-语言模型(LVLMs)开发提供经过筛选的高质量数据集推荐。已由IEEE Geoscience and Remote Sensing Magazine (GRSM)接收。

数据集管理方式

  • 采用 GitHub Issues 进行数据集管理
  • 通过 Labels 标签过滤所需数据集
  • 支持按数据集类型筛选:人工标注、GPT-4V生成、超高分辨率、时序理解等
  • 鼓励研究人员提交遗漏的数据集,并在Issue下讨论、分享经验

数据集分类及列表

1. 综合性数据(Comprehensive Data)

共收录27个数据集,涵盖2024-2026年发表,部分代表性数据集:

数据集名称 发表年份 会议/期刊 国家 相关论文
GeoChat-Instruct 2024 CVPR 阿联酋 2311.15826
SkyEye-968k 2024 ISPRS 中国 2401.09712
MMRS-1M 2024 TGRS 中国 2401.16822
VRSBench-Train 2024 NeurIPS 沙特阿拉伯 2406.12384
RS-GPT4V 2024 arXiv 中国 2406.12479
LHRS-Align & LHRS-Instruct 2024 ECCV 中国 2402.02544
EarthDial-Instruct 2025 CVPR 美国 2412.15190
SARLANG-1M 2025 ICLR 日本 2504.03254v1
RS-VL3M 2025 arXiv 中国 2507.20776
ScoreRS 2025 NeurIPS 中国 2503.00743
DisasterM3 2025 NeurIPS 日本 2505.21089
OpenEarthAgent Dataset 2026 arXiv 阿联酋 2602.17665

2. 综合性基准(Comprehensive Benchmarks)

共收录18个基准数据集,部分代表性数据集:

数据集名称 发表年份 会议/期刊 国家 相关论文
NAIP-OSM 2024 ICLR 美国 2312.06960
GeoChat-Bench 2024 CVPR 阿联酋 2311.15826
LHRS-Bench 2024 ECCV 中国 2402.02544
VRSBench 2024 NeurIPS 沙特阿拉伯 2406.12384
GEOBench-VLM 2025 ICCV 阿联酋 2411.19325
XLRS-Bench 2025 CVPR 中国 2503.23771
CHOICE 2025 NeurIPS 中国 2411.18145
ThinkGeo 2025 arXiv 阿联酋 2505.23752
GeoReason-Bench 2026 arXiv 中国 2601.04118

3. 任务特定数据(Task-specific Data)

图像描述/检索(Image Captioning / Retrieval)

数据集名称 发表年份 会议/期刊 国家 相关论文
UCM-Captions 2016 CITS 中国 7546397
Sydney-Captions 2016 CITS 中国 7546397
RSICD 2017 TGRS 中国 8240966
RSITMD 2021 TGRS 中国 9437331
NWPU-Captions 2022 TGRS 中国 9866055
UAV-Captions 2022 TGRS 意大利 9521989

相关资源

  • 项目网站: GeoChef项目
  • 技术论文: TechRxiv (176978652.29736845/v1)
  • Agent演示: 测试版Agent (geochef-v2-1.streamlit.app/)
  • Agent技能: 支持OpenClaw/Hermes/Coze/WorkBuddy的SKill

引用与联系

  • 项目由 DREAMS@ECNU 和 VisionXLab@SJTU 维护
  • 鼓励提交问题(Issues)并提供必要信息,项目将添加相应标签并更新README
搜集汇总
数据集介绍
Awesome-RS-VL-Data 数据集图片
构建方式
随着遥感领域大型视觉-语言模型(LVLMs)的蓬勃发展,高质量数据集的匮乏成为制约其进步的关键瓶颈。Awesome-RS-VL-Data项目应运而生,旨在通过精心策划与推荐,系统性地整合遥感视觉-语言数据集。该仓库巧妙借鉴了JE项目的管理理念,创造性地采用GitHub Issues作为数据集管理平台。研究者可通过提交Issue并遵循预设模板,贡献遗漏的优质成果。项目维护者随后为每个Issue添加恰当的标签,实现数据集的精细分类与高效检索,并同步更新README页面,从而构建了一个动态、协作且持续生长的数据集生态系统。
使用方法
使用Awesome-RS-VL-Data仓库极为便捷。用户可直接访问其GitHub页面,浏览按类别划分的表格,快速定位所需数据集。每个数据集条目均提供了论文链接、代码仓库星标状态及对应的Issue链接。点击Issue链接即可进入详细讨论页面,获取数据集的下载方式、使用说明及社区反馈。对于希望贡献新数据集的用户,只需按照模板提交Issue,项目团队将审核并添加标签。项目还提供了GeoChef智能体演示,可辅助研究者解答数据集相关问题。这种低门槛、高互动的使用模式,使得该仓库成为遥感视觉-语言研究领域不可或缺的数据枢纽。
背景与挑战
背景概述
随着遥感影像获取能力的飞速提升与大型视觉语言模型(LVLMs)的蓬勃发展,将自然语言理解与遥感图像分析深度融合已成为地理空间智能领域的前沿方向。然而,遥感场景中目标尺度多样、地物语义复杂且标注成本高昂,使得高质量、多模态对齐数据集的匮乏成为制约该领域发展的核心瓶颈。在此背景下,由华东师范大学DREAMS实验室与上海交通大学VisionXLab联合发起的Awesome-RS-VL-Data项目应运而生,自2024年起系统性地收集、整理并持续更新遥感视觉语言数据集资源。该项目不仅囊括了GeoChat、SkyEye-968k、MMRS-1M等涵盖图像描述、视觉问答、目标检测等任务的综合性数据集与基准,还收录了面向超高分辨率、时序变化理解等特定挑战的精细数据,为全球研究者提供了宝贵的资源索引与社区协作平台。其影响力已获IEEE Geoscience and Remote Sensing Magazine认可,有力推动了遥感领域LVLMs的标准化评估与模型发展。
当前挑战
Awesome-RS-VL-Data所聚焦的遥感视觉语言领域面临多重挑战。从领域问题层面看,遥感图像具有超大尺寸、多尺度目标、地物类别细粒度且空间关系复杂等特性,传统自然图像领域的视觉语言模型难以直接迁移,亟需构建能够理解地理空间语义、适应不同分辨率与传感器类型(如光学、SAR)的专用数据集与评估基准。从数据集构建过程看,挑战尤为显著:人工标注遥感图像描述与问答对成本极高,且对标注者需具备专业地理知识;现有数据集多依赖GPT-4V等大模型自动生成,但存在幻觉现象与领域知识偏差,导致数据质量参差不齐;此外,如何有效整合来自不同国家、不同年份、不同任务的异构数据,并维持统一的格式标准与更新机制,亦是一项复杂的系统工程。
常用场景
经典使用场景
在遥感领域,视觉与语言模型的深度融合正成为推动智能解译的关键范式。Awesome-RS-VL-Data作为一份精心整理的遥感视觉-语言数据集资源清单,其最经典的使用场景在于为大规模视觉语言模型(LVLMs)的训练与评估提供高质量的数据基石。研究者可依据该清单系统性地获取涵盖图像描述、视觉定位、变化检测等多任务的标注数据,从而支撑从基础模型预训练到特定场景微调的全流程研发工作。
解决学术问题
该数据集清单有效解决了遥感领域长期存在的多模态数据碎片化与标准化不足的学术困境。通过整合来自不同年份、会议和国家的综合性数据与基准测试,它弥合了遥感图像语义理解与自然语言交互之间的鸿沟。其意义在于为学术社区提供了一站式数据索引,使得研究者能够更便捷地对比不同方法的性能,从而加速了遥感视觉-语言模型从理论探索到实证验证的转化进程,推动了该领域的系统性进步。
实际应用
在实际应用中,Awesome-RS-VL-Data所收录的数据集已被广泛部署于智能地球观测系统之中。例如,基于GeoChat-Instruct和SkyEye-968k等数据集训练的模型,能够辅助城市规划者通过自然语言查询快速检索特定地物变化信息,或为灾害应急响应提供自动化影像分析。这些数据集支撑的智能体,如GeoChef Agent,已在实际场景中展示出辅助研究人员高效处理遥感数据问题的潜力,显著提升了从遥感影像中提取可操作情报的实时性与准确性。
数据集最近研究
最新研究方向
当前,遥感视觉-语言数据集的研究正以前所未有的活力蓬勃发展,深刻回应着地球观测与人工智能深度融合的时代命题。随着大型视觉语言模型在遥感领域的崛起,高质量、多样化的数据集成为驱动模型能力跃升的核心基石。该领域的前沿方向已从早期的单一图像描述与检索,转向构建覆盖全面、任务多元的大规模指令微调数据集与综合性基准评测体系。例如,近期涌现的GeoChat-Instruct、SkyEye-968k及MMRS-1M等综合性数据,不仅规模庞大,更通过精细的人工标注或GPT-4V等先进模型生成,赋予了模型理解复杂地理场景、执行精细视觉对话的能力。与此同时,VRSBench、LHRS-Bench、GEOBench-VLM等综合性基准的建立,为客观评估模型在细粒度识别、空间推理及变化检测等复杂任务上的表现提供了标准化平台。值得关注的是,超高分辨率图像理解、时序动态分析以及合成孔径雷达等多模态数据的融入,正开辟出全新的研究维度,如UHR-CoZ、TEOChatlas及SARLANG-1M等数据集的出现,标志着研究视野正从可见光向更广阔的多模态、多时相空间拓展。这些研究不仅推动了遥感分析从“看”到“懂”的范式转变,更在灾害应急响应、城市规划与全球变化监测等重大应用场景中释放出巨大的社会与经济价值,为构建智能、可交互的地球观测系统奠定了坚实的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务