遇见数据集

CPRS

收藏
arXiv2026-07-24 更新2026-07-28 收录
官方服务:

资源简介:

CPRS是由南开大学等机构构建的三层监督数据集,专为遥感多模态大语言模型的场景专业化设计。该数据集总计包含约81万条样本,涵盖RGB、SAR、PAN和NIR多源遥感影像,数据来源于现有遥感标注资源及多教师蒸馏合成。其构建过程遵循渐进式原则:首先通过RS-Anchor层建立俯视视角的视觉-语言对齐;其次利用Bridge-Conv层融合目标场景与桥梁场景的多模态共享先验;最后通过Scenario-EG层实现证据驱动的港口场景精细化调优。该数据集主要应用于海岸港口理解等垂直领域,旨在解决高质量场景数据稀缺与能力覆盖不足的挑战,推动遥感模型从通用能力向场景专业化演进。

CPRS is a three-layer supervised dataset constructed by Nankai University and other institutions, specifically tailored for scene specialization of remote sensing multimodal large language models. This dataset contains approximately 810,000 samples in total, covering multi-source remote sensing images including RGB, SAR, PAN and NIR modalities, with data sourced from existing remote sensing annotation resources and multi-teacher distillation synthesis. Its construction follows a progressive workflow: first, establish top-down visual-language alignment via the RS-Anchor layer; second, fuse multimodal shared priors between target scenarios and bridge scenarios using the Bridge-Conv layer; finally, achieve evidence-driven fine-tuning for port scenarios through the Scenario-EG layer. This dataset is primarily applied in vertical domains such as coastal port understanding, aiming to address the challenges of scarce high-quality scenario data and insufficient capability coverage, and promote the evolution of remote sensing models from general capabilities to scene-specific specialization.

创建时间:
2026-07-24
原始信息汇总

数据集概述:Filling Before Advancing (FBA)

该页面介绍了一个名为 Filling Before Advancing (FBA) 的遥感多模态大语言模型(RS-MLLM)后训练框架,旨在解决场景专业化问题。其核心思想是:先构建场景专业化所依赖的能力,再进行基于证据的目标行为微调。

1. 数据集:CPRS

FBA 框架引入了一个名为 CPRS 的三层结构化监督数据集,包含约 810K 条记录。

阶段 子数据集 规模 作用
S1 RS-Anchor 569,853 对图像-标题 建立遥感视觉语言对齐和广泛语义理解
S2 Bridge-Conv 187,296 条 SFT 记录 引入目标相关场景(海岸、港口、船舶等)及多传感器数据(RGB, SAR, PAN, NIR)的领域桥接
S3 Scenario-EG 53,000 条 SFT 记录 专注于基于证据的感知、空间推理、鲁棒性和生成

数据集构建流程包括:异构数据标准化、基于可见证据的指令合成、多教师模型蒸馏、人工审查和审计追踪。

2. 评估基准:HarborEval

HarborEval 是一个用于多源沿海港口理解的诊断性评估基准,包含 1,245 个诊断项,覆盖 471 张图像(RGB, SAR, PAN, NIR)。

轨道 数量 诊断角色
T1 162 物体/场景视觉问答
T2 182 功能区解释
T3 183 空间关系推理
T4 164 多单元网格定位
T5 171 传感器感知可观测性
T6 123 证据判断与不确定性
T7 79 基于证据的报告生成
T8 181 非港口与近域拒绝

3. 模型与实验结果

该框架在 LLaVA-v1.5Qwen3-VL 两个骨干模型上进行了评估,并与多个现有 RS-MLLM 进行了对比。

  • 控制路由对比 (HarborEval):FBA 在 LLaVA-v1.5 上取得 70.29 分(基线 46.22),在 Qwen3-VL 上取得 83.37 分(基线 70.37),均优于直接 SFT 和混合 SFT。
  • 与现有模型对比:FBA (LLaVA-v1.5, 7B) 和 FBA (Qwen3-VL, 8B) 在 HarborEval、VRSBench、RSVQA 和 OpenEval 四个基准上均取得了最佳成绩,且只使用了约 810K 条监督数据。
  • 阶段能力轨迹:实验表明三个阶段各司其职:S1 建立强视觉语言对齐,S2 提升多源诊断能力,S3 达到最佳场景专业化性能。
  • 监督角色替换控制:替换任一阶段的监督数据都会削弱其对应提供的能力,验证了分层设计(锚定、桥接、专业化)的有效性。

4. 资源发布状态

  • 论文:已在 arXiv 发布(2607.22205)
  • 代码、权重、CPRS 数据集、HarborEval 基准:正在准备发布
  • 许可证:仓库将记录原始代码、第三方模型、源数据集等的许可和条件。不可分发的资源将通过清单和可复现脚本表示。
搜集汇总
数据集介绍
CPRS 数据集图片
构建方式
CPRS数据集的构建遵循渐进式的三层监督数据策展策略,以支持面向海岸港口场景的遥感多模态大模型能力缺口驱动后训练。第一层RS-Anchor通过整合并筛选现有RGB遥感图像描述、检索及地理空间图文资源,经质量控制和去重处理后构建了569,853对大规模图像-文本监督数据,奠定俯视视角视觉-语言对齐基础。第二层Bridge-Conv采用分阶段多教师蒸馏技术,对包含目标港口场景与沿海桥梁场景的多源图像池(涵盖RGB、SAR、PAN和NIR模态)进行指令数据生成,元教师首先归一化传感器与场景证据,合成教师基于图像和归一化证据生成指令响应,验证教师则依据视觉支撑和模态一致性进行接受、重写或拒绝,最终汇聚187,296条高质量多源桥域指令样本。第三层Scenario-EG聚焦目标场景证据接地行为,构建了53,000条港口专业化指令样本,融入负样本和不确定性感知监督,强化在视觉证据不足或模糊时的响应校准能力。
特点
CPRS数据集的核心特点在于其层级化能力角色分配与渐进式场景聚焦设计。三个监督层按能力缺口填补逻辑有序组织:RS-Anchor负责广泛的遥感语义锚定,桥接通用多模态大模型与遥感俯视视觉-语言的理解鸿沟;Bridge-Conv专注于多传感器域桥汇聚,通过联合训练目标港口场景和沿海相关桥梁场景,促使模型共享不同模态下的遥感先验知识,涵盖纹理、布局、视角和场景结构等;Scenario-EG则着力于证据接地场景微调,强化模型在下游港口特定任务中的感知、空间理解、鲁棒性和生成能力,特别是对硬负样本的处理和证据缺失时的可靠拒答行为。这种设计使得仅需约81万条精选样本即可激发强大的场景专业化能力,显著优于同等预算下的直接微调或合并训练方案。
使用方法
CPRS数据集专为FBA(先填补后前进)渐进式后训练路线设计,使用时需遵循严格的三阶段有序训练流程。第一阶段加载通用多模态大模型,使用RS-Anchor层进行单轮次训练,建立遥感语义基础;第二阶段在此基础上加载Bridge-Conv层进行域桥汇聚训练,使模型学习多模态共享的遥感先验;第三阶段引入Scenario-EG层进行证据接地场景微调,最终获得港口专业化遥感多模态大模型。训练过程中需保持LoRA配置、优化器和推理设置在各个阶段的一致性,并配合HarborEval八维度诊断基准评估模型在感知、空间理解、鲁棒性和生成等方面的表现。数据集已公开发布于GitHub平台,支持LLaVA-v1.5和Qwen3-VL等多种骨干网络,研究者可根据需用灵活适配。
背景与挑战
背景概述
随着多模态大语言模型在遥感领域的渗透,通用型遥感大模型虽已具备航拍影像理解能力,但在应对海岸港口等特定场景的精细化需求时仍显力不从心。在此背景下,南开大学机器人与自动化信息系统研究所联合天津大学、西班牙埃斯特雷马杜拉大学及冰岛大学的研究团队,于2026年提出了CPRS数据集,旨在攻克场景专业化遥感多模态大模型的后训练瓶颈。该数据集围绕能力鸿沟驱动的渐进式训练范式,构建了三层监督体系,涵盖遥感语义锚定、跨模态域桥汇聚及证据化场景精调,为港口专用模型的研发提供了高质监督数据。CPRS的推出不仅推进了遥感视觉-语言模型从通用型向情境专精型的转型,更为细粒度地球观测应用提供了可复现的数据基石与评价范式。
当前挑战
CPRS数据集所面对的挑战主要体现在两个层面。首先,从领域问题来看,当前遥感多模态大模型难以胜任功能性分区、空间布局等操作级描述,其核心瓶颈在于从通用能力向场景专业化迁移过程中,视觉-语言对齐、传感器模态适应及任务专业化之间的鸿沟无法通过单阶段微调弥合。其次,在数据集构建过程中,高质量、专家标注的港口场景数据极度匮乏,多传感器数据获取周期长、标注成本高昂;此外,不同遥感观测手段在成像机理上的差异导致多模态数据间缺乏统一语义支撑,需借助多教师蒸馏和逐级监督增强数据质量与覆盖度,这进一步加剧了数据整合与验证的复杂性。
常用场景
经典使用场景
在遥感多模态大模型领域,CPRS数据集的核心应用场景在于驱动沿海港口场景的细粒度专业化理解。该数据集通过构建三层递进式监督结构——RS语义锚定、领域桥接收敛与证据引导的场景微调——为模型提供了一条从广泛遥感视觉-语言对齐到特定港口任务定向优化的渐进式训练路径。研究者可利用CPRS在RGB、SAR、PAN及NIR等多模态影像上训练模型,使其具备目标识别、功能区划分、空间关系推理、网格定位、拒判处理及证据驱动的生成性报告能力,从而实现对港口设施、船舶分布与作业布局的结构化语义解析。
解决学术问题
CPRS数据集旨在解决遥感多模态大模型在特定场景下因高质量标注数据稀缺与能力覆盖不完整而导致的专业化适应难题。它将场景适配重新定义为能力缺口驱动的后训练问题,提出“先填补后推进”的渐进式路线,克服了传统单阶段监督微调在整合多模态遥感先验与场景专属知识时的局限性。通过有序构建的三阶段训练策略,该数据集有效弥合了俯视视觉语义对齐、传感器感知模式融合及证据锚定生成之间的鸿沟,显著提升了模型在感知、空间理解、鲁棒性与生成四大维度上的综合性能,为遥感大模型的垂直场景迁移提供了系统性理论框架与实验验证。
衍生相关工作
CPRS数据集的发布催生了一系列衍生工作,包括构建HarborEval八通道诊断基准,用于系统评估模型在目标识别、功能区理解、空间关系推理、网格定位、模态识别、证据判断、拒判处理及生成性报告方面的表现。此外,研究者利用CPRS与FBA训练范式在LLaVA-v1.5和Qwen3-VL等多个骨干网络上开展了与现有遥感多模态大模型的对比实验,验证了渐进式能力填充策略相较于直接微调与合并微调的显著优势。这些工作不仅推动了港口场景下的遥感视觉-语言理解研究,也为其他垂直遥感场景(如农业监测、灾害评估)的数据集构建与专业化训练路线提供了可复现的方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务