CPRS
收藏资源简介:
CPRS是由南开大学等机构构建的三层监督数据集,专为遥感多模态大语言模型的场景专业化设计。该数据集总计包含约81万条样本,涵盖RGB、SAR、PAN和NIR多源遥感影像,数据来源于现有遥感标注资源及多教师蒸馏合成。其构建过程遵循渐进式原则:首先通过RS-Anchor层建立俯视视角的视觉-语言对齐;其次利用Bridge-Conv层融合目标场景与桥梁场景的多模态共享先验;最后通过Scenario-EG层实现证据驱动的港口场景精细化调优。该数据集主要应用于海岸港口理解等垂直领域,旨在解决高质量场景数据稀缺与能力覆盖不足的挑战,推动遥感模型从通用能力向场景专业化演进。
CPRS is a three-layer supervised dataset constructed by Nankai University and other institutions, specifically tailored for scene specialization of remote sensing multimodal large language models. This dataset contains approximately 810,000 samples in total, covering multi-source remote sensing images including RGB, SAR, PAN and NIR modalities, with data sourced from existing remote sensing annotation resources and multi-teacher distillation synthesis. Its construction follows a progressive workflow: first, establish top-down visual-language alignment via the RS-Anchor layer; second, fuse multimodal shared priors between target scenarios and bridge scenarios using the Bridge-Conv layer; finally, achieve evidence-driven fine-tuning for port scenarios through the Scenario-EG layer. This dataset is primarily applied in vertical domains such as coastal port understanding, aiming to address the challenges of scarce high-quality scenario data and insufficient capability coverage, and promote the evolution of remote sensing models from general capabilities to scene-specific specialization.
数据集概述:Filling Before Advancing (FBA)
该页面介绍了一个名为 Filling Before Advancing (FBA) 的遥感多模态大语言模型(RS-MLLM)后训练框架,旨在解决场景专业化问题。其核心思想是:先构建场景专业化所依赖的能力,再进行基于证据的目标行为微调。
1. 数据集:CPRS
FBA 框架引入了一个名为 CPRS 的三层结构化监督数据集,包含约 810K 条记录。
| 阶段 | 子数据集 | 规模 | 作用 |
|---|---|---|---|
| S1 | RS-Anchor | 569,853 对图像-标题 | 建立遥感视觉语言对齐和广泛语义理解 |
| S2 | Bridge-Conv | 187,296 条 SFT 记录 | 引入目标相关场景(海岸、港口、船舶等)及多传感器数据(RGB, SAR, PAN, NIR)的领域桥接 |
| S3 | Scenario-EG | 53,000 条 SFT 记录 | 专注于基于证据的感知、空间推理、鲁棒性和生成 |
数据集构建流程包括:异构数据标准化、基于可见证据的指令合成、多教师模型蒸馏、人工审查和审计追踪。
2. 评估基准:HarborEval
HarborEval 是一个用于多源沿海港口理解的诊断性评估基准,包含 1,245 个诊断项,覆盖 471 张图像(RGB, SAR, PAN, NIR)。
| 轨道 | 数量 | 诊断角色 |
|---|---|---|
| T1 | 162 | 物体/场景视觉问答 |
| T2 | 182 | 功能区解释 |
| T3 | 183 | 空间关系推理 |
| T4 | 164 | 多单元网格定位 |
| T5 | 171 | 传感器感知可观测性 |
| T6 | 123 | 证据判断与不确定性 |
| T7 | 79 | 基于证据的报告生成 |
| T8 | 181 | 非港口与近域拒绝 |
3. 模型与实验结果
该框架在 LLaVA-v1.5 和 Qwen3-VL 两个骨干模型上进行了评估,并与多个现有 RS-MLLM 进行了对比。
- 控制路由对比 (HarborEval):FBA 在 LLaVA-v1.5 上取得 70.29 分(基线 46.22),在 Qwen3-VL 上取得 83.37 分(基线 70.37),均优于直接 SFT 和混合 SFT。
- 与现有模型对比:FBA (LLaVA-v1.5, 7B) 和 FBA (Qwen3-VL, 8B) 在 HarborEval、VRSBench、RSVQA 和 OpenEval 四个基准上均取得了最佳成绩,且只使用了约 810K 条监督数据。
- 阶段能力轨迹:实验表明三个阶段各司其职:S1 建立强视觉语言对齐,S2 提升多源诊断能力,S3 达到最佳场景专业化性能。
- 监督角色替换控制:替换任一阶段的监督数据都会削弱其对应提供的能力,验证了分层设计(锚定、桥接、专业化)的有效性。
4. 资源发布状态
- 论文:已在 arXiv 发布(2607.22205)
- 代码、权重、CPRS 数据集、HarborEval 基准:正在准备发布
- 许可证:仓库将记录原始代码、第三方模型、源数据集等的许可和条件。不可分发的资源将通过清单和可复现脚本表示。




