CVSBench
收藏资源简介:
CVSBench是一个用于评估视觉语言模型跨视图理解能力的综合性基准测试数据集。该数据集专注于卫星图像与街景图像之间的关联,旨在测试模型在跨视图空间推理、对象定位、视点对齐以及基于部分观察进行视觉想象等方面的能力。数据集包含`cvusa/`和`fov/`两个主要子集,每个子集下又细分为多个任务家族,包括从地面到卫星(g2s)、从卫星到地面(s2g)的推理任务,以及跨视图对象接地与边界框定位任务(gs_grounding)。此外,`fov/`子集还包含视图匹配任务(gs_view)和用于辅助视觉想象实验的3D微型建筑模型图像(nanobanana)。数据以JSONL格式组织,包含图像路径引用、任务特定元数据、问题-答案对以及用于评估的边界框标注。该数据集适用于对视觉语言模型进行跨视图推理、对象接地、视点匹配和视觉想象等任务的基准测试与研究。数据集基于现有跨视图数据资源(如CVUSA、University-1652)构建,采用CC-BY-4.0许可证发布。
CVSBench is a comprehensive benchmark dataset for evaluating the cross-view understanding capabilities of vision-language models. It focuses on the association between satellite images and street-view images, aiming to test models abilities in cross-view spatial reasoning, object localization, viewpoint alignment, and visual imagination based on partial observations. The dataset includes two main subsets: `cvusa/` and `fov/`, each further divided into multiple task families, such as ground-to-satellite (g2s) and satellite-to-ground (s2g) reasoning tasks, as well as cross-view object grounding and bounding box localization tasks (gs_grounding). Additionally, the `fov/` subset contains a view matching task (gs_view) and 3D miniature building model images (nanobanana) to assist in visual imagination experiments. The data is organized in JSONL format, including image path references, task-specific metadata, question-answer pairs, and bounding box annotations for evaluation. This dataset is suitable for benchmarking and research on cross-view reasoning, object grounding, viewpoint matching, and visual imagination tasks for vision-language models. It is built upon existing cross-view data resources (e.g., CVUSA, University-1652) and released under the CC-BY-4.0 license.
数据集概述:CVSBench
CVSBench(Cross-View Spatial Reasoning and Dreaming Benchmark)是一个用于评估视觉语言模型在跨视角场景下进行空间推理、目标定位与视觉想象能力的基准数据集。
核心目标
- 测试模型在卫星图像与街景图像之间的跨视角理解能力。
- 评估任务涵盖:跨视角对应、空间推理、目标定位、视角理解与视觉想象。
基准亮点
- 支持卫星到地面与地面到卫星双向推理。
- 包含问答式、标注式与视角匹配式多种任务。
- 提供多个互补的子集,覆盖不同难度与场景。
- 超越传统识别与匹配任务,延伸至空间推理与视觉想象。
数据集结构
text CVSBench/ ├── cvusa/ │ ├── data/ # 原始图像与支持资源 │ ├── g2s/ # 地面到卫星推理任务 │ ├── s2g/ # 卫星到地面推理任务 │ └── gs_grounding/ # 跨视角目标定位与边界框标注任务 └── fov/ ├── data/ ├── g2s/ ├── s2g/ ├── gs_grounding/ ├── gs_view/ # 跨视角匹配任务(包含View-Arrow与View-Image两个设置) └── nanobanana/ # 用于视觉想象实验的3D迷你建筑模型图像
任务类型
- g2s / s2g:跨视角推理(地面↔卫星)
- gs_grounding:跨视角目标定位,输出边界框坐标
- gs_view:视角匹配任务(方向箭头←→街景图像)
数据格式示例(标注式任务)
json { "img_id": "0001119_0", "task": "Ground2Sat", "source_image": "cvusa/data/streetview/0001119.jpg", "target_image": "cvusa/data/bingmap/input0001119.png", "target_bbox": [121.0, 196.6, 153.0, 234.6], "questions": [ { "level": 3, "question": "First image shows a street-view with a bounding box. In the second satellite image, provide the pixel bounding box coordinates [x_min, y_min, x_max, y_max] for the corresponding object.", "answer": [121.0, 196.6, 153.0, 234.6] } ], "dataset": "cvusa" }
许可信息
- 许可证:CC-BY-4.0
应用场景
- 视觉语言模型的跨视角推理基准测试
- 卫星与街景图像的目标定位与视角对齐研究
- 基于稀疏或局部观测的视觉想象研究
资源链接




