遇见数据集

CVSBench

收藏
Hugging Face2026-06-20 更新2026-06-21 收录
官方服务:

资源简介:

CVSBench是一个用于评估视觉语言模型跨视图理解能力的综合性基准测试数据集。该数据集专注于卫星图像与街景图像之间的关联,旨在测试模型在跨视图空间推理、对象定位、视点对齐以及基于部分观察进行视觉想象等方面的能力。数据集包含`cvusa/`和`fov/`两个主要子集,每个子集下又细分为多个任务家族,包括从地面到卫星(g2s)、从卫星到地面(s2g)的推理任务,以及跨视图对象接地与边界框定位任务(gs_grounding)。此外,`fov/`子集还包含视图匹配任务(gs_view)和用于辅助视觉想象实验的3D微型建筑模型图像(nanobanana)。数据以JSONL格式组织,包含图像路径引用、任务特定元数据、问题-答案对以及用于评估的边界框标注。该数据集适用于对视觉语言模型进行跨视图推理、对象接地、视点匹配和视觉想象等任务的基准测试与研究。数据集基于现有跨视图数据资源(如CVUSA、University-1652)构建,采用CC-BY-4.0许可证发布。

CVSBench is a comprehensive benchmark dataset for evaluating the cross-view understanding capabilities of vision-language models. It focuses on the association between satellite images and street-view images, aiming to test models abilities in cross-view spatial reasoning, object localization, viewpoint alignment, and visual imagination based on partial observations. The dataset includes two main subsets: `cvusa/` and `fov/`, each further divided into multiple task families, such as ground-to-satellite (g2s) and satellite-to-ground (s2g) reasoning tasks, as well as cross-view object grounding and bounding box localization tasks (gs_grounding). Additionally, the `fov/` subset contains a view matching task (gs_view) and 3D miniature building model images (nanobanana) to assist in visual imagination experiments. The data is organized in JSONL format, including image path references, task-specific metadata, question-answer pairs, and bounding box annotations for evaluation. This dataset is suitable for benchmarking and research on cross-view reasoning, object grounding, viewpoint matching, and visual imagination tasks for vision-language models. It is built upon existing cross-view data resources (e.g., CVUSA, University-1652) and released under the CC-BY-4.0 license.

创建时间:
2026-06-20
原始信息汇总

数据集概述:CVSBench

CVSBench(Cross-View Spatial Reasoning and Dreaming Benchmark)是一个用于评估视觉语言模型在跨视角场景下进行空间推理、目标定位与视觉想象能力的基准数据集。

核心目标

  • 测试模型在卫星图像街景图像之间的跨视角理解能力。
  • 评估任务涵盖:跨视角对应、空间推理、目标定位、视角理解与视觉想象。

基准亮点

  • 支持卫星到地面地面到卫星双向推理。
  • 包含问答式标注式视角匹配式多种任务。
  • 提供多个互补的子集,覆盖不同难度与场景。
  • 超越传统识别与匹配任务,延伸至空间推理视觉想象

数据集结构

text CVSBench/ ├── cvusa/ │ ├── data/ # 原始图像与支持资源 │ ├── g2s/ # 地面到卫星推理任务 │ ├── s2g/ # 卫星到地面推理任务 │ └── gs_grounding/ # 跨视角目标定位与边界框标注任务 └── fov/ ├── data/ ├── g2s/ ├── s2g/ ├── gs_grounding/ ├── gs_view/ # 跨视角匹配任务(包含View-Arrow与View-Image两个设置) └── nanobanana/ # 用于视觉想象实验的3D迷你建筑模型图像

任务类型

  • g2s / s2g:跨视角推理(地面↔卫星)
  • gs_grounding:跨视角目标定位,输出边界框坐标
  • gs_view:视角匹配任务(方向箭头←→街景图像)

数据格式示例(标注式任务)

json { "img_id": "0001119_0", "task": "Ground2Sat", "source_image": "cvusa/data/streetview/0001119.jpg", "target_image": "cvusa/data/bingmap/input0001119.png", "target_bbox": [121.0, 196.6, 153.0, 234.6], "questions": [ { "level": 3, "question": "First image shows a street-view with a bounding box. In the second satellite image, provide the pixel bounding box coordinates [x_min, y_min, x_max, y_max] for the corresponding object.", "answer": [121.0, 196.6, 153.0, 234.6] } ], "dataset": "cvusa" }

许可信息

  • 许可证:CC-BY-4.0

应用场景

  • 视觉语言模型的跨视角推理基准测试
  • 卫星与街景图像的目标定位与视角对齐研究
  • 基于稀疏或局部观测的视觉想象研究

资源链接

搜集汇总
数据集介绍
CVSBench 数据集图片
构建方式
CVSBench是一个专为评估视觉语言模型在跨视角空间推理与想象能力而设计的基准数据集。其构建依托于CVUSA、University-1652等公开跨视角数据集,并在此基础上进行了系统性拓展与重构。数据集的构建过程涵盖了卫星图像与街景图像的双向对应关系,通过精心设计的任务框架,将数据划分为cvusa和fov两大子集。每个子集内部又细分为g2s(地面到卫星)、s2g(卫星到地面)、gs_grounding(跨视角目标定位)等不同任务族,并辅以fov子集中特有的gs_view视角匹配任务与nanobanana三维微型建筑模型数据,以支持视觉想象实验。所有数据均以JSONL格式组织,包含详细的图像路径、边界框坐标及多级难度的问题注释,确保了数据的高质量与任务多样性。
特点
CVSBench的核心特点在于其全面性、精细度与挑战性。与以往仅聚焦于检索或识别的跨视角基准不同,该数据集明确强调跨视角空间推理、目标定位、视角理解与视觉想象四大能力。其包含的任务类型丰富多元,既有问答式的语义推理,也有边界框级的精确定位,还有基于方向箭头与街景图像的双向匹配。特别值得注意的是,数据集引入了“视觉想象”这一前沿评估维度,通过fov子集中的nanobanana数据,要求模型基于不完整的跨视角线索想象未见场景内容,极大地提升了评估的深度与前沿性。此外,数据集的难度分级机制(如问题中的level字段)使得对不同能力层次的模型进行细致评估成为可能。
使用方法
使用CVSBench时,研究者可通过Hugging Face CLI工具便捷地下载完整数据集,命令为`huggingface-cli download zlyzlyzly/CVSBench --repo-type dataset --local-dir data/CVSBench`。数据集可直接用于视觉语言模型的跨视角推理能力基准测试,支持对模型在目标定位、视角匹配、空间推理及视觉想象等多维度性能的系统评估。官方提供的GitHub仓库中包含完整的评估脚本与代码示例,便于研究者复现实验结果。对于不同任务子集,用户需根据JSONL文件中的任务类型字段(如g2s、s2g、gs_grounding)选择对应的评估流程,并利用提供的边界框坐标与问题答案进行自动化打分。该数据集尤其适合用于对比不同视觉语言模型在跨视角理解任务上的优劣,以及推动模型在空间智能方面的突破。
背景与挑战
背景概述
跨视角空间推理是计算机视觉与地理空间智能交叉领域的前沿课题,其核心在于弥合卫星影像与地面视角之间巨大的视觉与语义鸿沟。尽管现有数据集在图像检索或场景识别方面取得了显著进展,但针对细粒度空间对应关系与跨模态想象能力的系统性评估仍十分匮乏。在此背景下,CVSBench数据集于2026年由西安交通大学等机构的研究人员提出,旨在构建一个全面、多任务的基准,用于评测视觉语言模型在卫星与街景图像间的空间推理、目标定位及视觉想象能力。该数据集基于CVUSA等资源构建,不仅涵盖了从地面到卫星与卫星到地面的双向推理任务,还创新性地引入了跨视角目标定位与视点匹配单元,显著拓展了跨视图理解的研究范畴,有望推动具身智能与空间智能系统的评估标准迈向新高度。
当前挑战
CVSBench数据集所应对的核心挑战在于视觉语言模型对异源视角几何与语义一致性的理解能力。卫星图像呈现的是俯视的、全局的、缺乏纹理信息的场景,而街景图像则是侧视的、局部的、富含外观细节的语义信息,两者之间的空间映射关系难以简单建模。该数据集专门设计了跨视角空间推理、目标框定位与视点匹配等任务,以探讨模型能否从部分观察中推断出完整的空间拓扑,并想象不可见视角的内容。在构建过程中,研究人员面临如何精准对齐俯视与侧视图像中同一对象的空间标注问题,这需要克服不同分辨率、不同光照条件以及遮挡噪声带来的标注误差。此外,将自然语言问题与多任务格式(如QA、框标注、视角匹配)相融合,对数据质量和一致性提出了极高的要求。
常用场景
经典使用场景
CVSBench作为跨视角空间推理与想象基准,其最经典的使用场景在于评估视觉语言模型在卫星与街景图像之间进行空间对应、目标定位与视角理解的能力。研究者借助该数据集,能够系统性地测试模型是否能够从卫星图像中推理出对应街景的空间位置,或从街景视角中定位到卫星图像中的具体目标。此外,数据集还设计了视角匹配任务,要求模型根据方向箭头或街景图像进行相互映射,从而全面考察模型对跨视角几何关系的理解深度。这些任务共同构筑了一个严苛的评测平台,推动模型从简单的图像识别迈向更高阶的空间推理。
解决学术问题
CVSBench着力解决了传统跨视角基准仅聚焦于检索或识别任务,而忽视空间推理与视觉想象能力的学术困境。以往的研究在跨场景对应、目标定位与视角理解方面缺乏系统化的评测工具,导致模型在这些关键能力上的进展难以量化。该数据集通过引入问答式、目标定位式及视角匹配式等多种任务形态,填补了跨视角空间推理评估的空白。其意义在于为学术界提供了一个标准化的横向对比平台,促使研究者开发能够真正理解空间关系与视角变换的智能模型,进而推动计算机视觉与地理空间智能的深度融合。
衍生相关工作
CVSBench的发布催生了一系列围绕跨视角推理与视觉想象的经典研究工作。一方面,研究者基于数据集中的视角匹配任务,开发了新的视角对齐算法,通过引入几何约束与注意力机制,提升了卫星与街景图像间的对应精度。另一方面,目标定位任务推动了跨场景物体检测与边界框回归方法的迭代,衍生出融合空间上下文与多尺度特征的定位网络。此外,视觉想象子任务激励了生成式模型在跨视角补全领域的探索,诸如结合扩散模型的跨视角图像合成工作逐渐兴起。这些衍生工作不仅验证了数据集作为基准的有效性,也反过来丰富了跨视角智能的研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务