SpatialGen-Bench
收藏资源简介:
SpatialGen-Bench是一个用于诊断图像生成模型和文本输出视觉语言模型(VLM)空间认知能力的基准数据集。它旨在评估模型在空间相关任务上的表现,涵盖视觉问答和图像到图像两种任务类别。数据集包含470个样本,这些样本被组织为14个子任务,并归属于四个核心能力层级:感知(Perception,包含计数、深度、方向、物体大小等子任务,共145个样本)、理解(Understanding,包含关系、视角、心理建模、空间基础等子任务,共140个样本)、推理(Reasoning,包含多跳、预测、几何可行性等子任务,共90个样本)以及交互(Interaction,包含功能可供性、导航、轨迹等子任务,共95个样本)。每个样本以JSON Lines格式存储,包含唯一标识符(id)、所属能力层级(capability)、子任务名称(task)、图像路径(image_path,相对于benchmarks/目录)、有序的输入图像路径列表(media_paths,用于单图或多图任务)、可选的真实掩码路径(mask_path)、问题(question)、规范化字符串形式的答案(answer)、答案类型(answer_type)、选项列表(choices)、数据来源(source)、来源标识符(source_id)以及任务特定的序列化元数据(metadata_json)。数据集可通过Hugging Face Datasets库直接加载。注释和协议配置遵循Apache-2.0许可证,而其中引用的媒体文件则受其各自上游数据集的许可条款约束。
数据集概述:SpatialGen-Bench
SpatialGen-Bench 是一个用于评估图像生成模型和文本输出视觉语言模型(VLM)空间认知能力的诊断性基准测试集。当前版本为 v1.1。
- 语言: 英语
- 数据集规模: 小于 1000 条样本(n<1K)
- 任务类别: 视觉问答、图像到图像
数据集结构
数据集包含 470 条测试样本,横跨 14 个子任务,并按能力划分为四个层级:
| 能力层级 | 子任务 | 样本数 |
|---|---|---|
| 感知 | 计数、深度、方向、物体大小 | 145 |
| 理解 | 关系、视角、心理建模、空间定位 | 140 |
| 推理 | 多跳、预测、几何可行性 | 90 |
| 交互 | 可供性、导航、轨迹 | 95 |
数据字段
每条记录(JSONL 格式)包含以下字段:
id: 稳定的样本标识符capability: 能力层级(感知/理解/推理/交互)task: 子任务名称image_path: 相对于benchmarks/目录的图像路径media_paths: 所有有序输入图像路径(支持单图或多图任务)mask_path: 可选的真实掩码路径question: 问题文本answer: 归一化后的字符串答案answer_type: 答案类型choices: 选项列表source: 数据来源source_id: 来源标识符metadata_json: 任务特定的序列化元数据
文件组织
SpatialGen-Bench/ ├── data/ │ └── spatialgen_bench.jsonl # 主数据文件 ├── benchmarks/ # 媒体文件目录 │ ├── perception/ │ ├── understanding/ │ ├── reasoning/ │ └── interaction/ ├── protocols/ │ └── spatialgen_bench.yaml # 视觉-答案合约协议 ├── SOURCES.md # 任务来源与许可详情 └── LICENSE # 许可证文件
加载方式
使用 Hugging Face datasets 库加载:
python from datasets import load_dataset dataset = load_dataset("wx91726/SpatialGen-Bench", split="test")
也可通过以下命令下载完整评估包:
bash hf download wx91726/SpatialGen-Bench --repo-type dataset --local-dir SpatialGen-Bench
媒体字段中的路径是相对于 benchmarks/ 目录的路径。运行时协议实现和解析器维护在 ProVisE 项目中。
许可证
- SpatialGen-Bench 的标注和协议配置:采用 Apache-2.0 许可证
- 源媒体文件:受其上游数据集的许可证和条款约束(详见
SOURCES.md)
引用
bibtex @misc{wang2026showdonttell, title = {Show, Dont Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text}, author = {Wang, Xu and Yao, Kaixiang and Pan, Miao and Zhou, Xiaohe and Liu, Xuanyu and Zhang, Wenqi and Zhang, Xuhong}, year = {2026} }
致谢
数据集构建过程中使用了以下公开数据集和评估资源:CountBench, BLINK, EgoOrientBench, VSR, ViewSpatial-Bench, MindCube, VisWorld-Eval, RoboAfford-Eval, ShareRobot-Bench, PhysBench, SPHERE-VLM, 以及 RefCOCOg。




