遇见数据集

SpatialGen-Bench

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

SpatialGen-Bench是一个用于诊断图像生成模型和文本输出视觉语言模型(VLM)空间认知能力的基准数据集。它旨在评估模型在空间相关任务上的表现,涵盖视觉问答和图像到图像两种任务类别。数据集包含470个样本,这些样本被组织为14个子任务,并归属于四个核心能力层级:感知(Perception,包含计数、深度、方向、物体大小等子任务,共145个样本)、理解(Understanding,包含关系、视角、心理建模、空间基础等子任务,共140个样本)、推理(Reasoning,包含多跳、预测、几何可行性等子任务,共90个样本)以及交互(Interaction,包含功能可供性、导航、轨迹等子任务,共95个样本)。每个样本以JSON Lines格式存储,包含唯一标识符(id)、所属能力层级(capability)、子任务名称(task)、图像路径(image_path,相对于benchmarks/目录)、有序的输入图像路径列表(media_paths,用于单图或多图任务)、可选的真实掩码路径(mask_path)、问题(question)、规范化字符串形式的答案(answer)、答案类型(answer_type)、选项列表(choices)、数据来源(source)、来源标识符(source_id)以及任务特定的序列化元数据(metadata_json)。数据集可通过Hugging Face Datasets库直接加载。注释和协议配置遵循Apache-2.0许可证,而其中引用的媒体文件则受其各自上游数据集的许可条款约束。

创建时间:
2026-07-17
原始信息汇总

数据集概述:SpatialGen-Bench

SpatialGen-Bench 是一个用于评估图像生成模型和文本输出视觉语言模型(VLM)空间认知能力的诊断性基准测试集。当前版本为 v1.1。

  • 语言: 英语
  • 数据集规模: 小于 1000 条样本(n<1K)
  • 任务类别: 视觉问答、图像到图像

数据集结构

数据集包含 470 条测试样本,横跨 14 个子任务,并按能力划分为四个层级:

能力层级 子任务 样本数
感知 计数、深度、方向、物体大小 145
理解 关系、视角、心理建模、空间定位 140
推理 多跳、预测、几何可行性 90
交互 可供性、导航、轨迹 95

数据字段

每条记录(JSONL 格式)包含以下字段:

  • id: 稳定的样本标识符
  • capability: 能力层级(感知/理解/推理/交互)
  • task: 子任务名称
  • image_path: 相对于 benchmarks/ 目录的图像路径
  • media_paths: 所有有序输入图像路径(支持单图或多图任务)
  • mask_path: 可选的真实掩码路径
  • question: 问题文本
  • answer: 归一化后的字符串答案
  • answer_type: 答案类型
  • choices: 选项列表
  • source: 数据来源
  • source_id: 来源标识符
  • metadata_json: 任务特定的序列化元数据

文件组织

SpatialGen-Bench/ ├── data/ │ └── spatialgen_bench.jsonl # 主数据文件 ├── benchmarks/ # 媒体文件目录 │ ├── perception/ │ ├── understanding/ │ ├── reasoning/ │ └── interaction/ ├── protocols/ │ └── spatialgen_bench.yaml # 视觉-答案合约协议 ├── SOURCES.md # 任务来源与许可详情 └── LICENSE # 许可证文件


加载方式

使用 Hugging Face datasets 库加载:

python from datasets import load_dataset dataset = load_dataset("wx91726/SpatialGen-Bench", split="test")

也可通过以下命令下载完整评估包:

bash hf download wx91726/SpatialGen-Bench --repo-type dataset --local-dir SpatialGen-Bench

媒体字段中的路径是相对于 benchmarks/ 目录的路径。运行时协议实现和解析器维护在 ProVisE 项目中。


许可证

  • SpatialGen-Bench 的标注和协议配置:采用 Apache-2.0 许可证
  • 源媒体文件:受其上游数据集的许可证和条款约束(详见 SOURCES.md

引用

bibtex @misc{wang2026showdonttell, title = {Show, Dont Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text}, author = {Wang, Xu and Yao, Kaixiang and Pan, Miao and Zhou, Xiaohe and Liu, Xuanyu and Zhang, Wenqi and Zhang, Xuhong}, year = {2026} }


致谢

数据集构建过程中使用了以下公开数据集和评估资源:CountBench, BLINK, EgoOrientBench, VSR, ViewSpatial-Bench, MindCube, VisWorld-Eval, RoboAfford-Eval, ShareRobot-Bench, PhysBench, SPHERE-VLM, 以及 RefCOCOg。

搜集汇总
数据集介绍
SpatialGen-Bench 数据集图片
构建方式
SpatialGen-Bench是专为评估生成模型与视觉语言模型空间认知能力而设计的诊断性基准。其构建过程历经系统性策划,从CountBench、BLINK、EgoOrientBench等多个公开数据集中精选并整合任务设计,形成涵盖感知、理解、推理与交互四大能力层级的14个子任务,共计470个测试样本。每个样本以JSONL格式存储,包含唯一标识符、能力类别、子任务名称、图像路径、多模态输入序列、可选掩码路径、标准化问题与答案、答案类型及选项,并附带来源与序列化元数据。此外,数据集提供版本化的视觉-答案协议文件,确保评估过程具有可重复性与标准化执行框架。
特点
该基准最显著的特点在于其多维度的空间认知评估结构,通过四大能力层级——感知、理解、推理与互动——对模型进行递进式诊断。感知层涵盖计数、深度、方向与物体尺寸等基础判别任务;理解层则深入关系理解、视角转换、心理建模与空间定位;推理层要求模型执行多跳推理、预测与几何可行性判断;互动层聚焦于可操作性、导航与轨迹规划。这种分层设计使研究者能够精准定位模型在空间认知链条中的薄弱环节,同时支持单一图像与多图像输入任务,覆盖从基础视觉处理到高级空间推理的全谱系挑战。
使用方法
使用者可通过Hugging Face Datasets库便捷加载该基准测试集,执行"load_dataset('wx91726/SpatialGen-Bench', split='test')"命令即可获取全部样本。由于媒体字段存储的是相对于仓库目录的路径,建议运行"hf download"命令将完整评估包下载至本地,以确保图像文件可被正确访问。该数据集还提供了版本化的视觉-答案协议文件(protocols/spatialgen_bench.yaml),配合ProVisE库中的运行时协议实现与解析器,可构建标准化、可复现的评估流水线,从而对图像生成模型及文本输出视觉语言模型的空间认知能力进行系统性评测。
背景与挑战
背景概述
在视觉与语言交叉领域,空间认知能力是衡量生成式模型理解物理世界的关键维度。然而,现有基准多依赖文本输出评估,难以捕捉像素级空间推理的细微差异。SpatialGen-Bench由Wang等人于2026年提出,旨在填补这一空白,通过诊断图像生成模型与文本输出视觉语言模型的空间认知能力,推动模型从感知走向交互。该数据集包含470个样本,覆盖感知、理解、推理与交互四个能力层次下14项子任务,其设计整合了CountBench、BLINK等多源资源,为评估模型的计数、深度、几何可行性等空间技能提供了标准化测试。作为首个聚焦空间认知的诊断基准,它对理解模型在真实世界导航、机器人操作等应用中的潜力具有里程碑意义。
当前挑战
SpatialGen-Bench所面临的挑战首先体现在领域问题上:现有视觉语言模型在文本问答中表现优异,但在生成图像时往往忽略空间一致性,如物体大小比例失调、深度关系混淆,这源于模型缺乏显式的空间规则学习。基准构建过程亦充满难题,包括如何从多源数据中提取与空间认知相关的子任务,并确保样本间难度均衡而不冗余;同时,需设计统一的协议以兼容零样本与微调评估,避免上游数据许可冲突。此外,像素级答案的验证机制(如掩码路径)要求精确定义视觉正确性,这对现有评估框架构成技术挑战,尤其在几何可行性与轨迹预测等交互任务中,多模态输出的对齐与评估仍待突破。
常用场景
经典使用场景
SpatialGen-Bench作为空间认知诊断基准,专为评估图像生成模型与文本输出视觉语言模型的空间智能而设计。它涵盖感知、理解、推理与交互四个能力层级,包含计数、深度、方位、物体大小、关系理解、视角变换、心理建模、多跳推理、几何可行性、可操作空间、导航与轨迹等14项子任务。研究者常利用这组精心构建的470个样本,系统性地剖析模型在多维度空间任务上的表现短板,尤其关注模型是否能超越简单的语言描述,真正掌握空间结构的内在逻辑。
衍生相关工作
该基准的构建借鉴了CountBench、BLINK、VSR、RefCOCOg等经典工作的任务设计理念,同时其发布也激发了后续多项衍生研究。例如,ProVisE项目基于本基准的协议格式开发了运行时协议实现与解析器,降低了其他研究者复用评估框架的门槛。此外,SPHERE-VLM和PhysBench等数据集在任务粒度与评估协议设计上明显受到SpatialGen-Bench层级化能力划分的启发,推动了视觉空间评估从单一指标向多维度、多模态联合分析的方向演化。
数据集最近研究
最新研究方向
SpatialGen-Bench作为首个聚焦图像生成模型与文本输出视觉语言模型空间认知能力的诊断基准,其研究前沿正围绕“从文本推理走向像素级空间表达”这一核心命题展开。该基准通过构建涵盖感知、理解、推理与交互四大能力层级的14项子任务,精准评估模型在数量计数、深度估计、空间关系推理及交互可行性判断等维度的生成质量,直接回应当前多模态大模型在机器人操作、自动驾驶与增强现实等具身智能场景中对空间几何理解与物理世界映射的迫切需求。相关热点事件包括大模型在空间问答任务中表现出的“语言捷径”现象——即模型虽能正确描述空间关系,却在图像生成中出现矛盾布局——这凸显了仅依赖文本范式评估的局限性,而SpatialGen-Bench通过强制模型以生成像素而非输出文本来展示空间理解,为衡量机器视觉智能的“真正空间推理能力”提供了更鲁棒的评估框架,对推动通用视觉模型从“能说”到“会做”的范式迁移具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务