遇见数据集

SRBench

收藏
arXiv2013-08-06 更新2024-06-21 收录
官方服务:

资源简介:

SRBench是由萨尔兰大学创建的一个用于评估配乐推荐系统性能的基准数据集。该数据集包含470首来自不同音乐风格的歌曲,旨在通过用户偏好判断来评估推荐系统的性能。数据集的创建过程涉及从Wikipedia和Last.fm等平台收集音乐风格和情感信息,以确保数据集的广泛覆盖性。SRBench的应用领域主要集中在评估和改进配乐推荐系统,旨在解决如何为特定图像集合推荐最合适的背景音乐的问题。

SRBench is a benchmark dataset developed by Saarland University for evaluating the performance of soundtrack recommendation systems. It contains 470 songs spanning various music genres, and is intended to assess the performance of recommendation systems via user preference judgments. The construction of SRBench involved collecting music genre and emotional information from platforms including Wikipedia and Last.fm, so as to ensure the comprehensive coverage of the dataset. The main application areas of SRBench focus on evaluating and improving soundtrack recommendation systems, aiming to solve the problem of recommending the most appropriate background music for a specific image collection.

提供机构:
萨尔兰大学
创建时间:
2013-08-06
搜集汇总
数据集介绍
构建方式
SRBench数据集以人类空间认知理论为基石,系统性地构建了涵盖心理旋转、空间可视化、空间关系及方向导航四大核心维度的评估框架。数据来源多元且互补:心理旋转测试包含程序化生成的200幅经典MRT图像(含简易与困难两个版本)及基于生成式AI(如Flux.1-dev与Stable Diffusion 3.5)合成的80幅逼真场景图;空间可视化任务通过Python脚本模拟折纸过程,生成200幅不同折叠次数与穿孔模式的图像;空间关系评估从Spatial-Obj数据集中精选400幅自然图像,涉及36种典型空间关系;方向与导航部分则整合了Maze-Nav的400幅迷宫路径图与EgoOrientBench的400幅以自我为中心的朝向判断图像。所有图像均配有多选题形式的问答对,确保评估的标准化与可复现性。
特点
该数据集最鲜明的特质在于其多维度的空间推理隔离评估设计,首次将心理旋转、空间可视化、空间关系与方向导航作为独立模块进行精细化测试,避免传统基准中空间推理与物体检测或语义理解任务相混淆的弊端。数据形态横跨程序化合成图像、生成式AI渲染场景与真实世界照片,构建了从受控环境到自然情境的连续光谱,使评估结果既具内部效度又具生态效度。尤为突出的是,数据集揭示了当前最先进的13个视觉语言模型在空间推理上的普遍困境——平均准确率仅略高于随机猜测(32.37%),其中心理旋转与折纸任务尤为薄弱,而空间关系与朝向判断则相对表现较好,这种鲜明的性能分化精准定位了模型能力的边界与瓶颈。
使用方法
使用SRBench时,研究者需将图像-问题对输入待评估的视觉语言模型,采用贪婪解码策略直接生成答案,并利用正则表达式从模型输出中提取选项进行匹配。数据集包含1800个标准化测试样本,各子集权重均衡(心理旋转、空间关系、方向导航各占22.2%,空间可视化占11.1%),便于计算加权总体准确率。为消除提示工程对结果的干扰,建议避免使用思维链或从简到繁等高级提示策略,以裸模型性能为基准。数据集已开源至HuggingFace平台,配套代码仓库提供PyTorch与Transformers库的完整评估管线,支持4×A100 40GB GPU环境下的批量推理,可复现论文中13个模型的全部实验结果。
背景与挑战
背景概述
空间推理作为认知科学的核心议题,长久以来被视为人类智能的基石,其内涵涵盖对物体位置、朝向及空间关系的理解与操纵。近年来,视觉语言模型在图像描述、视觉问答等任务中展现出卓越的多模态理解能力,然而其空间推理水平却始终悬而未决。由爱丁堡大学Ilias Stogiannidis、Steven McDonagh与Sotirios A. Tsaftaris于2025年提出的SRBench基准数据集,旨在系统性地填补这一评估空白。该研究团队首次将空间推理精细拆解为空间关系、方向与导航、心理旋转及空间可视化四个维度,并基于认知心理学经典测试范式,构建了包含1800个图像-问题对的综合性评估框架。通过对13款前沿视觉语言模型的深入评测,SRBench揭示了当前模型在空间推理任务上普遍表现接近随机水平的严峻现实,为领域内指明了亟待突破的关键瓶颈。
当前挑战
SRBench所揭示的挑战具有双重性。在领域问题层面,视觉语言模型的空间推理能力远未达到人类水准:多数模型在心理旋转与纸笔折叠任务中准确率仅徘徊于随机水平,即便在较易的方向感知任务中,部分模型的表现亦不及预期,暴露出模型对几何变换与空间语境理解的系统性匮乏。在数据集构建层面,挑战同样显著:研究团队需从认知心理学文献中提炼可计算化的评估范式,将心理旋转测试、纸笔折叠测试等经典人类测验转化为适用于视觉语言模型的视觉刺激;同时,为确保评估的生态效度,数据集需融合程序化生成、生成式AI合成与真实世界图像三类数据,并确保各维度任务间互不干扰,以精准隔离空间推理能力与其他视觉语义能力的混杂效应。
常用场景
经典使用场景
在视觉与语言模型蓬勃发展的当下,空间推理能力的评估始终缺乏系统性与独立性。SRBench数据集应运而生,它巧妙借鉴人类认知科学中的经典范式,将空间推理拆解为心理旋转、空间可视化、空间关系理解以及方向导航四大核心维度。通过融合程序化生成的抽象图形、生成式AI创造的逼真场景以及真实世界的自然图像,该数据集为模型提供了从受控实验室环境到开放现实世界的渐进式评估桥梁。研究者可利用此基准,精准剖析视觉语言模型在理解物体相对位置、识别旋转不变性、模拟折叠展开等空间变换任务中的真实表现。
衍生相关工作
SRBench的诞生催生了一系列旨在突破空间推理瓶颈的后续研究。受其组件化评估框架启发,研究者们开始探索针对特定空间能力的专项训练策略,如SpatialVLM通过构建三维场景图来增强模型的空间感知能力,SpatialRGPT则创新性地将深度信息融入视觉编码器以改善空间关系理解。同时,Sparkle等工作尝试将基础空间技能(方向判断、距离估计)进行组合,以应对更复杂的复合空间推理任务。这些衍生工作共同构成了一个以SRBench为起点的研究生态,持续推动着视觉语言模型在空间认知领域从“感知”向“理解”的质变。
数据集最近研究
最新研究方向
当前,视觉-语言模型(VLM)在图像描述、视觉问答等任务中表现卓越,但其空间推理能力仍是一个亟待突破的瓶颈。针对这一痛点,SRBench数据集应运而生,它从认知科学中汲取灵感,系统解构了空间推理的四大核心要素:空间关系、方位导航、心理旋转与空间可视化。该数据集不仅整合了程序化生成的合成图像与真实世界照片,更创新性地引入生成式AI(GenAI)图像,构建了从受控实验室到自然场景的评估桥梁。前沿研究揭示,即便如GPT-4o、InternVL2.5等顶尖模型,在SRBench上的平均准确率也仅徘徊于随机水平(约32%),尤其在心理旋转与纸折叠任务中暴露了根本性缺陷。这一发现深刻挑战了当前VLM“视觉理解”的边界,为机器人导航、增强现实等需要精密空间认知的应用领域敲响了警钟,并推动了学界从单纯提升模型规模转向构建真正具备类人空间智能的新型架构。
相关研究论文
  • 1
    Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models爱丁堡大学 · 2025年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务