遇见数据集

SpatialSceneQA

收藏
github2026-06-09 更新2026-06-10 收录
数据链接:
官方服务:

资源简介:

一个包含61k样本的空间音频-视觉基准数据集,将RGB-D观测与4通道一阶Ambisonic音频配对,并提供3D度级监督。数据注释位于`data/`目录下,JSON格式遵循`data/example_data.json`。

A spatial audio-visual benchmark dataset containing 61,000 samples that pairs RGB-D observations with 4-channel first-order Ambisonic audio and offers 3D degree-level supervision. Data annotations are located in the `data/` directory, with the JSON format conforming to the specification provided in `data/example_data.json`.

创建时间:
2026-05-20
原始信息汇总

数据集概述:SpatialSceneQA

SpatialSceneQA 是一个用于三维空间音频-视觉定位与推理的基准数据集,包含 61,000 个样本。

核心特性

  • 模态组合:配对 RGB-D(红绿蓝-深度)观测与 4通道一阶环绕声(FOA) 音频。
  • 监督粒度:提供 度级方位角/仰角 监督信号,支持波达方向估计、3D边界框定位及多说话人匹配任务。
  • 数据规模:61k 样本。

构建流程

  • 使用来自 LibriSpeechtrain-clean-100dev-cleantest-clean 分割)的干单声道语音,与提供的房间脉冲响应(RIR)进行卷积,生成空间化音频。
  • RIR 数据可从 Hugging Face 下载:SpatialSceneQA
  • 注释文件以 JSON 格式提供,示例见 data/example_data.json

数据分割

  • 训练集:基于 train-clean-100
  • 验证集:基于 dev-clean
  • 测试集:基于 test-clean

许可协议

  • Apache 2.0
搜集汇总
数据集介绍
SpatialSceneQA 数据集图片
构建方式
SpatialSceneQA数据集的构建依托于在模拟物理环境中同步采集RGB-D视觉观测与四通道一阶声场环绕声(FOA)信号,并辅以精确至度级别的三维空间标注。具体而言,研究团队利用房间脉冲响应(RIR)卷积来自LibriSpeech的干式单声道语音,生成具有真实混响与多源重叠特性的空间音频。数据集包含61,000个样本,每个样本均附带方位角与仰角的方向到达(DoA)标注、3D边界框定位以及多说话人匹配信息,从而构建起一个多模态、多层次的三维空间感知基准。
特点
该数据集的核心特点在于其兼具视觉与听觉模态的联合空间标注能力,不仅提供RGB-D图像与FOA音频的配对数据,还通过Neural Intensity Vector(Neural IV)机制学习稳健的空间音频表示,使其在混响与声源重叠场景下仍能保持精确的方向估计。此外,数据集的标注粒度达到度级别,支持从粗粒度的事件描述到细粒度声源定位的推理任务,为三维空间中的视听联合理解与推理提供了前所未有的基准测试平台。
使用方法
使用SpatialSceneQA数据集时,首先需从HuggingFace下载RIR文件,并通过提供的脚本与LibriSpeech语音进行卷积生成空间音频。随后按照示例JSON格式组织标注文件,并在配置文件中指定数据与模型路径。模型训练需在3个节点共24块A100 GPU上运行,使用Accelerate框架启动。推理阶段则分为音频独立、视觉独立与音视频联合三种模式,通过对应脚本完成8路数据并行推理后合并结果,解码超参数在独立配置文件中调整。
背景与挑战
背景概述
SpatialSceneQA数据集诞生于2026年,由清华大学研究人员刘展、唐常力、王宇欣等人联合打造,隶属于JAEGER框架的核心组成部分。该数据集旨在解决三维空间中音频与视觉联合定位与推理这一前沿课题,通过提供61k样本的基准测试,将视角从传统二维图像拓展至沉浸式三维环境。研究者利用RGB-D观测与四通道一阶环绕声(FOA)音频,实现了波达方向估计、3D框定位以及多说话人匹配等精细任务,推动了多模态大语言模型在空间智能领域的发展。其构建过程基于仿真物理环境,融合了实际房间脉冲响应与LibriSpeech语音数据,为跨模态空间理解提供了高精度的评估平台。
当前挑战
当前SpatialSceneQA数据集面临的挑战主要集中于领域问题与构建过程两方面。在领域问题上,三维音频-视觉联合推理需要克服复杂声学环境中的混响干扰与多源重叠,传统方法在波达方向估计上常因噪声和回声产生显著偏差,而RGB-D与FOA的异质融合缺乏鲁棒的空间对齐机制。在构建过程中,数据集的生成依赖于仿真环境的准确性,例如房间脉冲响应的采集需平衡真实度与计算成本,同时61k样本的标注要求对每个样本提供度级方位角和仰角监督,人工验证成本极高。此外,跨模态数据的高效协同训练仍需应对模型在长尾场景下的泛化瓶颈。
常用场景
经典使用场景
在三维空间智能感知领域,SpatialSceneQA数据集被广泛用于训练和评估多模态模型在复杂声学与视觉环境中的联合定位与推理能力。该数据集通过配对RGB-D视觉观测与四通道一阶环境立体声(FOA)音频,提供了包含方位角与俯仰角度级监督的61k样本,支持波达方向估计、三维空间边界框定位以及多说话人匹配等经典任务。研究者常将其作为基准,用以检验模型在混响与重叠声源干扰下的空间理解鲁棒性。
解决学术问题
该数据集填补了三维音频-视觉联合推理领域缺乏高精度空间监督数据集的空白,解决了以往模型仅能在二维图像或单通道音频上进行粗糙定位的局限。通过提供度级别的方位与俯仰标注,SpatialSceneQA使得端到端的三维声源定位与视觉目标关联成为可能,显著推动了多模态感知在复杂物理场景中的研究进展。其发布促使学界重新审视空间音频表征与视觉线索间的协同机制,为后续构建更具生态效度的跨模态推理模型奠定了数据基础。
衍生相关工作
基于SpatialSceneQA数据集,研究者开发了JAEGER框架,其核心创新包括Neural Intensity Vector(神经强度向量)这一可学习的空间音频表征,以及将RGB-D与FOA融合至Qwen2.5-Omni-7B大语言模型中的端到端架构。该数据集还催生了一系列后续工作,如改进的视听定位网络、面向复杂声场的高阶Ambisonics建模方法,以及融合语言指令的空间场景问答系统。这些衍生工作共同推动了三维空间感知从实验室仿真环境向真实世界部署的跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务