CT-SpatialVQA
收藏官方服务:
资源简介:
CT-SpatialVQA 是一个用于评估 3D CT 图像中语义空间推理能力的基准数据集。它来源于 CT-RATE 数据集,包含 1,601 个 CT 体积(CT-RATE 验证集)和 9,077 个问答对。问题被设计为需要明确的空间定位,涵盖六个类别:左右与双侧对称性(如左右区分、双侧受累)、纵向位置(如上下、中下部)、前后关系(如前侧与后侧结构)、内外方向(如中心、外周、内侧、外侧)、相邻性与包含关系(如与某结构相邻或位于其内部)、空间范围与边界(如大小、边界、分布)。每个样本包含案例 ID、CT 体积路径、问题和参考答案。该数据集适用于评估医学视觉语言模型在 3D 空间推理任务上的表现。使用时需先通过 Hugging Face 数据集库加载问答对,并单独下载相应的 CT 体积。
创建时间:
2026-09-03
搜集汇总
数据集介绍

构建方式
CT-SpatialVQA脱胎于CT-RATE数据集的验证集划分,涵盖1,601例三维CT体数据与9,077组问答对。其构建围绕语义-空间推理这一核心诉求,由领域专家针对每例CT设计需要显式空间定位方可作答的问题,并给出参考答复。问题覆盖侧别与双侧对称、纵向位置、前后深度关系、内外侧方位、毗邻与包含关系、空间范围与边界六大维度,确保模型必须在三维解剖语境中完成推理而非依赖纯语义线索。
特点
该基准的突出特征在于将评测重心从传统医学视觉问答的诊断分类转向三维空间关系理解,兼具语义与几何双重约束。问题设计具有明确的空间接地要求,覆盖六个互补的空间类别,能够系统性检验模型对左右、上下、前后、中心与周边等解剖方位以及毗邻、包含、范围边界的把握。数据集规模适中,1,601例体数据对应9,077组问答,多组问答共享同一体数据,契合真实临床中单次扫描需回答多角度空间询问的场景。
使用方法
使用该基准时,首先通过datasets库加载测试划分,获得包含case_id、ctrate_path、question与answer字段的问答对集合。由于CT体数据未随本数据集分发,需依据ctrate_path字段从CT-RATE仓库(受限访问,须接受相关条款)下载对应的全部1,601例体数据,并按路径结构保存至本地目录。评估阶段遍历问答对,借助nibabel等工具读取对应体数据,将三维CT与问题输入待评测模型,将其输出与参考答复比对,从而在统一流程下完成语义-空间推理能力的量化评价。
背景与挑战
背景概述
三维医学影像的语义理解长期受制于空间推理能力的评估空白。CT-SpatialVQA于2026年由Monon、Rahman等学者提出,依托CT-RATE大规模胸部CT数据集构建,包含1,601例体积与9,077组问答对,系首个面向三维CT语义-空间推理的系统性基准。该数据集聚焦六类空间关系,涵盖左右对称、上下方位、前后深度、内外侧向、毗邻包含及空间范围,旨在检验视觉语言模型对解剖结构的立体定位能力。其出现填补了二维医学VQA向三维空间认知跃迁的关键缺口,为放射学报告生成与临床决策支持提供了可量化的评测范式。
当前挑战
该基准所应对的核心领域难题在于三维医学影像中空间语义的精确解析与语言对齐。现有视觉语言模型多基于二维切片或投影图像训练,难以捕捉CT体积中固有的纵深层次与解剖毗邻关系,导致在左右判别、上下定位及包含关系等任务上表现欠佳。构建过程中面临多重挑战:从CT-RATE验证集筛选并标注1,601例体积需确保空间问题的临床相关性与答案一致性,9,077组问答需覆盖六类空间范畴且避免语义歧义;三维体积与文本配对的标注成本高昂,且需依赖门控数据访问机制,限制了基准的复现与扩展。
常用场景
经典使用场景
在三维医学影像理解与视觉语言推理领域,CT-SpatialVQA构筑了一座专门评估语义-空间推理能力的基准桥梁,其典型使用场景聚焦于对3D CT体积中解剖结构的方位判别与空间关系建模。该基准涵盖侧别与双侧对称、纵向垂直位置、前后深度关系、内外侧方位、毗邻与包含关系以及空间范围与边界六大维度,要求模型在回答问题时必须将语义识别与显式空间定位紧密结合。研究者通常将1601例CT体积与9077组问答对作为测试床,驱动3D医学视觉语言模型在自由文本生成范式下完成方位敏感的问答任务,从而系统检验模型对体积数据中复杂空间构型的表征与推理水平。
解决学术问题
该数据集精准回应了当前3D医学视觉语言模型在空间理解评测上的结构性空白问题。既往基准多侧重于病灶分类或语义描述,对模型是否真正理解左侧与右侧、上部与下部、前部与后部等方位关系缺乏细粒度诊断工具。CT-SpatialVQA通过构建覆盖六大空间范畴的问答对,将模型在医学影像中的空间推理能力从模糊的整体评价中剥离出来,促成对左右混淆、深度误判、邻接关系失察等典型失败模式的量化归因。其意义在于为多模态大模型的空间智能提供了可复现的评测标尺,推动学术界从语义匹配层面向真实空间认知层面深入,并对临床场景中方位错误可能引发的安全风险形成前置性预警。
衍生相关工作
CT-SpatialVQA脱胎于CT-RATE这一大规模三维CT多模态数据集,其构建直接受益于CT-RATE所提供的1601例验证集体积与配套报告,两者在数据血缘上形成衍生关系。围绕该基准,研究者已展开针对3D医学视觉语言模型空间理解短板的系统性评测工作,相关成果集中体现于其配套论文《Lost in Volume》中,揭示了当前模型在体积空间推理任务上的普遍性困境。该基准亦为后续空间感知型医学多模态模型的架构设计提供了反馈信号,可能催生融合显式三维位置编码与解剖先验的改进方案,并推动更细粒度空间关系标注数据集的出现与迭代。
以上内容由遇见数据集搜集并总结生成




