遇见数据集

BTUMQA

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

BTUMQA(Brain Tumor MRI Visual Question Answering Dataset)是一个大规模脑肿瘤MRI视觉问答数据集,专门用于可控研究评估。该数据集包含225,000个问答对,每个问答对对应一张2D MRI切片。数据来源于RSNA BraTS 2021 2D数据集(Kaggle)。数据集文件以CSV格式组织,包含训练集(157,501个问答对)、验证集、测试集以及全量问答对池。每个CSV文件包含47个字段,涵盖核心VQA字段(如qa_id、question、answer、split、difficulty_level、answer_type)、图像与患者元数据(如patient_id、slice_id、modality_context)、问题元数据(如question_family、question_style、template_id、region_target_primary等)、区域面积统计(如edema_area_pixels等)、不确定性及调制权重估计(通过MC-Dropout计算,如edema_uncertainty、edema_weight等)以及中间生成token文件引用。数据集适用于视觉问答、医学图像分析、不确定性建模等研究任务。注意:本数据集仅供研究使用,不用于临床诊断或治疗。

BTUMQA (Brain Tumor MRI Visual Question Answering Dataset) is a large-scale brain tumor MRI visual question answering dataset designed for controlled research evaluation. It contains 225,000 question-answer pairs, each corresponding to a 2D MRI slice. The data originates from the RSNA BraTS 2021 2D dataset (Kaggle). The dataset is organized in CSV format, including training set (157,501 pairs), validation set, test set, and full QA pool. Each CSV file contains 47 fields, covering core VQA fields (e.g., qa_id, question, answer, split, difficulty_level, answer_type), image and patient metadata (e.g., patient_id, slice_id, modality_context), question metadata (e.g., question_family, question_style, template_id, region_target_primary, etc.), region area statistics (e.g., edema_area_pixels, etc.), uncertainty and modulation weight estimation (computed via MC-Dropout, e.g., edema_uncertainty, edema_weight, etc.), and intermediate generated token file references. The dataset is suitable for research tasks such as visual question answering, medical image analysis, and uncertainty modeling. Note: This dataset is for research purposes only and not for clinical diagnosis or treatment.

创建时间:
2026-07-24
原始信息汇总

BTUMQA: 脑肿瘤MRI视觉问答数据集

数据集概述

BTUMQA是一个大规模视觉问答(VQA)数据集,专为脑肿瘤MRI扫描图像的受控研究评估而设计,包含225,000个问答对,映射到2D MRI切片。该数据集源自论文**"AUGR-VQA: Question-Adaptive Uncertainty-Guided Regional Reasoning for Reliable Brain Tumor MRI Visual Question Answering"**,其患者切片信息和基础图像来自Kaggle上的RSNA BraTS 2021 2D数据集

数据集规模与许可

  • 许可协议: Apache 2.0
  • 语言: 英语
  • 任务类型: 视觉问答、问答
  • 数据集规模: 100K < n < 1M
  • 标签: 医学、脑肿瘤、MRI、VQA、BTUMQA

数据集结构

数据集文件组织在btumqa_225k/子文件夹中,包含以下文件:

文件 说明
btumqa_225k_qa_pairs.csv 完整的225,000个问答对池,含图像引用
btumqa_225k_train.csv 训练集划分(157,501个问答对)
btumqa_225k_val.csv 验证集划分
btumqa_225k_test.csv 测试集划分

数据字段

每个CSV文件包含47个字段,分为以下类别:

核心VQA字段

  • qa_id: 问答对的唯一标识符
  • question: 关于MRI切片的自然语言问题
  • answer: 目标标准答案
  • split: 数据集划分(train/val/test)
  • difficulty_level: 问题难度级别(easy/medium/hard)
  • answer_type: 答案类型(如classification)

图像与患者元数据

  • patient_id: RSNA BraTS 2021中的患者标识符
  • slice_id/image_id: MRI切片索引号
  • unique_id: 患者与切片的组合标识符(如00000_049
  • modality_context: 可用MRI模态(如FLAIR|T1|T1ce|T2

问题元数据

  • question_family: 语义模板族(如confidence_qualified_presenceuncertainty_gap_bucketdominant_region_under_uncertainty
  • question_style: 问题格式样式(如confidence_qualifiedbucketedambiguity_sensitive
  • template_id/paraphrase_id: 底层模板和自然语言改写的标识符
  • region_target_primary/region_target_secondary: 问题中涉及的目标脑区(如edemaenhancingtumor

区域面积统计(像素)

  • edema_area_pixelsncr_net_area_pixelsenhancing_area_pixelstumor_area_pixelscontext_area_pixelsglobal_area_pixels: 各分割区域的表面积

不确定性与调制权重估计(MC-Dropout)

  • edema_uncertaintyncr_net_uncertaintyenhancing_uncertaintytumor_uncertaintycontext_uncertaintyglobal_uncertainty: MC-dropout像素级方差分数
  • edema_weightncr_net_weightenhancing_weighttumor_weightcontext_weightglobal_weight: 用于令牌调制的区域权重系数
  • mc_dropout_passes: MC-dropout前向传递次数(如20)

生成的中间令牌文件引用

  • phase2a_token_fileslice_index_in_token_filephase2c_fileslice_index_in_ugtm_file: 指向提取的视觉令牌和UGTM调制令牌的文件路径及切片索引。注意:实际令牌文件不在此仓库中托管,这些路径代表通过官方AUGR-VQA代码仓库运行数据处理管道后文件将被保存的位置。

使用方式

可通过Hugging Face datasets库直接加载CSV文件,例如加载训练集:

python from datasets import load_dataset

train_dataset = load_dataset( "shuvomonowar00/BTUMQA", data_files="btumqa_225k/btumqa_225k_train.csv" )

重要说明

⚠️ 警告: 该数据集是受控研究评估资源,适用于临床诊断、患者治疗或实际临床工作流程部署。

相关链接

搜集汇总
数据集介绍
BTUMQA 数据集图片
构建方式
BTUMQA数据集是基于RSNA BraTS 2021 2D MRI影像数据构建的大规模视觉问答资源,涵盖225,000个问答对,映射至二维MRI切片。构建流程融合了多模态医学影像分析与不确定性量化技术,通过MC-Dropout方法估计像素级不确定性,并据此生成区域权重系数,用于后续的令牌调制。数据集的构建不仅包含基础的问答对,还涉及问题模板与自然语言释义的生成,以及区域面积统计。整个构建过程遵循严格的受控研究评估原则,确保数据集的科学性和可复现性。
特点
BTUMQA数据集的显著特点在于其丰富的语义层次和精细的注释结构。每个问答对均附带难度等级、答案类型、问题家族及风格等多维度标签。此外,数据集提供了详细的区域面积统计和不确定性估计,包括水肿、坏死、增强肿瘤等区域的像素级指标。其独特的不确定性引导的问答设计,使得模型能够处理医学图像中的歧义和不确定性,适用于开发鲁棒性强的医学视觉问答系统。数据集的规模与多样性,为脑肿瘤MRI的自动理解提供了坚实的基准。
使用方法
使用BTUMQA数据集时,可通过Hugging Face的datasets库直接加载CSV文件,方便快捷地获取训练、验证和测试分割。支持分别加载各分割数据或完整问答池,便于进行模型训练、验证及基准测试。数据集中的字段涵盖了从基础问答对到高级不确定性指标的完整信息,研究者可灵活利用这些数据进行多任务学习或特征工程。由于token文件需通过官方代码仓库动态生成,建议用户参考AUGR-VQA代码库以复现完整的数据处理流程,从而最大化数据集的应用价值。
背景与挑战
背景概述
BTUMQA数据集由Shovo Monowar等人于论文“AUGR-VQA: Question-Adaptive Uncertainty-Guided Regional Reasoning for Reliable Brain Tumor MRI Visual Question Answering”中提出,旨在为脑肿瘤MRI的视觉问答(VQA)研究提供大规模受控评估资源。该数据集基于RSNA BraTS 2021 2D数据集构建,包含225,000个问答对,覆盖FLAIR、T1、T1ce、T2四种模态,并附有语义模板、区域面积统计、MC-Dropout不确定性估计等丰富标注。其创建核心问题在于推动医学影像VQA模型从粗粒度全局推理转向问题自适应的区域级细粒度推理,提升模型对不确定性区域的感知与可靠性。BTUMQA的发布为医学VQA领域提供了首个结合不确定性量化与区域推理的大规模基准,对后续研究具有重要参考价值。
当前挑战
该数据集所应对的领域挑战在于脑肿瘤MRI VQA任务中,现有模型常忽略肿瘤区域(如水肿、增强区、坏死区)的细粒度差异,难以处理模糊或不确定的视觉信息,导致回答可靠性不足。BTUMQA通过引入基于MC-Dropout的不确定性估计和区域权重调制,推动模型进行问题自适应的区域级推理,缓解了上述问题。在构建层面,挑战包括从RSNA BraTS 2021中精准提取2D切片并映射患者信息,设计涵盖多类语义模板的问题生成流程,确保问答对覆盖不同难度与不确定性水平,同时需对区域面积、不确定性分数等47个字段进行一致性校验。此外,数据集作为研究资源,明确限制用于临床,避免误导应用,这也对使用规范提出了额外要求。
常用场景
经典使用场景
BTUMQA数据集作为医学视觉问答(Med-VQA)领域的旗舰级资源,其核心应用场景聚焦于脑肿瘤MRI影像的自动化语义理解与推理。该数据集覆盖225,000个精心设计的问题-答案对,关联2D MRI切片,并系统性地整合了患者元数据、分割区域面积统计、MC-Dropout不确定性估计及区域调制权重等多维信息。研究者可基于此设计并评估新模型在脑肿瘤识别、病灶区域定位、影像特征判别等任务上的表现,尤其是针对精细化的视觉-语言对齐与高级语义推理能力的量化测试。该数据集的规范划分(训练/验证/测试)与难度分层(简单/中等/困难)为跨模型比较提供了标准化基准,推动了医学影像QA从通用视觉问答向高精度、具备不确定性感知能力的专用系统演进。
实际应用
在实际应用中,BTUMQA为智能医疗影像辅助分析提供了坚实的试验场,尤其适用于自动化影像报告生成、肿瘤负荷量化评估及临床决策支持流程的预研与验证。基于该数据集训练的VQA模型可帮助放射科医生快速检索影像中的关键病理特征,例如通过自然语言查询‘该切片中水肿区域占比是否超过50%’并获得量化响应,从而提升阅片效率与一致性。此外,数据集的标注结构支持在多中心研究中校准不同MRI设备间的影像差异,促进跨机构模型的迁移学习。尽管当前明确禁止直接临床使用,其技术路径(如不确定性引导的区域视觉特征调制)已被视为未来实时术中导航、远程放射学辅助等场景的重要预演基础,有望加速从结构化报告到人机协同诊断的转型。
衍生相关工作
BTUMQA的发布催生了一系列富有成效的衍生研究工作,其核心影响力集中于不确定性感知的视觉问答架构与医疗多模态学习范式。最典型的代表是配套的AUGR-VQA框架,该工作率先提出问题自适应的不确定性引导区域推理机制,通过MC-Dropout派生权重对视觉token进行调制,实验证明其在脑肿瘤问答精度与置信度校准上显著超越基线。后续衍生活动还包括:开发面向医学影像的域自适应预训练策略,利用数据集中丰富的区域统计字段设计弱监督分割模型;探索将答案类型与难度标签用于对抗性样本生成,以测试模型的鲁棒性;以及基于该数据集构建多任务学习系统,将VQA与分割、分类任务联合优化。这些工作共同推动了医学影像理解从单纯识别向具备推理与自省能力的更高层次迈进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务