MM-BRAF dataset
收藏资源简介:
MM-BRAF数据集是一个多模态甲状腺癌数据集,包含来自1,258名患者的3,120个超声图像样本。每个样本结合了超声图像、临床/超声文本以及BRAF V600E突变状态。数据采用患者级别分割,以避免训练-测试泄漏。
The MM-BRAF dataset is a multi-modal thyroid cancer dataset comprising 3,120 ultrasound image samples from 1,258 patients. Each sample integrates ultrasound images, clinical/ultrasound text, and BRAF V600E mutation status. The dataset adopts patient-level splitting to avoid train-test leakage.
数据集概述
本数据集名为 MM-BRAF,是一个多模态甲状腺癌数据集,专为预测甲状腺乳头状癌中的BRAF V600E突变而构建。该数据集由 BRAF-MLLM 项目使用,结合了监督式多模态微调与肿瘤中心多模态双尺度对齐(TMDA)技术。
核心特点
- 数据规模:包含来自 1,258 名患者的 3,120 份超声图像样本。
- 多模态输入:每个样本由三部分组成:
- 甲状腺超声图像
- 临床/超声文本报告
- BRAF V600E 突变状态(阳性或阴性)
- 划分策略:采用患者级划分,在构建样本前先对患者进行拆分,避免训练集与测试集之间的数据泄漏。
数据结构
数据集文件需单独申请获取,下载后放置于 dataset/ 目录下,其预期布局如下:
text
dataset/
|-- train/
| |-- braf_train_new2.25.json
| -- img/ |-- test/ | |-- braf_test_new2.25.json | -- img/
每个 JSON 文件中的条目遵循以下格式:
json { "image": "dataset/train/img/example.jpg", "system_prompt": "You are an expert medical AI specializing in BRAF mutation prediction.", "problem": "Clinical and ultrasound information for this case...", "answer": "Positive" }
其中 answer 字段的取值为 Positive 或 Negative。
用途与限制
- 研究用途:本项目仅供研究使用,不适用于临床诊断或治疗决策。
- 合规要求:使用数据集时需遵守相应的数据协议和机构要求。
- 引用:若此项目对研究有帮助,请引用相关论文(出处见论文引用部分)。
论文结果(MM-BRAF测试集)
| 方法 | 准确率 (Acc) | F1分数 (F-Score) | 召回率 (Recall) |
|---|---|---|---|
| LLaVA-1.5-7B (SFT) | 0.7211 | 0.6371 | 0.6215 |
| Qwen2.5-VL-7B (SFT) | 0.7443 | 0.6598 | 0.6383 |
| BRAF-MLLM | 0.7735 | 0.6979 | 0.7129 |




