遇见数据集

MM-BRAF dataset

收藏
github2026-06-30 更新2026-07-07 收录
官方服务:

资源简介:

MM-BRAF数据集是一个多模态甲状腺癌数据集,包含来自1,258名患者的3,120个超声图像样本。每个样本结合了超声图像、临床/超声文本以及BRAF V600E突变状态。数据采用患者级别分割,以避免训练-测试泄漏。

The MM-BRAF dataset is a multi-modal thyroid cancer dataset comprising 3,120 ultrasound image samples from 1,258 patients. Each sample integrates ultrasound images, clinical/ultrasound text, and BRAF V600E mutation status. The dataset adopts patient-level splitting to avoid train-test leakage.

创建时间:
2026-06-25
原始信息汇总

数据集概述

本数据集名为 MM-BRAF,是一个多模态甲状腺癌数据集,专为预测甲状腺乳头状癌中的BRAF V600E突变而构建。该数据集由 BRAF-MLLM 项目使用,结合了监督式多模态微调与肿瘤中心多模态双尺度对齐(TMDA)技术。

核心特点

  • 数据规模:包含来自 1,258 名患者的 3,120 份超声图像样本。
  • 多模态输入:每个样本由三部分组成:
    • 甲状腺超声图像
    • 临床/超声文本报告
    • BRAF V600E 突变状态(阳性或阴性)
  • 划分策略:采用患者级划分,在构建样本前先对患者进行拆分,避免训练集与测试集之间的数据泄漏。

数据结构

数据集文件需单独申请获取,下载后放置于 dataset/ 目录下,其预期布局如下:

text dataset/ |-- train/ | |-- braf_train_new2.25.json | -- img/ |-- test/ | |-- braf_test_new2.25.json | -- img/

每个 JSON 文件中的条目遵循以下格式:

json { "image": "dataset/train/img/example.jpg", "system_prompt": "You are an expert medical AI specializing in BRAF mutation prediction.", "problem": "Clinical and ultrasound information for this case...", "answer": "Positive" }

其中 answer 字段的取值为 PositiveNegative

用途与限制

  • 研究用途:本项目仅供研究使用,不适用于临床诊断或治疗决策。
  • 合规要求:使用数据集时需遵守相应的数据协议和机构要求。
  • 引用:若此项目对研究有帮助,请引用相关论文(出处见论文引用部分)。

论文结果(MM-BRAF测试集)

方法 准确率 (Acc) F1分数 (F-Score) 召回率 (Recall)
LLaVA-1.5-7B (SFT) 0.7211 0.6371 0.6215
Qwen2.5-VL-7B (SFT) 0.7443 0.6598 0.6383
BRAF-MLLM 0.7735 0.6979 0.7129
搜集汇总
数据集介绍
MM-BRAF dataset 数据集图片
构建方式
MM-BRAF数据集专为甲状腺乳头状癌的BRAF V600E突变预测而构建,整合了多模态临床数据。数据来源于1258名患者的3120张超声图像样本,每份样本融合了甲状腺超声图像、超声报告、临床病理信息及突变标签。在样本构建前,依据患者级别进行划分,严格避免训练集与测试集之间的信息泄露。数据集以JSON格式组织,包含图像路径、系统提示、临床问题及突变状态答案字段,答案明确标注为阳性或阴性。
使用方法
使用该数据集需先通过作者提供的链接申请访问权限,下载后置于dataset/目录下,并按预设结构组织训练集与测试集子文件夹。训练阶段可采用监督微调或全框架训练两种方式:前者通过运行train_sft.py脚本并配置相应yaml文件即可启动;后者则运行train_tmda.py脚本以激活肿瘤中心多模态双尺度对齐方法。评估时通过evaluate_braf.py脚本加载预训练模型路径与测试数据,自动输出准确率、宏平均精确率、召回率、F1值及混淆矩阵等分类指标。
背景与挑战
背景概述
甲状腺癌是全球范围内发病率增长最快的恶性肿瘤之一,其中乳头状甲状腺癌(PTC)占据绝大多数。BRAF V600E突变作为PTC中最常见的基因突变类型,与肿瘤的侵袭性、复发风险及预后不良密切相关,其精准预测对于制定个体化治疗方案具有举足轻重的临床意义。然而,传统的突变检测依赖于组织活检,具有侵入性、耗时且难以重复。在此背景下,MM-BRAF数据集应运而生,由Hao Pengfei、Li Shuaibo等研究人员于2026年创建,旨在通过多模态临床数据实现BRAF V600E突变的无创预测。该数据集整合了甲状腺超声图像、超声报告及临床病理信息,涵盖3120例超声图像样本,源自1258例患者,并采用患者级别的数据划分以避免数据泄露。MM-BRAF数据集的提出为多模态大语言模型在甲状腺癌基因突变预测领域树立了新的基准,推动了医学影像与临床文本深度融合的研究范式。
当前挑战
MM-BRAF数据集所解决的领域核心挑战在于如何从多模态临床数据中精准预测BRAF V600E突变状态,这要求模型能够同时理解超声图像的视觉特征与临床文本的语义信息,并建立跨模态的细粒度关联。传统的单模态方法往往受限于图像噪声或文本歧义,难以捕捉与突变相关的关键特征。此外,医学图像的背景干扰严重,肿瘤区域与正常组织对比度低,导致模型易于被无关信息误导。在数据集构建过程中,挑战同样严峻:首先,需要从海量临床记录中筛选并标准化标注BRAF突变状态,确保标签的可靠性与一致性;其次,超声图像的采集来自不同设备和操作者,存在显著的异质性,需进行严格的预处理以消除设备偏差;最后,患者级别的拆分策略虽避免了数据泄漏,但进一步加剧了样本稀缺性,使得模型训练面临小样本与类别不平衡的双重困境。
常用场景
经典使用场景
在精准医疗与人工智能交叉的浪潮中,甲状腺癌的分子病理分型已成为个性化治疗的关键切入点。MM-BRAF数据集作为首个专注于甲状腺乳头状癌BRAF V600E突变预测的多模态临床数据集,其经典使用场景在于联合超声影像、超声报告文本及临床病理信息,构建多模态预测模型。研究者可基于该数据集中1,258名患者的3,120份超声图像样本,将图像特征与结构化或非结构化的临床文本语义对齐,从而训练能够捕捉肿瘤微观突变表征的深度学习架构。数据集采用患者级划分策略,有效避免了训练与测试间的数据泄露,确保模型泛化能力评估的严谨性。这为甲状腺癌术前无创基因突变预测提供了标准化的数据基准与实验平台。
解决学术问题
该数据集系统性地回应了甲状腺癌分子诊断领域长期存在的核心学术难题:如何在非侵入性条件下准确预测BRAF V600E突变状态。传统依赖细针穿刺活检的基因检测方法存在创伤性、采样偏差及成本高昂等局限,而常规影像学分析又难以直接揭示分子层面的突变信息。MM-BRAF数据集的构建,使得研究者能够探索多模态数据中隐含的突变相关视觉与语义特征,推动从宏观影像到微观基因型的跨尺度关联研究。这一工作填补了公开可用的甲状腺癌多模态突变预测数据集的空白,为后续模型的可重复性验证与公平比较奠定了坚实基础,对推动计算病理学与临床决策支持系统的交叉发展具有里程碑意义。
实际应用
在实际临床场景中,MM-BRAF数据集驱动的预测模型可嵌入甲状腺结节诊疗流程,作为术前风险评估的辅助工具。通过整合常规超声检查获得的影像和报告信息,模型能够快速生成BRAF V600E突变概率,帮助医生在制定手术方案时更有针对性地选择淋巴结清扫范围或靶向治疗策略。尤其对于穿刺结果不确定或细胞学意义不明确的结节,该数据集训练出的模型可提供无创、低成本的二次判断参考。此外,依托多模态大语言模型架构,系统还能以自然语言形式输出可解释的推理依据,增强临床医师对模型预测的信赖度,推动精准医学从实验室向临床实践的落地。
数据集最近研究
最新研究方向
当前甲状腺癌精准诊疗领域的前沿探索中,BRAF V600E基因突变作为乳头状甲状腺癌的关键分子标志物,其术前无创预测成为临床决策的重要突破点。MM-BRAF数据集由1258例患者的3120份超声影像及对应临床文本构成,创新性地构建了患者级数据划分策略以防止信息泄露,并联合Qwen2.5-VL多模态大语言模型框架,提出肿瘤中心多模态双尺度对齐机制(TMDA)。该技术通过精细对齐瘤内与瘤周视觉特征与临床语义,有效抑制背景噪声并强化突变相关线索,在测试集上取得了77.35%的准确率与69.79%的F值,相较于传统大模型方案实现了显著提升,为甲状腺癌分子分型的无创评估开辟了智能化新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务