遇见数据集

HarMoE Harmonized Dataset

收藏
arXiv2026-08-03 更新2026-08-05 收录
数据链接:
官方服务:

资源简介:

HarMoE Harmonized Dataset是由伯尔尼大学等机构整合多源胸部X光影像构建的统一预训练数据集,旨在突破单源依赖,提升模型在异构数据下的泛化能力。该数据集融合了MIMIC-CXR、CheXpert、ChestX-ray14和PadChest四个经典数据集,总计约87.3万张图像,覆盖229种疾病标签。构建过程通过大语言模型统一报告标签、构建全局疾病词汇表并采用三态编码,有效避免了未标注类别的假阴性问题。该数据集主要用于胸部X光视觉-语言预训练,解决多源数据中标签体系不一致与领域偏移带来的表示纠缠问题,显著提升零样本分类与跨域迁移性能。

The HarMoE Harmonized Dataset is a unified pre-training dataset developed by the University of Bern and other institutions by integrating multi-source chest X-ray images. It aims to break through the reliance on single-source data and enhance the generalization capability of models under heterogeneous data conditions. This dataset integrates four classic datasets including MIMIC-CXR, CheXpert, ChestX-ray14 and PadChest, with a total of approximately 873,000 images covering 229 disease labels. During its construction, large language models (LLMs) are used to unify report labels, build a global disease vocabulary and adopt three-state encoding, which effectively avoids false negative problems caused by unannotated categories. This dataset is mainly applied to chest X-ray vision-language pre-training, addressing the issue of representation entanglement arising from inconsistent label systems and domain shift in multi-source data, and significantly improving the performance of zero-shot classification and cross-domain transfer.

创建时间:
2026-08-03
搜集汇总
数据集介绍
HarMoE Harmonized Dataset 数据集图片
构建方式
HarMoE Harmonized Dataset是通过整合四大公开胸部X射线数据集(MIMIC-CXR、CheXpert、ChestX-ray14和PadChest)构建而成,共计873K张图像和229种疾病类别。构建流程首先利用大型语言模型(如Qwen3)从自由文本报告中提取结构化标签,随后通过本体对齐解决标签同义词冲突,构建统一疾病词汇表。每个样本被赋予三态标签(存在、不存在、未知),其中未知条目在训练时被掩蔽,以避免假阴性问题。该数据集的多源整合策略有效扩展了数据规模和病理覆盖范围,为多源视觉-语言预训练提供了坚实基础。
特点
HarMoE数据集的核心特点在于其多源异构性和统一标签空间。通过融合不同机构、不同标注协议的数据,该数据集显著提升了病理多样性(229种疾病),远超单一来源(MIMIC-CXR的43种)。同时,三态编码和掩蔽监督机制有效缓解了标签缺失带来的假阴性问题,确保了训练信号的准确性。此外,数据集的构建支持分类级提示编码,使得无自由文本报告的纯标注数据集也能被纳入预训练,突破了传统视觉-语言模型对报告数据的依赖。这些特点使得HarMoE数据集在跨域泛化和零样本诊断方面具有显著优势。
使用方法
HarMoE数据集主要用于多源胸部X射线视觉-语言预训练。使用时应配合HarMoE框架,该框架通过数据集解缠混合专家模块(DA-MoE)分离共享病理特征与数据集特有偏差。训练时,模型采用掩蔽二元交叉熵损失与正交性损失、专家正则化损失联合优化,确保共享路径承载足够的诊断信号。推理时,数据集专属专家路径被丢弃,仅使用共享特征进行零样本分类或视觉定位,无需任何微调。该数据集支持在11个基准上进行评估,涵盖域内和域外场景,用户可直接复用预训练权重或基于其进行下游任务适配。
背景与挑战
背景概述
哈莫伊(HarMoE)数据集由伯尔尼大学ARTORG生物医学工程研究中心与上海交通大学的研究人员于2026年构建,旨在整合多个胸片数据集以推进医学视觉语言预训练。该数据集的核心研究问题在于如何调和来自MIMIC-CXR、CheXpert、ChestX-ray14与PadChest四个异构数据源的873K图像,构建统一的229类疾病标签体系,从而突破对单一机构数据源的依赖,扩大病理覆盖范围。HarMoE通过数据集感知的混合专家架构,实现了跨数据集的共享医学语义学习,同时将源特异性变异隔离于轻量残差专家中。该数据集在零样本分类、分布外泛化及视觉定位等多方面展示了显著优势,为多源医学数据融合预训练开辟了新范式,其开源发布预期将推动该领域的发展。
当前挑战
该数据集面临的核心挑战在于多源医疗影像数据的异质性整合。不同数据集在标签本体、标注协议、采集流程以及报告风格上的差异,容易导致模型将临床语义与数据集身份纠缠,损害跨域传输能力。此外,朴素联合训练会导致模型学习源特异性捷径,使分布外性能下降,而对抗性对齐则可能移除临床相关的真实变异。构建过程中,还需克服部分标签缺失带来的系统性假阴性问题,以及设计有效的解耦机制,在训练时利用源特定信息,而在推理时仅依赖共享表示,确保模型既能在源域内保持高精度,又能稳健泛化至不可见的环境与疾病类别。
常用场景
经典使用场景
HarMoE Harmonized Dataset 作为大规模胸部X光影像预训练语料库,其经典使用场景在于支撑多源异构医学影像数据的统一学习。该数据集整合了MIMIC-CXR、CheXpert、ChestX-ray14和PadChest四个主流数据集,通过精细的标签协调策略构建了涵盖229种疾病的统一词汇表,并采用三元状态编码(存在、缺失、未知)以应对标注体系不一致的挑战。研究者可借此开展跨机构、跨设备的视觉-语言预训练,探索如何从异质性数据源中提取共享的病理语义特征,同时规避数据集身份带来的虚假相关性。该语料库的发布为医学影像领域提供了规模达873K图像的宝贵资源,突破了单一机构数据源的局限,成为推动放射学基础模型向多源学习范式转型的基石。
实际应用
在实际临床辅助诊断领域,HarMoE Harmonized Dataset赋能的预训练模型展现出广阔的应用前景。基于该数据集训练的视觉-语言模型可在无标注情况下直接用于胸部X光片的零样本疾病分类,覆盖肺结节、心脏肥大、肺不张等常见病症,并能适应不同医疗机构、不同品牌设备采集的影像数据,有效缓解了因设备差异导致的性能波动。此外,模型还能提供病理区域的视觉定位,帮助放射科医师快速聚焦可疑病灶,提升阅片效率与诊断一致性。在COVID-19等新发传染病的快速筛查中,该数据集训练的模型展现出卓越的跨域迁移能力,为公共卫生应急响应提供了可靠的技术支撑,其鲁棒性和泛化性能有望推动AI辅助诊断系统在基层医疗机构的规模化落地。
衍生相关工作
围绕HarMoE Harmonized Dataset,研究者已衍生出一系列具有影响力的学术工作。在方法层面,相关研究探索了数据集解耦的专家混合架构,通过确定性路由机制将源特定信息隔离于低秩残差模块,推动了多域学习与医学影像结合的理论发展。在应用层面,该数据集支撑了零样本分类、分布外泛化评估和视觉定位等任务的benchmark构建,如RSNA肺炎检测、COVID-QU-Ex等OOD基准上的性能提升验证了其价值。此外,相关工作还涉及标签协调策略的优化,如利用大语言模型从自由文本报告中提取结构化标签,以及设计正交性约束和专家正则化以增强特征解耦效果。这些衍生研究不仅深化了对多源预训练机制的理解,也为后续医学影像基础模型的开发提供了方法论参考和实证依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务