遇见数据集

willxxy/pretrain-mimic-250-2500

收藏
Hugging Face2025-08-08 更新2025-10-25 收录
官方服务:

资源简介:

这是一个基于Pretrain MIMIC数据集的五折随机分割的心电图数据集,每个折(fold)包含训练集和测试集,确保了训练和测试集之间没有患者重叠。数据集包含三个特征:心电图路径、文本和名称。

This is a five-fold randomly split ECG dataset based on the Pretrain MIMIC dataset, with each fold containing a training set and a test set, ensuring no patient overlap between training and test sets. The dataset includes three features: ECG path, text, and name.

提供机构:
willxxy
搜集汇总
数据集介绍
构建方式
该数据集源自MIMIC临床数据库中的心电图记录,通过患者级别的分层随机采样策略,构建了五折交叉验证结构。每个折叠均确保训练集与测试集之间无患者重叠,从而避免数据泄露。原始信号以250 Hz的采样频率进行重采样,并截取10秒时长(即2500个采样点),最终形成统一的ECG波形片段。每一条数据包含心电图文件路径、对应的文本描述以及唯一标识符,文本描述可能涵盖诊断结论或临床注释。数据划分代码已公开,便于复现。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,指定所需折叠名称(如fold1_train)即可获取对应分片。每条记录包含ecg_path字段用于定位信号文件,text字段提供文本标签,name字段作为唯一标识。适用于心电图分类、报告生成或多模态表征学习等任务。建议在加载后对ECG信号进行标准化或滤波预处理,以适配下游模型的输入要求。
背景与挑战
背景概述
心电图(ECG)作为临床诊断心血管疾病的核心工具,其自动化解读技术近年来随着深度学习的发展取得了显著突破。然而,高质量、大规模且具有患者级别独立性的预训练数据集仍然稀缺,制约了模型泛化能力的提升。在此背景下,willxxy/pretrain-mimic-250-2500数据集应运而生,由ECG-Bench项目维护者基于MIMIC临床数据库构建,于近年公开发布。该数据集以250Hz采样频率、10秒时长(2500个采样点)为标准,通过五折交叉验证策略进行患者分层划分,确保训练集与测试集间无患者重叠,从而有效评估模型在真实临床场景中的鲁棒性。其核心研究问题聚焦于为心电图自监督预训练提供标准化基准,推动心电图基础模型的发展,对心电智能诊断领域具有重要的方法学支撑作用。
当前挑战
该数据集所解决的领域问题在于心电图多模态表征学习的预训练范式缺乏统一基准,现有数据集常因患者重叠导致性能高估,难以反映模型在独立患者群体上的真实表现。构建过程中面临多重挑战:首先,从MIMIC数据库中提取心电信号时需处理长时程记录的分段标准化问题,确保250Hz重采样与10秒截断不丢失关键病理特征;其次,五折分层划分需严格基于患者身份进行,避免同一患者数据跨折分布,这对大规模临床数据的去重与哈希映射提出较高要求;最后,数据标注的文本描述来源于临床报告,其非结构化特性增加了文本与信号对齐的难度,需设计高效的数据清洗与配对策略以保证预训练质量。
常用场景
经典使用场景
在心血管疾病智能诊断的学术前沿,心电图(ECG)数据的多模态表征学习已成为关键突破口。该数据集以250Hz采样频率和10秒时长的标准化设置,为ECG信号与临床文本的跨模态预训练提供了大规模、结构化的基准资源。研究者可基于其五折交叉验证划分,开展ECG波形特征与对应医疗描述之间的对比学习、掩码建模等自监督任务,从而构建能够理解心脏电生理活动与文本语义关联的基础模型。
解决学术问题
该数据集有效解决了医疗领域标注数据稀缺与模型泛化能力不足的双重困境。通过提供超过35万条训练样本及严格的患者级分层策略,它支持开发者在无监督或弱监督范式下探索ECG表征学习的鲁棒性,显著降低了传统监督学习对昂贵临床标注的依赖。其意义在于推动了从单一信号分析向多模态融合的范式转变,为心律失常分类、心肌缺血检测等下游任务奠定了可迁移的特征基础。
实际应用
在临床辅助决策系统中,该数据集训练出的预训练模型可集成至可穿戴心电监测设备,实现实时异常心律筛查与紧急预警。例如,通过微调后的模型能自动解析急诊科患者的10秒静息ECG,快速识别房颤、室性早搏等常见病变,并将波形异常与结构化电子病历中的症状描述关联,辅助医生提升诊断效率。此外,该资源还可用于远程医疗平台,为基层医疗机构提供云端ECG智能分析服务。
数据集最近研究
最新研究方向
基于willxxy/pretrain-mimic-250-2500数据集的前沿研究方向聚焦于心电图(ECG)与自然语言描述的多模态预训练模型构建。该数据集以MIMIC临床数据库为根基,通过患者层级分层抽样生成五折交叉验证划分,确保了训练与测试集间无患者重叠,为模型泛化能力评估提供了严谨基准。当前热点围绕ECG-Bench框架下的自监督学习与跨模态对齐技术,探索如何将原始心电信号(以250Hz采样、10秒时长标准化)与结构化文本报告深度融合,推动临床辅助诊断、罕见心律失常检测及可解释AI在心血管疾病管理中的落地应用。这一资源显著降低了心电图大模型训练的数据门槛,为医疗AI的可重复性研究与公平性评估奠定了关键基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务