遇见数据集

Awesome-Biosignal-Foundation-Model

收藏
github2026-05-26 更新2026-06-04 收录
官方服务:

资源简介:

这是一个精心策划的资源列表,专注于生物信号(如心电图、脑电图和光电容积描记图)的基础模型、数据集和工具。该合集收集并整理了多个大规模训练数据集、评估基准和预处理工具箱,覆盖了生物信号分析领域的多个方向,包括心电图、脑电图、光电容积描记图、惯性测量单元、肌电图、动脉血压和心音图等数据类型。

This is a carefully curated list of resources focused on foundation models, datasets, and tools for biosignals (e.g., electrocardiogram (ECG), electroencephalogram (EEG), and photoplethysmography (PPG)). This collection compiles and organizes numerous large-scale training datasets, evaluation benchmarks, and preprocessing toolkits, covering multiple research directions in the field of biosignal analysis and encompassing a wide range of data types including ECG, EEG, PPG, inertial measurement unit (IMU), electromyogram (EMG), arterial blood pressure (ABP), and phonocardiogram (PCG).

创建时间:
2024-08-29
原始信息汇总

数据集详情总结:Awesome Foundation Models for Biosignals

这是一个关于生物信号基础模型的资源集合,涵盖了模型、数据集和工具,基于一篇全面的综述论文。

数据集详情页概述

  • 地址https://github.com/guxiao0822/Awesome-Biosignal-Foundation-Model
  • 背景:生物信号(如ECG、EEG、PPG)记录了人体的生理和行为“语言”。为大规模分析这些信号,借鉴自然语言处理和计算机视觉领域成功经验的基础模型正在涌现。
  • 综述论文Foundation Models for Biosignals: A Survey

生物信号基础模型领域全景

该领域可归纳为三个主要方向:

  1. 从头预训练生物信号基础模型:在大型生物信号数据集上预训练专用基础模型。
  2. 将时间序列基础模型适配到生物信号:将通用时间序列基础模型重新用于生物信号任务。
  3. 利用大语言模型处理生物信号:利用(多模态)大语言模型进行生物信号分析。

数据集、基准与工具

1. 大规模训练数据集 列举了多种模态的公开可用大规模数据集:

数据集 模态 个体数量 时长(小时) 链接
UKBiobank ECG PPG IMU Health Metrics - - dataset
MC-MED ECG PPG Resp Vital Signs 70K - dataset
MIMIC-III-WDB ECG PPG ABP Resp Vital Signs 30K 3M dataset
VitalDB ECG PPG ABP Resp Vital Signs 6K - dataset
PulseDB ECG PPG ABP 5K 50M dataset
MESA ECG PPG EEG 2K - dataset
VTaC ECG PPG ABP 2K - dataset
CODE ECG 2M - dataset
MIMIC-IV-ECG ECG 160K 2K dataset
PhysioNet2020 ECG 40K 90 dataset
eICU Vital Signs 139K - dataset
HiRID Vital Signs 34K - dataset
UCSF-PPG PPG 21K 600K dataset
TUEG EEG 15K 27K dataset
HBN-EEG EEG 3K 3K dataset
MOABB EEG >1K - dataset
SEED Series EEG Gaze Metrics - - dataset
emg2pose EMG 193 370 dataset
emg2qwerty EMG 108 346 dataset
HUNT4 IMU 35K - dataset
Capture24 IMU 151 4K dataset
Ego4D IMU Audio Gaze Metrics 923 4K dataset
COVID-19 Sounds Audio 36K 552 dataset

2. 评估基准

  • PhysioNet Challenges:年度国际竞赛,为ECG解读、睡眠分期、心律失常检测等生物信号分析任务提供标准化评估框架。 benchmark
  • MOABB (Mother of All BCI Benchmarks):基于EEG的脑机接口算法综合基准框架,提供标准化流程和评估协议。 benchmark

3. 预处理工具包 列举了针对不同生物信号模态的工具:

工具包 模态 链接
MNE-Python EEG tool
NeuroKit ECG PPG Resp EMG tool
HeartPy ECG PPG tool
pyHRV ECG PPG tool
BIOBSS ECG PPG IMU tool
BioSPPy ECG PPG EEG Resp EMG PCG tool
PyPhysio ECG PPG IMU tool
EEGLAB EEG tool
Vital-Sqi ECG PPG tool
PhysioKit PPG Resp tool
PPGFeat PPG tool
WFDB Toolbox ECG PPG EEG Resp ABP EMG tool
PyPPG PPG tool

模型列表

资源列表还收录了大量基础模型,这些模型涵盖了从心电图(ECG)、脑电图(EEG)、肌电图(EMG)到光电容积描记图(PPG)和惯性测量单元(IMU)等多种模态,并发表在Nature、Nature Communications、NeurIPS、ICLR、ICML等顶级期刊和会议上。每个模型条目均包含论文链接,部分还提供了代码仓库链接。

搜集汇总
数据集介绍
Awesome-Biosignal-Foundation-Model 数据集图片
构建方式
该数据集系统性地整合了生物信号领域的基础模型、数据集与工具资源,基于对领域内最新研究的全面调研构建而成。其内容涵盖三大核心方向:从零开始预训练生物信号基础模型、将通用时间序列基础模型适配至生物信号任务、以及利用多模态大语言模型进行生物信号分析。资源列表按模型类别、模态类型(如ECG、EEG、PPG等)及任务方向进行分层组织,并附有详尽的论文链接与代码仓库,形成一个结构清晰、易于导航的知识体系。
使用方法
使用者可通过GitHub仓库的目录导航快速定位所需资源,例如按“Pretraining from Scratch”“Adapting Time Series FMs”“Leveraging LLMs”等分类浏览模型,或通过表格筛选特定模态的数据集与工具。每个条目均提供论文原文与代码链接,便于直接复现与实验。对于评估基准与预处理工具,数据集直接导向PhysioNet、MOABB等权威平台,确保研究流程的标准化与可重复性。该资源库持续更新,并欢迎社区贡献,以保持其前沿性与完整性。
背景与挑战
背景概述
生物信号,如心电图(ECG)、脑电图(EEG)和光电容积描记图(PPG),承载着人体生理与行为活动的丰富“语言”。近年来,受自然语言处理与计算机视觉领域基础模型成功经验的启发,研究者开始探索将这一范式迁移至生物信号分析领域,以期从海量传感器数据中挖掘深层模式。Awesome-Biosignal-Foundation-Model 数据集与资源列表正是在这一背景下应运而生,由多所机构的研究者基于系统性综述工作创建,旨在全面梳理面向生物信号的基础模型、数据集与工具。该资源体系聚焦于三大方向:从头预训练生物信号基础模型、将通用时间序列基础模型适配至生物信号任务、以及利用大语言模型进行生物信号分析。其核心研究问题在于如何构建能够泛化处理多种生物信号模态的通用模型,从而推动精准医疗、可穿戴健康监测及脑机接口等领域的突破。该资源自发布以来,已成为该交叉学科领域的重要参考,对相关研究范式演进产生了显著影响。
当前挑战
该数据集所涉及的领域面临多重挑战。首先,生物信号具有高度个体差异性与噪声干扰,不同模态(如ECG、EEG、PPG)间的时空尺度与生理机制迥异,使得构建统一的、跨模态的基础模型极为困难。其次,大规模高质量生物信号数据的获取受限于隐私法规、伦理审查与标注成本,现有公开数据集在规模、模态覆盖及标注一致性方面仍存在显著不足。在模型构建过程中,如何设计有效的预训练策略以捕捉生理信号的时序依赖与多尺度特征,同时避免过拟合至特定数据集,是技术上的核心难点。此外,基础模型的可解释性、鲁棒性及其在低资源场景下的迁移能力,也是当前研究亟待突破的瓶颈,这些挑战共同制约着生物信号基础模型从实验室走向临床与真实世界部署的进程。
常用场景
经典使用场景
在生物医学信号处理领域,心电图、脑电图和光电容积描记图等生物信号承载着人体生理与行为活动的丰富信息。该数据集汇集了大规模、多模态的生物信号数据,如UKBiobank、MIMIC系列和TUEG等,为研究人员提供了从海量传感器读数中挖掘生理模式的基础。其经典使用场景包括基于自监督学习范式预训练生物信号基础模型,例如利用百万级心电图记录训练能够泛化至多种心脏疾病诊断的通用表征模型,或在脑电图数据上构建跨任务、跨个体的脑机接口解码框架。这些场景不仅验证了基础模型在生物信号领域的可迁移性,更推动了从特定任务模型向通用生理信号理解范式的转变。
解决学术问题
该数据集系统性地解决了生物信号分析中长期存在的标注数据匮乏与模型泛化能力不足的学术困境。传统方法依赖大量人工标注的生理信号片段进行监督学习,不仅成本高昂且难以覆盖罕见的病理模式。通过提供海量未标注的原始信号数据,该数据集支撑了对比学习、掩码建模等自监督预训练策略的探索,使模型能够从无标签数据中习得丰富的生理信号先验知识。这一突破显著降低了后续下游任务(如心律失常分类、睡眠分期、癫痫检测)对标注样本的需求,同时提升了模型在不同医院、设备和人群间的鲁棒性,为构建可泛化的生物信号人工智能系统奠定了数据基石。
实际应用
在实际医疗健康场景中,该数据集驱动的生物信号基础模型正逐步从实验室走向临床与可穿戴设备。基于心电图基础模型的自动诊断系统已能够实时检测心肌梗死、房颤等致命性心律失常,辅助急诊分诊决策。脑电图基础模型则被集成于脑机接口设备中,帮助运动功能障碍患者通过神经信号控制外部设备。此外,来自可穿戴设备的光电容积描记图和惯性测量单元数据所训练的基础模型,已被部署于智能手表和健康手环中,实现连续血压监测、睡眠质量评估及日常活动识别。这些应用不仅减轻了医护人员的工作负担,更使得低成本、大规模的居家健康监测成为可能。
数据集最近研究
最新研究方向
生物信号基础模型领域正经历着从专用模型向通用智能范式的深刻转型,其前沿研究呈现出三条交织并进的演进路径。第一条路径聚焦于从零开始预训练专有基础模型,如基于千万级心电记录构建的ECGFounder模型,以及在Nature系列期刊上发表的面向连续血糖监测、睡眠解码与心脏健康评估的多模态基础模型,这些工作充分展现了大规模生物信号语料库在病理表征学习中的巨大潜力。第二条路径致力于将通用时间序列基础模型适配至生物信号任务,通过迁移学习策略弥合领域间的表征鸿沟。第三条路径则探索利用大语言模型的多模态理解能力进行生物信号分析,如NeuroLM与ECG-LM等开创性工作,它们试图将生物信号的时序语言与大语言模型的语义空间对齐。这一研究热潮与可穿戴健康设备的普及、精准医疗的迫切需求以及大模型技术的溢出效应紧密相关,正在重塑心血管疾病筛查、脑机接口、睡眠障碍诊断等领域的智能分析范式,其深远意义在于为个性化健康管理提供可扩展的通用计算底座。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务