遇见数据集

brainer/ecg_labeled_Marzo

收藏
Hugging Face2024-01-19 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: image dtype: image - name: width dtype: int64 - name: height dtype: int64 - name: pixel_values sequence: sequence: sequence: uint8 - name: image_id dtype: int64 - name: image_path dtype: string - name: objects struct: - name: area sequence: int64 - name: bbox sequence: sequence: int64 - name: category sequence: int64 - name: id sequence: int64 splits: - name: train num_bytes: 583394854.0 num_examples: 199 - name: test num_bytes: 82413124.0 num_examples: 28 - name: valid num_bytes: 167349293.0 num_examples: 57 download_size: 166870694 dataset_size: 833157271.0 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* - split: valid path: data/valid-* --- Source: https://universe.roboflow.com/centro-oncolgico-integral/ecg_labeled_marzo

数据集信息: 特征字段: - 名称: image 数据类型: 图像 - 名称: width 数据类型: int64(64位整型) - 名称: height 数据类型: int64(64位整型) - 名称: pixel_values 数据类型: 嵌套三层的无符号8位整型(uint8)序列 - 名称: image_id 数据类型: int64(64位整型) - 名称: image_path 数据类型: string(字符串型) - 名称: objects 数据类型: 结构体类型,包含以下子字段: - 名称: area 数据类型: int64(64位整型)序列 - 名称: bbox 数据类型: 嵌套两层的int64(64位整型)序列 - 名称: category 数据类型: int64(64位整型)序列 - 名称: id 数据类型: int64(64位整型)序列 数据集划分: - 名称: train 占用字节数: 583394854.0 样本数量: 199 - 名称: test 占用字节数: 82413124.0 样本数量: 28 - 名称: valid 占用字节数: 167349293.0 样本数量: 57 下载大小: 166870694 数据集总大小: 833157271.0 配置项: - 配置名称: default 数据文件路径: - 划分: train 路径: data/train-* - 划分: test 路径: data/test-* - 划分: valid 路径: data/valid-* 数据来源: https://universe.roboflow.com/centro-oncolgico-integral/ecg_labeled_marzo

提供机构:
brainer
原始信息汇总

数据集概述

特征信息

  • image: 图像数据,数据类型为 image
  • width: 图像宽度,数据类型为 int64
  • height: 图像高度,数据类型为 int64
  • pixel_values: 像素值,数据类型为 uint8 的序列的序列。
  • image_id: 图像ID,数据类型为 int64
  • image_path: 图像路径,数据类型为 string
  • objects: 对象信息,包含以下子字段:
    • area: 区域面积,数据类型为 int64 的序列。
    • bbox: 边界框,数据类型为 int64 的序列的序列。
    • category: 类别,数据类型为 int64 的序列。
    • id: 对象ID,数据类型为 int64 的序列。

数据分割

  • train: 训练集,包含 199 个样本,占用 583394854.0 字节。
  • test: 测试集,包含 28 个样本,占用 82413124.0 字节。
  • valid: 验证集,包含 57 个样本,占用 167349293.0 字节。

数据集大小

  • download_size: 下载大小为 166870694 字节。
  • dataset_size: 数据集总大小为 833157271.0 字节。

配置信息

  • default: 默认配置,包含以下数据文件路径:
    • train: data/train-*
    • test: data/test-*
    • valid: data/valid-*
搜集汇总
数据集介绍
brainer/ecg_labeled_Marzo 数据集图片
构建方式
在心血管疾病诊断领域,心电图(ECG)作为核心诊断工具,其自动化分析高度依赖高质量标注数据。brainer/ecg_labeled_Marzo数据集源自Roboflow平台上的公开项目,由医学影像专家对心电图图像进行精细标注构建而成。该数据集包含图像及其对应的像素值、尺寸等元信息,并针对每张图像中的目标区域提供了边界框(bbox)、类别(category)、面积(area)等结构化标注字段,形成了一套完整的监督学习数据体系。数据集划分为训练集(199例)、测试集(28例)和验证集(57例),总计284例样本,为心电图目标检测任务提供了可靠的数据基础。
特点
该数据集的核心特点在于其面向心电图图像的目标检测任务设计,每张图像均附带精确的边界框与类别标签,支持模型对心电图中特定波形或异常区域的定位与识别。数据集中包含图像原始像素值(pixel_values)与图像路径(image_path),便于灵活加载与预处理。此外,数据集提供了统一的图像尺寸信息(width、height),有助于模型输入标准化。样本规模虽小但经过专业标注,适合作为小样本学习或迁移学习的基准数据集,尤其适用于医学影像分析中的细粒度目标检测场景。
使用方法
使用者可通过HuggingFace Datasets库加载该数据集,调用load_dataset('brainer/ecg_labeled_Marzo')即可获得包含训练、测试、验证三个子集的数据对象。加载后,可访问'image'字段获取PIL图像对象,通过'objects'字段中的'bbox'和'category'获取标注信息。图像预处理建议统一调整尺寸至固定大小,并将像素值归一化。对于目标检测模型(如Faster R-CNN、YOLO),需将边界框格式转换为模型要求的坐标表示。数据集支持标准的PyTorch或TensorFlow数据流水线,便于集成到现有训练流程中。
背景与挑战
背景概述
心电图(ECG)作为心血管疾病诊断的核心工具,其自动分析与解读在临床实践中具有重要价值。然而,传统基于规则的方法在处理复杂波形变异时存在局限,亟需高质量标注数据集以推动深度学习模型的发展。brainer/ecg_labeled_Marzo数据集由Roboflow平台上的Centro Oncológico Integral团队创建,聚焦于心电图图像的实例分割任务,旨在通过细粒度标注(如波形区域边界框与类别)提升模型对心电信号的解析能力。该数据集包含284张标注图像(训练集199例、测试集28例、验证集57例),覆盖了典型与非典型心电模式,为心电信号的结构化识别提供了标准化基准。其发布填补了医疗影像领域中小样本、高精度标注数据集的空白,为心电异常检测、波形分割等研究奠定了关键数据基础,对推动可解释性医疗AI的发展具有显著影响力。
当前挑战
该数据集面临的核心挑战在于心电图像固有的领域复杂性:多类波形(如P波、QRS波群、T波)的形态高度相似且边界模糊,导致实例分割任务中类别区分与边界定位难度极大;同时,心电信号的噪声干扰(如基线漂移、肌电噪声)进一步加剧了模型泛化的不确定性。在构建过程中,数据来源依赖有限的临床采集场景,样本量仅284例,难以覆盖罕见心律失常或个体差异显著的边缘案例,可能引发模型过拟合与偏差。此外,标注工作需专业医师对密集、重叠的波形区域进行逐像素勾画,耗时且主观性强,标注一致性难以保障。这些挑战制约了数据集在真实临床环境中的鲁棒性,亟需通过数据增强、半监督学习或跨中心协作扩展来缓解。
常用场景
经典使用场景
在心血管疾病智能诊断领域,心电图(ECG)的自动化解读是临床决策支持系统的核心任务之一。brainer/ecg_labeled_Marzo数据集以其包含的199张训练图像、28张测试图像及57张验证图像,为基于深度学习的ECG信号目标检测与分类提供了高质量的标注资源。该数据集的经典使用场景聚焦于训练卷积神经网络(CNN)或Transformer架构,以识别ECG图像中的关键波形特征,如P波、QRS波群和T波,并定位异常节律区域。研究者常利用其提供的边界框(bbox)和类别(category)标注,开发能够同时完成心电信号分割与多类别异常检测的端到端模型,从而推动心电信号分析从人工判读向自动化、高精度方向的转变。
实际应用
实际临床环境中,该数据集支撑着远程心电监测与急诊分诊系统的智能化升级。基于brainer/ecg_labeled_Marzo训练的模型可嵌入便携式心电设备,实时标注异常波形并生成预警信号,辅助非专科医生在基层医疗场景中快速识别心肌缺血或传导阻滞。此外,其标注的精细度使得模型能够区分不同严重程度的ST段改变,从而优化胸痛中心的分诊流程。在制药企业的药物安全性评估中,该数据集亦被用于训练自动分析药物对QT间期影响的算法,减少人工复核的时间成本。
衍生相关工作
该数据集衍生了一系列具有影响力的研究工作,例如基于YOLOv8的ECG目标检测改进模型,通过优化边界框回归损失函数提升了对微小P波变化的检出率。另一项经典工作利用Vision Transformer(ViT)在该数据集上预训练后,迁移至其他心电图像数据集,验证了跨模态特征表征的有效性。此外,研究者还开发了结合注意力机制与图卷积网络的混合架构,利用数据集中的空间标注信息建模心电导联间的拓扑关系,在可解释性方面取得了突破。这些成果共同构建了从数据驱动到理论创新的完整研究链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务