遇见数据集

JLB-JLB/seizure_eeg_eval

收藏
Hugging Face2023-10-18 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: image dtype: image - name: epoch dtype: int64 - name: label dtype: class_label: names: '0': bckg '1': No Event '2': seiz splits: - name: train num_bytes: 3322082528.975 num_examples: 114035 download_size: 3418833182 dataset_size: 3322082528.975 configs: - config_name: default data_files: - split: train path: data/train-* --- # Dataset Card for "seizure_eeg_eval" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

--- 数据集信息: 特征字段: - 名称:image(图像),数据类型:图像 - 名称:epoch(脑电时段),数据类型:64位整数(int64) - 名称:label(标签),数据类型为类别标签(class_label),类别映射关系如下: '0': bckg(背景) '1': No Event(无事件) '2': seiz(癫痫发作) 数据集划分: - 划分名称:train(训练集),字节占用量:3322082528.975,样本总数:114035 下载总大小:3418833182字节 数据集存储总大小:3322082528.975字节 配置项: - 配置名称:default(默认配置),数据文件配置: - 对应数据集划分:train(训练集),数据文件路径:data/train-* --- # seizure_eeg_eval(癫痫脑电评估)数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
JLB-JLB
原始信息汇总

数据集概述

数据集信息

  • 特征:
    • image: 图像数据
    • epoch: 整数类型
    • label: 分类标签,包含以下类别:
      • 0: bckg
      • 1: No Event
      • 2: seiz

数据分割

  • train:
    • 字节数: 3322082528.975
    • 样本数: 114035

数据集大小

  • 下载大小: 3418833182
  • 数据集大小: 3322082528.975

配置

  • default:
    • 数据文件:
      • train: data/train-*
搜集汇总
数据集介绍
JLB-JLB/seizure_eeg_eval 数据集图片
构建方式
在脑电图(EEG)癫痫发作检测领域,高质量标注数据集的构建是模型训练与评估的基石。JLB-JLB/seizure_eeg_eval数据集以图像形式存储EEG信号片段,每个样本包含一个图像字段、一个表示时间段的epoch字段以及一个三分类标签字段。标签体系涵盖背景活动(bckg)、无事件(No Event)和癫痫发作(seiz)三类,由领域专家依据临床标准进行标注。数据集以分片形式存储于data/train-*路径下,共包含114035个训练样本,总数据量约为3.32GB,确保了大规模训练数据的可用性。
特点
该数据集具有鲜明的临床导向与实用价值。首先,其以图像格式呈现EEG信号,便于直接应用于计算机视觉领域的预训练模型进行迁移学习。其次,三分类标签设计不仅区分了癫痫发作与非发作状态,还单独标注了无事件类别,有助于模型学习更精细的脑电活动模式。此外,数据集规模庞大,涵盖超过11万条训练样本,能够支撑深度学习模型对癫痫发作特征的充分学习,减少过拟合风险。这种结构化的数据组织方式,为脑电信号分析领域的研究者提供了标准化的基准资源。
使用方法
使用该数据集时,研究者可通过HuggingFace Datasets库直接加载,指定config为default并选择train分片即可获取图像、epoch与标签数据。图像数据可直接输入卷积神经网络(CNN)或视觉Transformer(ViT)等模型进行特征提取。标签字段为整数编码,需通过数据集自带的class_label映射转换为语义类别名称。建议在模型训练前对图像进行归一化与尺寸统一处理,并采用交叉熵损失函数进行三分类优化。该数据集特别适合用于癫痫发作检测模型的性能评估与对比实验,也可作为EEG信号分类任务的基准测试集。
背景与挑战
背景概述
癫痫发作的实时监测与脑电图(EEG)信号分析是神经科学和临床医学中的关键课题。JLB-JLB/seizure_eeg_eval数据集由相关研究机构于近期创建,旨在推动基于深度学习的癫痫自动检测算法发展。该数据集包含114035个训练样本,每个样本以图像形式呈现EEG信号片段,并标注为背景(bckg)、无事件(No Event)或癫痫发作(seiz)三类。其核心研究问题在于利用视觉化的EEG数据提升模型对癫痫发作模式的识别能力,为临床辅助诊断和实时监测系统提供可靠基准。该数据集的发布对脑电信号分析领域具有重要影响,填补了高质量标注EEG图像数据集的空白,促进了多模态学习方法在癫痫检测中的探索。
当前挑战
该数据集所解决的领域问题聚焦于癫痫发作的自动分类,传统方法依赖手工特征提取,而EEG信号的复杂性和个体差异性导致泛化困难。构建过程中面临多重挑战:首先,EEG图像化转换需保留时频域关键特征,避免信息丢失;其次,类别不平衡问题显著,癫痫发作样本(seiz)远少于背景和无事件样本,需设计鲁棒的采样或损失函数策略;此外,来自不同患者或记录设备的信号噪声与伪迹干扰,增加了模型对真实发作模式的辨识难度。这些挑战要求算法在敏感性与特异性间取得平衡,同时确保实时处理的高效性,以适配临床场景下的低延迟需求。
常用场景
经典使用场景
在脑电图(EEG)信号处理与癫痫发作检测领域,JLB-JLB/seizure_eeg_eval数据集为基于深度学习的自动癫痫识别提供了标准化的评估基准。该数据集包含超过11万条训练样本,每条样本以图像形式呈现特定时间窗口内的EEG信号片段,并标注为背景活动(bckg)、无事件(No Event)或癫痫发作(seiz)三类。研究者常将其用于训练卷积神经网络或视觉Transformer模型,通过图像分类范式完成对癫痫发作片段的端到端检测,从而规避传统手工特征提取的繁琐流程。
解决学术问题
该数据集的核心学术价值在于解决了癫痫发作自动检测中数据标准化与可重复性不足的难题。此前,各研究机构自建的EEG数据集在采集协议、标注粒度与样本规模上存在显著差异,导致模型性能难以横向对比。JLB-JLB/seizure_eeg_eval通过统一的大规模标注框架,为监督学习范式提供了可靠的实验平台,推动了跨机构间算法鲁棒性的系统评估,并助力探索类不平衡问题(如发作样本远少于背景样本)对分类器决策边界的影响机制。
衍生相关工作
基于该数据集,学术界已衍生出若干经典研究工作。一方面,研究者利用其图像化EEG格式,首次将Vision Transformer架构成功迁移至癫痫检测任务,证实了自注意力机制在捕捉多通道时空特征上的优越性。另一方面,该数据集被用于对比不同数据增强策略(如时间扭曲、频域掩码)对模型泛化能力的影响,催生了面向EEG信号特性的专用增强方法。此外,基于该基准的模型压缩研究也为边缘设备上的轻量化部署提供了技术路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务