遇见数据集

amber

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

Amber 是一个开放的脑电图(EEG)语料库,旨在将多个公共 EEG 数据集统一为一种自描述的容器格式(EEGX),以便于大规模分析和机器学习应用。该数据集包含 6,047 小时的 EEG 记录,来自 7,241 个记录片段、1,835 名受试者和 161 个不同的源数据集。数据总大小为 60.4 GB,包含 3,754,479 个标注事件。数据集特别侧重于收集受试者在执行任务(如阅读、聆听、记忆、决策、控制界面)时的 EEG 数据,而非静止状态。内容分类包括:主动任务(302.6 小时)、临床(164.8 小时)、静息/未标记(330.1 小时)和睡眠(5,249.5 小时)。所有数据均以统一格式提供,每个文件为一个 (n_channels, n_samples) 的通道主序数组,物理单位为浮点型。数据支持时间序列预测和特征提取等任务。数据集遵循混合开放许可(CC0 和 ODC-BY 1.0),要求对每个源数据集进行适当归因。该语料库还提供了目录索引(catalog.jsonl)和纯 Python 参考读取器(eegx),便于用户根据采样率、通道数或时长进行过滤和读取。

创建时间:
2026-09-10
原始信息汇总

Amber — 开放 EEG 语料库

概述

  • 包含 6,046 小时 EEG 数据
  • 来自 7,275 个记录1,864 名受试者164 个公开数据集
  • 全部转换为统一的自描述容器格式,可用一行代码读取

核心统计

指标 数值
记录时长 6,046.4 小时
EEG 通道-小时 37,487
记录数 7,275
文件数 7,523
受试者数 1,864
源数据集数 164
标注事件数 3,612,642
大小 60.5 GB
位精确文件 3,620 / 7,523 (48%)

内容分类(受试者活动)

内容类型 小时 记录数 数据集数
主动任务 295.3 3,434 61
临床 164.8 83 5
静息 / 未标注 336.8 3,382 92
睡眠 5,249.5 376 6

标签源自数据集标题和任务实体,通过 tools/content_tiers.py 生成,仅供参考而非人工整理的基准真值。

快速开始

依赖:仅需 numpyzstandard(较重的转换器 pyedflibmne 为惰性导入,读取时不需):

bash pip install numpy zstandard huggingface_hub

python from huggingface_hub import snapshot_download import eegx # reader shipped in this repo under eegx/

p = snapshot_download(amongglue/amber, repo_type=dataset, allow_patterns=data/physionet/eegmat/*) r = eegx.open(f{p}/data/physionet/eegmat/Subject00_1.eegx)

x = r.read() # (n_channels, n_samples) float32, physical units x = r.read(picks=[eeg]) # EEG channels only print(r.sfreq, r.duration, r.channel_names, r.events)

每个文件为单个 (n_channels, n_samples) 通道优先数组。这是该格式唯一的刚性保证:无论蒙太奇、任务或原始供应商格式如何,此形状始终成立。容器布局详见 SPEC.md

目录结构

data/<archive>/<dataset>/*.eegx signals, one file per recording data/<archive>/<dataset>/README.md source, licence, hours, channels catalog.jsonl one row per file: id, hours, channels, rates SPEC.md the container format eegx/ reference reader (pure Python + numpy)

catalog.jsonl 是索引入口,可在不打开任何信号文件的情况下按采样率、通道数或时长筛选。

来源贡献

Other — 164 个数据集共 6,046.4 小时

完整数据集列表(含 Source、Hours、Rec、Subj、Rate (Hz)、Ch、Licence)见 README 中的表格,涵盖 sleep-edfxhmc-sleep-stagingucddbsiena-scalp-eegeegmmidb 等 164 个数据集,许可均为 ODC-BY。

时长计算方式

  • 记录时长:墙钟时间,按每个源记录计一次。混合采样率的记录会按采样率分组拆分为多个文件,因此一夜睡眠可能对应多个文件;仅计入至少含一个 EEG 通道的文件,且同一记录的各部分不会相加。
  • 通道-小时:时长乘以 EEG 通道数,是衡量训练数据量的关键指标。

保真度

  • EDF/BDF 源在数字层面读取,以相同的整数存储,并保留原始每通道仿射映射,转换位精确且可逆——可通过源仓库中的 tools/verify_lossless.py 验证(重新下载原始文件并比较样本)。
  • 仅暴露浮点数据的源(EEGLAB .set、部分 BrainVision)会针对每通道满量程范围重新量化为 int16;这些文件在其头部和 catalog.jsonl 中标记为 lossless: false

来源与许可

  • 每个文件记录其来源:源 URL、原始文件的 SHA-256、许可和转换时间:

python eegx.read_header(path)[provenance]

  • 所有包含的数据集均为 CC0 或 ODC-BY 1.0,均允许再分发。
  • ODC-BY 要求署名:每个数据集的 README.md 均标明原始来源,这些引用应随任何衍生作品一同传播。
  • 本仓库是格式转换,而非新数据——请引用原始作者,而不仅是本语料库。

标签与分类

  • 标签:eeg、neuroscience、biosignals、time-series、brain-computer-interface、sleep
  • 任务类别:time-series-forecasting、feature-extraction
  • 规模类别:10B < n < 100B
  • 许可:other(mixed-open-cc0-and-odc-by),许可链接:https://opendatacommons.org/licenses/by/1-0/
  • viewer: false
搜集汇总
数据集介绍
amber 数据集图片
构建方式
Amber语料库的构建源于脑电信号研究领域对跨数据集整合的迫切需求,其核心策略在于将来自164个公开数据集的7,275段记录统一转换为自描述的EEGX容器格式。构建过程中,EDF/BDF格式的源文件以数字级别读取并保留原始逐通道仿射映射,实现位精确且可逆的转换,而仅提供浮点数据的EEGLAB等格式则按通道满量程重新量化为int16。每个文件均记录来源URL、原始SHA-256、许可证及转换时间,确保完整的溯源信息。
特点
该数据集汇集了1,864名受试者共计6,046.4小时的脑电记录,涵盖37,487通道小时与3,612,642个标注事件,总规模达60.5 GB。其显著特点在于偏重受试者执行主动任务时的脑电信号,如阅读、聆听、记忆与接口控制,而非静息态记录。所有文件严格遵循单一通道优先的(n_channels, n_samples)矩阵结构,无论导联布局、任务类型或原始厂商格式如何,该形状恒定不变,从而支持对未知记录的枚举与转换。
使用方法
使用该数据集仅需安装numpy与zstandard,并通过huggingface_hub下载快照。借助仓库内置的eegx参考读取器,用户可执行eegx.open()打开指定EEGX文件,调用read()获取物理单位的浮点数组,或通过picks参数筛选脑电通道,并访问采样率、时长、通道名称及事件信息。catalog.jsonl提供逐文件索引,允许在不打开信号文件的情况下按采样率、通道数或时长进行筛选。
背景与挑战
背景概述
脑电图(EEG)作为刻画神经电生理活动的核心手段,其数据共享与复用长期受制于格式碎片化与样本规模不足。Amber语料库由研究团队于近年构建并公开发布,旨在将164个公开数据集、7275段记录、1864名受试者的6046小时EEG信号统一转换为自描述的EEGX容器格式,从而以单行代码实现跨来源读取。该工作直面EEG领域缺乏大规模、异构整合基准的核心问题,其以主动任务与睡眠数据为主体的构成,为时间序列预测、特征提取及脑机接口研究提供了迄今规模领先的开放资源,对推动可复现神经科学与算法泛化评估具有显著影响力。
当前挑战
Amber所应对的领域问题在于EEG数据因采集设备、导联布局、采样率与文件格式的巨大多样性而难以规模化利用,传统分析流程需针对每一来源单独适配,严重阻碍模型训练与跨数据集验证。其构建过程亦面临多重挑战:164个数据集的元数据与许可条款参差不齐,需逐一核验并确保CC0或ODC-BY兼容;EDF/BDF可位精确转换,而仅提供浮点数据的EEGLAB与BrainVision来源则需重新量化并标记有损;睡眠记录跨采样率切分与通道小时统计亦要求精细的工程处理。这些因素共同构成了大规模EEG语料整合的典型难题。
常用场景
经典使用场景
在脑机接口与认知神经科学领域,Amber凭借其庞大的规模与统一格式,成为多任务脑电建模的经典基座。研究者得以将运动想象、事件相关电位、睡眠分期等异质任务置于同一容器中,利用其三万七千余通道小时的信号开展跨数据集预训练与迁移学习。例如,在运动想象解码中,可一次性枚举上百个源数据集的特征分布,从而评估模型在未知被试与未知采集设备上的泛化边界,这种能力在以往碎片化的脑电资源中难以实现。
实际应用
在临床与消费级场景中,Amber为睡眠自动分期、癫痫发作检测、注意力监测等应用提供了可规模化的训练语料。睡眠相关记录逾五千小时,覆盖多个公开睡眠队列,足以支撑高精度的睡眠纺锤波与分期模型开发。对于脑机接口企业而言,该语料库可用于预训练解码器,再以少量用户特定数据微调,从而缩短产品落地周期。此外,其目录文件支持按采样率与通道数快速筛选,便于针对嵌入式设备定制轻量化模型。
衍生相关工作
自发布以来,Amber已催生若干围绕统一脑电解码与自监督表示学习的研究。部分工作以其为预训练池,探索掩码重建与对比学习在脑电信号上的迁移效能;另一些则利用其丰富的注释事件,构建跨数据集的睡眠分期与异常检测基准。这些衍生研究反过来促进了EEGX格式的采纳,并推动了社区对数据溯源与许可合规的重视,形成数据、格式与算法协同演进的良性循环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务