amber
收藏资源简介:
Amber 是一个开放的脑电图(EEG)语料库,旨在将多个公共 EEG 数据集统一为一种自描述的容器格式(EEGX),以便于大规模分析和机器学习应用。该数据集包含 6,047 小时的 EEG 记录,来自 7,241 个记录片段、1,835 名受试者和 161 个不同的源数据集。数据总大小为 60.4 GB,包含 3,754,479 个标注事件。数据集特别侧重于收集受试者在执行任务(如阅读、聆听、记忆、决策、控制界面)时的 EEG 数据,而非静止状态。内容分类包括:主动任务(302.6 小时)、临床(164.8 小时)、静息/未标记(330.1 小时)和睡眠(5,249.5 小时)。所有数据均以统一格式提供,每个文件为一个 (n_channels, n_samples) 的通道主序数组,物理单位为浮点型。数据支持时间序列预测和特征提取等任务。数据集遵循混合开放许可(CC0 和 ODC-BY 1.0),要求对每个源数据集进行适当归因。该语料库还提供了目录索引(catalog.jsonl)和纯 Python 参考读取器(eegx),便于用户根据采样率、通道数或时长进行过滤和读取。
Amber — 开放 EEG 语料库
概述
- 包含 6,046 小时 EEG 数据
- 来自 7,275 个记录、1,864 名受试者、164 个公开数据集
- 全部转换为统一的自描述容器格式,可用一行代码读取
核心统计
| 指标 | 数值 |
|---|---|
| 记录时长 | 6,046.4 小时 |
| EEG 通道-小时 | 37,487 |
| 记录数 | 7,275 |
| 文件数 | 7,523 |
| 受试者数 | 1,864 |
| 源数据集数 | 164 |
| 标注事件数 | 3,612,642 |
| 大小 | 60.5 GB |
| 位精确文件 | 3,620 / 7,523 (48%) |
内容分类(受试者活动)
| 内容类型 | 小时 | 记录数 | 数据集数 |
|---|---|---|---|
| 主动任务 | 295.3 | 3,434 | 61 |
| 临床 | 164.8 | 83 | 5 |
| 静息 / 未标注 | 336.8 | 3,382 | 92 |
| 睡眠 | 5,249.5 | 376 | 6 |
标签源自数据集标题和任务实体,通过 tools/content_tiers.py 生成,仅供参考而非人工整理的基准真值。
快速开始
依赖:仅需 numpy 和 zstandard(较重的转换器 pyedflib、mne 为惰性导入,读取时不需):
bash pip install numpy zstandard huggingface_hub
python from huggingface_hub import snapshot_download import eegx # reader shipped in this repo under eegx/
p = snapshot_download(amongglue/amber, repo_type=dataset, allow_patterns=data/physionet/eegmat/*) r = eegx.open(f{p}/data/physionet/eegmat/Subject00_1.eegx)
x = r.read() # (n_channels, n_samples) float32, physical units x = r.read(picks=[eeg]) # EEG channels only print(r.sfreq, r.duration, r.channel_names, r.events)
每个文件为单个 (n_channels, n_samples) 通道优先数组。这是该格式唯一的刚性保证:无论蒙太奇、任务或原始供应商格式如何,此形状始终成立。容器布局详见 SPEC.md。
目录结构
data/<archive>/<dataset>/*.eegx signals, one file per recording data/<archive>/<dataset>/README.md source, licence, hours, channels catalog.jsonl one row per file: id, hours, channels, rates SPEC.md the container format eegx/ reference reader (pure Python + numpy)
catalog.jsonl 是索引入口,可在不打开任何信号文件的情况下按采样率、通道数或时长筛选。
来源贡献
Other — 164 个数据集共 6,046.4 小时
完整数据集列表(含 Source、Hours、Rec、Subj、Rate (Hz)、Ch、Licence)见 README 中的表格,涵盖 sleep-edfx、hmc-sleep-staging、ucddb、siena-scalp-eeg、eegmmidb 等 164 个数据集,许可均为 ODC-BY。
时长计算方式
- 记录时长:墙钟时间,按每个源记录计一次。混合采样率的记录会按采样率分组拆分为多个文件,因此一夜睡眠可能对应多个文件;仅计入至少含一个 EEG 通道的文件,且同一记录的各部分不会相加。
- 通道-小时:时长乘以 EEG 通道数,是衡量训练数据量的关键指标。
保真度
- EDF/BDF 源在数字层面读取,以相同的整数存储,并保留原始每通道仿射映射,转换位精确且可逆——可通过源仓库中的
tools/verify_lossless.py验证(重新下载原始文件并比较样本)。 - 仅暴露浮点数据的源(EEGLAB
.set、部分 BrainVision)会针对每通道满量程范围重新量化为 int16;这些文件在其头部和catalog.jsonl中标记为lossless: false。
来源与许可
- 每个文件记录其来源:源 URL、原始文件的 SHA-256、许可和转换时间:
python eegx.read_header(path)[provenance]
- 所有包含的数据集均为 CC0 或 ODC-BY 1.0,均允许再分发。
- ODC-BY 要求署名:每个数据集的
README.md均标明原始来源,这些引用应随任何衍生作品一同传播。 - 本仓库是格式转换,而非新数据——请引用原始作者,而不仅是本语料库。
标签与分类
- 标签:eeg、neuroscience、biosignals、time-series、brain-computer-interface、sleep
- 任务类别:time-series-forecasting、feature-extraction
- 规模类别:10B < n < 100B
- 许可:other(mixed-open-cc0-and-odc-by),许可链接:https://opendatacommons.org/licenses/by/1-0/
- viewer: false




