eeg-corpus-manifest
收藏资源简介:
EEG Corpus Manifest 是一个针对大型EEG预训练语料库构建的规范化、可查询索引数据集,该语料库由多个开放获取的神经科学数据集汇编而成。该数据集本身仅包含元数据,不包含任何实际的EEG信号数据,每条记录指向源数据集的归档存储URI(如S3、OpenNeuro、PhysioNet AWS Open Data等),访问底层EEG信号需遵循原始数据集的许可协议。数据规模方面,v0.4.1版本覆盖79,418小时的EEG数据,包含186,386个记录文件、43,114名受试者和419个索引数据集,在数据量上超过了REVE和DIVER-1等现有基准。数据集采用星型模式组织,包含5个Parquet表:1) `datasets`表(419行):记录每个源数据集的信息,包括许可、DOI、范式类别等;2) `recordings`表(186,386行):事实表,记录每个EEG文件的基本信息,包括受试者、会话、任务、持续时间、采样率、通道数、参考电极、制造商、蒙太奇、BIDS实体和S3 URI等;3) `channels`表(11,530,668行):记录每个记录的每个通道信息,包括名称、类型、单位和3D坐标(当数据集提供electrodes.tsv时);4) `subjects`表(43,114行):记录每个规范化受试者的人口统计学信息,包括年龄、性别、临床状态和利手;5) `shards`表(0行):占位符表,用于未来索引预训练就绪的数据分片。数据来源广泛,包括:锚定数据集(HBN-EEG、PEERS Memory EEG、TUH-EEG家族)、397个通过OpenNeuro自动获取的数据集,以及Tier 2基准数据集(PhysioNet的Sleep-EDFx、HMC、CAP、CHB-MIT、Siena、MMI、EEGMAT,以及Mumtaz抑郁数据集和TUH的TUAB、TUAR、TUEV等)。这些数据涵盖了多种EEG范式,包括睡眠分期、癫痫检测、运动想象、情绪识别等。该数据集专为大规模EEG预训练和基础模型研究设计,支持通过Hugging Face datasets库、Pandas、DuckDB、Polars等多种工具进行程序化访问和查询。元数据本身采用CC-BY-4.0许可,但用户在使用底层EEG信号时必须遵守原始数据集的许可要求,部分数据集(如TUH家族)需要签署数据使用协议。
EEG Corpus Manifest is a standardized and queryable indexed dataset constructed for large-scale EEG pre-training corpora, which is compiled from multiple open-access neuroscience datasets. This dataset only contains metadata without any actual EEG signal data. Each record points to the archive storage URI of the source dataset (such as S3, OpenNeuro, PhysioNet AWS Open Data, etc.), and accessing the underlying EEG signals must comply with the license agreements of the original datasets. In terms of data scale, version v0.4.1 covers 79,418 hours of EEG data, including 186,386 recording files, 43,114 subjects and 419 indexed datasets, and its data volume exceeds existing benchmarks such as REVE and DIVER-1. The dataset is organized in a star schema and contains 5 Parquet tables: 1) `datasets` table (419 rows): records information of each source dataset, including license, DOI, paradigm category, etc.; 2) `recordings` table (186,386 rows): fact table that records basic information of each EEG file, including subject, session, task, duration, sampling rate, number of channels, reference electrode, manufacturer, montage, BIDS entities and S3 URI, etc.; 3) `channels` table (11,530,668 rows): records information of each channel of each recording, including name, type, unit and 3D coordinates (when the dataset provides electrodes.tsv); 4) `subjects` table (43,114 rows): records demographic information of each standardized subject, including age, gender, clinical status and handedness; 5) `shards` table (0 rows): placeholder table for future indexing of pre-training-ready data shards. The dataset has wide data sources, including: anchor datasets (HBN-EEG, PEERS Memory EEG, TUH-EEG family), 397 datasets automatically acquired via OpenNeuro, and Tier 2 benchmark datasets (Sleep-EDFx, HMC, CAP, CHB-MIT, Siena, MMI, EEGMAT from PhysioNet, as well as Mumtaz Depression Dataset and TUAB, TUAR, TUEV from TUH, etc.). These data cover a variety of EEG paradigms, including sleep staging, epilepsy detection, motor imagery, emotion recognition, etc. This dataset is specifically designed for large-scale EEG pre-training and foundation model research, and supports programmatic access and querying via multiple tools including the Hugging Face Datasets library, Pandas, DuckDB and Polars. The metadata itself is licensed under CC-BY-4.0, but users must comply with the license requirements of the original datasets when using the underlying EEG signals; some datasets (such as the TUH family) require signing a data usage agreement.
EEG Corpus Manifest 数据集详情
数据集概述
EEG Corpus Manifest 是一个面向大规模 EEG 预训练语料库的标准化、可查询索引。该清单仅包含元数据,不包含任何 EEG 信号。每个条目指向源数据集的归档 URI(S3 / OpenNeuro / FCP-INDI / NEDC / PhysioNet AWS Open Data),对底层信号的访问受原始数据集许可证的约束。
版本与规模
- 当前版本: v0.4.1(2026-05-14)
- 覆盖范围: 79,418 小时 EEG,共 186,386 条记录,43,114 名被试,419 个已索引数据集
数据集结构
清单采用星型模式,包含 5 个 Parquet 表格:
| 表格 | 行数 | 描述 |
|---|---|---|
datasets |
419 | 每个源数据集一行。包含许可证、DOI、范式摘要、模态、范式类别 |
recordings |
186,386 | 事实表。每条记录文件一行。包含被试、会话、运行、任务、范式、时长、采样率、通道数、参考、制造商、导联、BIDS 实体、S3 URI |
channels |
11,530,668 | 每个记录每个通道一行。包含名称、类型、单位、电极状态、3D 坐标 |
subjects |
43,114 | 每个规范被试一行。包含年龄、性别、临床状态、利手 |
shards |
0 | 占位符 — 将索引预训练就绪的 WebDataset / MDS 分片 |
数据覆盖(v0.4.1)
| 字段 | 覆盖率 | 说明 |
|---|---|---|
duration_s |
95.8% | 缺失值来自缺少 BIDS 侧车文件的 .set / .vhdr / .fif 文件 |
sampling_rate_hz |
97.3% | EDF/BDF 始终可解析(64 KB 头部读取) |
header_read_status == "ok" |
100% | 186,386 条记录零头部解析错误 |
channels.x / y / z |
因数据集而异 | 仅当数据集提供 electrodes.tsv 时填充 |
语料库组成
锚点数据集(v0.1.0 / v0.2.0)
| 数据集 | 格式 | 通道数 | 采样率 | 许可证 |
|---|---|---|---|---|
| HBN-EEG (Healthy Brain Network) | EEGLAB .set | 129 (EGI HydroCel) | 500 Hz | CC-BY-SA-4.0 |
| PEERS Memory EEG (ds004395) | EDF / BDF | 129 (EGI), 137, 144, 272 (BioSemi) | 250–2048 Hz | CC0-1.0 |
| TUH-EEG Corpus (TUEG 家族) | EDF | 20–41 (临床) | 250 / 256 / 400 / 512 / 1000 Hz | TUH DUA |
| 397 个 OpenNeuro 数据集 | 混合 | 不等 | 不等 | 主要为 CC0-1.0 |
Tier 2 — 基础模型基准/下游评估
| 数据集 | 来源 | 记录数 | 被试数 | 小时数 | 许可证 | |---|---|---|---:|---:|---:|---| | PhysioNet Sleep-EDFx | PhysioNet | 197 | 197 | 3,849 | ODC-By | | PhysioNet HMC | PhysioNet | 154 | 154 | 1,164 | ODC-By | | PhysioNet CAP | PhysioNet | 108 | 108 | 993 | ODC-By | | PhysioNet CHB-MIT | PhysioNet | 665 | 23 | 962 | ODC-By | | PhysioNet Siena | PhysioNet | 38 | 14 | 130 | ODC-By | | PhysioNet MMI (EEGMMIDB) | PhysioNet | 1,526 | 109 | 49 | ODC-By | | Mumtaz | figshare 4244171 | 180 | 64 | 20 | CC-BY-4.0 | | PhysioNet EEGMAT | PhysioNet | 72 | 36 | 2 | ODC-By | | TUAB — TUH Abnormal | TUH NEDC | 2,993 | 2,329 | 1,141 | TUH DUA | | TUAR — TUH Artifact | TUH NEDC | 310 | 213 | 100 | TUH DUA | | TUEV — TUH Events | TUH NEDC | 518 | 370 | 149 | TUH DUA | | Tier 2 总计 | | 6,761 | 3,617 | 8,558 | |
Tier 2 — 受限/延期的数据集
| 数据集 | 来源 | 延期原因 |
|---|---|---|
| FACED — 4 类情感 | Synapse syn50614194 | 需要免费 Synapse 账户 + 点击接受服务条款 |
| SEED-V — 5 类情感 | bcmi.sjtu.edu.cn | 需要通过 BCMI 门户提交 DUA |
| ISRUC-Sleep I / II / III | sleeptight.isr.uc.pt | 大学 WordPress 对 AWS IP 返回 text/html |
| MOABB 捆绑包 | bbci.de / GIN / Wasabi Tokyo | 跨区域吞吐量低,需 ap-northeast-1 工作节点 |
记录表主要字段(核心事实表)
| 列 | 类型 | 说明 |
|---|---|---|
recording_id |
string | 基于 archival_uri 的 UUIDv5,跨构建稳定 |
dataset_id |
string | 外键 → datasets.dataset_id |
subject_id_in_dataset |
string | 源数据中的被试标识 |
subject_canonical_hash |
string | 外键 → subjects.subject_hash |
session_id, run_id, task |
string | BIDS 风格实体,可空 |
archival_uri |
string | S3 路径 |
archival_format |
string | edf, bdf, set, vhdr, fif, cnt, gdf |
duration_s |
float64 | 时长,缺失时为 null |
sampling_rate_hz |
float32 | 采样率 |
header_source |
string | 头部提取来源 |
许可证
- 清单本身: CC-BY-4.0
- 底层 EEG 信号由原始数据集许可证管理:
| 来源家族 | 信号许可证 | 访问要求 |
|---|---|---|
| HBN-EEG | CC-BY-SA-4.0 | 开放 |
| PEERS ds004395 | CC0-1.0 | 开放 |
| 397 个 OpenNeuro 数据集 | 几乎全为 CC0-1.0 | 开放 |
| TUH-EEG 家族 | TUH DUA | 需签署数据使用协议 |
| PhysioNet (MMI, Sleep-EDFx, CHB-MIT, Siena, CAP, EEGMAT, HMC) | ODC-By | 开放 |
| Mumtaz (figshare 4244171) | CC-BY-4.0 | 开放 |
已知限制(v0.4.1)
- MOABB 捆绑包排队等待未来版本发布
- 四个 OpenNeuro 镜像仍被上游阻止(403 AccessDenied)
- 十二个 Mumtaz figshare 文件 ID当前返回 63 字节的 404 JSON 载荷
- NSRR 儿科睡眠队列 (NCHSDB) 待 DUA 批准
- ISRUC Sleep I/II/III 被延期
- 跨数据集被试去重仅限数据集内
- 仅 MNE 格式仍报告空头部
版本历史
| 版本 | 日期 | 数据集数 | 显著新增 |
|---|---|---|---|
| v0.1.0 | 2026-05-13 | 3 | HBN + PEERS + TUH 锚点 |
| v0.2.0 | 2026-05-13 | 400 | 397 个 OpenNeuro 数据集自动摄入 |
| v0.3.0 | 内部 | 400 | 模式清理 |
| v0.4.0 | 2026-05-14 | 419 | TUAB / TUAR / TUEV + PhysioNet Tier 2 + Mumtaz |
| v0.4.1 | 2026-05-14 | 419 | TUH 路径覆盖、BIDS 运行标签、Mumtaz 无效载荷过滤 |
| v0.5.0 (计划) | 待定 | 449+ | MOABB 捆绑包和获批的受限/延期队列 |
引用
bibtex @misc{eeg_corpus_manifest_2026, author = {Pavan Kalyan Tankala}, title = {EEG Corpus Manifest: A unified index over open-access EEG pretraining corpora}, year = {2026}, publisher = {Hugging Face}, howpublished = {url{https://huggingface.co/datasets/tankalapavankalyan/eeg-corpus-manifest}}, }




