遇见数据集

reve-dataset

收藏
Hugging Face2026-03-16 更新2026-03-20 收录
官方服务:

资源简介:

REVE预训练数据集(开放子集)是一个用于训练EEG(脑电图)大规模基础模型的开放访问数据集。该子集包含所有允许重新分发和开放研究的记录,总大小约为4.4TB,占整个REVE预训练数据量的一半。数据集以NumPy二进制文件(.npy)格式存储,并针对内存映射(memmap)进行了优化,以便在不将整个多TB数据集加载到RAM的情况下实现高效访问。该数据集旨在用于自监督学习(如掩码自编码器、对比学习)、评估EEG基础模型的迁移能力以及研究数据量对神经信号解码的影响。数据集汇集了多个主要的开源EEG存储库,并强调了引用原始来源的重要性。

The REVE Pre-training Dataset (Open Subset) is an openly accessible dataset for training large-scale foundation models for EEG (Electroencephalography). This subset includes all records that permit redistribution and open research, with a total size of approximately 4.4 TB, accounting for half of the entire REVE pre-training dataset. The dataset is stored in NumPy binary file (.npy) format, and optimized for memory mapping (memmap) to enable efficient access without loading the entire multi-TB dataset into RAM. This dataset is designed for use in self-supervised learning (e.g., masked autoencoders, contrastive learning), evaluating the transfer capabilities of EEG foundation models, and researching the impact of data scale on neural signal decoding. The dataset aggregates multiple major open-source EEG repositories, and emphasizes the importance of citing their original sources.

创建时间:
2026-03-13
搜集汇总
数据集介绍
reve-dataset 数据集图片
构建方式
在脑电信号基础模型研究的浪潮中,REVE预训练数据集(开放子集)应运而生。该数据集通过整合多个来自OpenNeuro等平台的公开许可脑电记录构建而成,汇聚了包括空间记忆、情绪识别、语音处理、静息态等多种实验范式的原始与预处理数据。整体规模约达4.85TB,占REVE完整预训练语料的一半左右。数据以大规模NumPy二进制格式(.npy)存储,并采用内存映射(memory-mapping)机制进行加载,从而在不将整个多TB语料库载入内存的前提下实现高效访问。
特点
该数据集最显著的特征在于其庞大且多样化的数据规模,为脑电图领域大规模基础模型的训练提供了丰厚的土壤。其覆盖了超过25,000名受试者的脑电活动记录,来源横跨多种认知任务与临床情境,极大地提升了数据的代表性与泛化能力。采用内存映射技术使得研究者能够轻松处理TB级数据而无需昂贵的内存资源,降低了大规模脑电研究的技术门槛。此外,数据集专为自监督学习范式设计,完美适配掩码自编码器与对比学习等前沿算法。
使用方法
使用该数据集时,研究者可聚焦于三大核心方向。其一为预训练阶段,可借助自监督学习框架,如掩码自编码器,在海量无标签脑电数据上习得鲁棒的神经表征。其二为模型评估与迁移学习,该数据集可作为基准,检验脑电基础模型在不同任务间的可迁移性。其三为探索神经科学中的缩放定律,通过系统性地改变数据量,揭示数据规模对神经信号解码性能的影响规律。使用前需注意引用原始数据来源及REVE论文,以尊重各数据贡献者的学术劳动。
背景与挑战
背景概述
在神经科学与脑机接口领域,脑电图(EEG)因其非侵入性与高时间分辨率而成为研究大脑动态活动的核心工具。然而,传统EEG模型受限于小样本与单一实验范式,难以泛化至多样化场景。为突破这一瓶颈,Yassine El Ouahidi等研究人员于2025年提出了REVE(Representation Learning for EEG)基础模型,并发布了其预训练数据集的开放子集(REVE Pretrain: Open Subset)。该数据集由IMT Atlantique、蒙特利尔大学等机构联合构建,汇聚了来自OpenNeuro等公开存储库的超过50项研究,覆盖约25000名受试者,总规模达4.85TB,旨在通过大规模自监督学习推动EEG基础模型的研发。其对领域的影响力在于,首次提供了足以支撑规模法则研究的公开EEG语料库,有望重塑神经信号解码的范式。
当前挑战
该数据集面临的核心挑战源自EEG领域固有的异质性与构建过程的复杂性。首先,不同实验范式(如静息态、认知任务)下采集的EEG信号在通道配置、采样率及噪声特性上差异显著,如何设计统一的预处理流程以消除设备与协议偏差,同时保留神经生理学信息,是模型泛化需解决的领域难题。其次,构建过程中需整合来自数十个研究组的异构数据,包括格式转换(如从BIDS到大规模NumPy二进制文件)、伪迹去除(如眼动与肌肉噪声的自动识别)以及存储优化(如内存映射的高效访问),这些步骤对计算资源与标准化流程提出了严苛要求。此外,开放子集仅占完整语料库的一半,如何确保子集在人口统计学与任务类型上的代表性,以避免预训练偏向,亦是数据平衡中的重大挑战。
常用场景
经典使用场景
在脑电信号(EEG)领域,大规模基础模型的训练长期受限于数据规模和异构性。REVE数据集开放子集以约4.85TB的原始与预处理脑电数据,为自监督学习范式提供了肥沃的土壤。研究者可借助掩码自编码器或对比学习等框架,在这片丰饶的数据沃土上预训练通用的EEG表征模型,从而摆脱传统方法对特定任务与有限样本的依赖。该数据集的内存映射加载机制,使得即使面对多TB级数据,也能实现高效、可扩展的模型训练与迭代。
解决学术问题
REVE数据集的核心贡献在于解决了脑电领域长期存在的“数据荒漠”困境——缺乏大规模、多源、可公开获取的预训练语料。通过聚合来自OpenNeuro等平台的数十个高质量研究子集,它使得探索神经信号解码中的缩放定律成为可能,即系统性地研究数据量增长如何影响模型性能与泛化能力。此外,该数据集为评估EEG基础模型的跨任务、跨被试迁移性提供了标准化基准,推动了从专用模型向通用脑电智能体的范式跃迁。
衍生相关工作
REVE数据集的发布催生了一系列围绕EEG基础模型的前沿探索。其直接衍生的经典工作当属REVE模型本身,该工作证明了在25000名被试数据上预训练的Transformer架构能够适应多种采集设置。围绕该数据集,研究者进一步探索了基于对比学习的跨被试表征对齐方法、面向EEG的掩码建模策略,以及针对不同时间分辨率的神经编码器设计。这些工作共同开启了脑电领域“预训练-微调”的新范式,为后续更大规模、更多模态的神经基础模型研究奠定了基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务