遇见数据集

DavidVivancos/MindBigData2023_MNIST-2B

收藏
Hugging Face2024-07-17 更新2024-03-04 收录
官方服务:

资源简介:

MindBigData 2023 MNIST-2B数据集是MindBigData 2023 MNIST-8B的一个子集,基于单个受试者的EEG信号创建,用于机器学习。数据集包含140,000条记录,每条记录来自128个EEG通道,每个通道有256个样本,采样率为250Hz。数据集包括两个主要的CSV文件(train.csv和test.csv),10个音频文件(0.wav到9.wav),以及一个包含EEG电极3D坐标的CSV文件(3Dcoords.csv)。

The MindBigData 2023 MNIST-2B dataset is a subset of the MindBigData 2023 MNIST-8B dataset, developed using EEG signals from a single subject for machine learning applications. It contains 140,000 records, each of which is sourced from 128 EEG channels, with each channel holding 256 samples and a sampling rate of 250 Hz. The dataset includes two primary CSV files (train.csv and test.csv), 10 audio files ranging from 0.wav to 9.wav, and a CSV file (3Dcoords.csv) that records the 3D coordinates of the EEG electrodes.

提供机构:
DavidVivancos
原始信息汇总

数据集概述

MindBigData 2023 MNIST-2B 是一个基于EEG信号的机器学习数据集,由单个受试者使用128通道设备捕获。该数据集复制了Yann LeCun等人创建的MNIST数据集中的70,000个数字,受试者在观看原始数字像素的同时,听取从0到9的语音标签。

数据集内容

  • 数据量:包含70,000条记录,每条记录来自128个EEG通道,每个通道有256个样本(约1秒),采样率为250Hz。
  • 数据文件
    • train.csv:10.7GB,包含头部信息和60,000行数据,共32,558列。
    • test.csv:1.79GB,包含头部信息和10,000行数据,共32,558列。
    • audiolabels 文件夹:包含10个音频文件(0.wav至9.wav)。
    • 3Dcoords.csv:4.27KB,包含头部信息和130行数据,共4列,记录EEG电极的三维坐标。

数据集结构与字段

数据集的详细结构和字段信息,请参考支持论文:arXiv:2306.00455

引用信息

sh @article{MindBigData_2023_MNIST-8B, title={MindBigData 2023 MNIST-8B The 8 billion datapoints Multimodal Dataset of Brain Signals}, author={David Vivancos}, journal={arXiv preprint arXiv:2306.00455}, year={2023} }

搜集汇总
数据集介绍
DavidVivancos/MindBigData2023_MNIST-2B 数据集图片
构建方式
该数据集是MindBigData 2023 MNIST-8B的一个精简子集,基于单名受试者使用定制128通道脑电图设备采集的脑电信号构建而成。实验过程中,受试者同时观看原始MNIST数字像素在屏幕上的逐点呈现,并听取对应数字0至9的语音标签。原始8亿数据点经降采样处理,将每个脑电信号样本从500个采样点缩减至256个(略超1秒),最终形成14万条记录,每条包含128个通道的脑电数据。数据集以两个主要CSV文件存储:训练集含12万行、测试集含2万行,每行包含33,559列特征;此外还附有10个数字语音标签文件及电极三维坐标文件。
特点
该数据集的核心特色在于其多模态融合特性,整合了视觉刺激、听觉标签与高密度脑电信号,完整复现了经典MNIST手写数字集的7万样本。128通道的精细空间分辨率与250Hz的采样率,使脑电信号在时间与空间维度上均具备丰富信息。通过从8B版本中合理降采样至256个时间点,在保持信号关键特征的同时显著降低数据规模,便于机器学习模型的训练与验证。数据集结构清晰,包含训练集与测试集的明确划分,并配套提供了语音标签与电极坐标,为脑机接口与多模态学习研究提供了标准化基准。
使用方法
该数据集适用于基于脑电信号的数字识别与多模态机器学习任务。用户可直接加载train.csv与test.csv文件,利用每行33,559维的特征向量(包含128通道×256时间点的脑电数据及标签)进行模型训练与评估。配套的语音标签文件夹audiolabels中的10个WAV文件可用于多模态融合实验,而3Dcoords.csv文件则支持电极空间位置的可视化或图神经网络建模。建议使用者首先阅读支撑论文(arXiv:2306.00455)以深入理解数据采集协议与特征含义,进而可基于PyTorch或TensorFlow等框架构建分类或回归模型,探索脑电信号与数字认知状态的映射关系。
背景与挑战
背景概述
脑机接口与机器学习领域的交叉研究近年来蓬勃发展,其中基于脑电图(EEG)信号的模式识别为理解人脑认知过程提供了重要窗口。MindBigData 2023 MNIST-2B数据集由David Vivancos于2023年创建,源自其更大规模的MindBigData 2023 MNIST-8B数据集,旨在为机器学习研究提供高质量的脑信号开放资源。该数据集利用定制128通道设备,记录单一受试者在观看Yann LeCun等人经典MNIST手写数字像素并同步聆听对应语音标签时的EEG信号,从而复现了70000个原始数字的脑信号对应版本。核心研究问题在于探索能否从多维脑电数据中解码视觉与听觉刺激所对应的数字类别,为脑机接口解码算法提供基准。该数据集通过提供140000条记录、每条覆盖128通道256样本(约1秒)的标准化格式,显著推动了多模态脑信号数据集的发展,其配套论文发表于arXiv,为后续神经解码研究奠定了数据基础。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。在领域问题层面,核心挑战在于从高维、低信噪比的EEG信号中准确解码数字类别,因为脑电数据易受生理伪迹、环境噪声及个体差异干扰,且128通道256样本的时序结构要求模型具备处理时空关联特征的能力。构建过程中,挑战尤为突出:首先,数据采集需在受试者同步执行视觉注视与听觉感知任务时进行,确保刺激时序精确对齐,这对实验设计提出了严苛要求;其次,原始8B数据点经降采样至256样本后,需平衡信息保留与计算效率,避免丢失关键神经动态;此外,单一受试者数据虽控制了变量,却限制了模型泛化性,未来需扩展至多受试者场景以验证跨个体解码能力。这些挑战共同制约了脑信号机器学习模型的鲁棒性与实用性。
常用场景
经典使用场景
MindBigData 2023 MNIST-2B 数据集在脑机接口与机器学习交叉领域具有里程碑意义,其经典使用场景聚焦于从多通道脑电信号中解码视觉与听觉认知过程。该数据集复刻了经典MNIST手写数字识别任务,但将输入模态从图像像素转变为128通道EEG时序信号,并同步提供对应数字的语音标签。研究者可借此构建端到端的脑信号分类模型,在250Hz采样率下对1秒窗口内的神经活动进行模式识别,实现从大脑活动到数字类别的直接映射,开创了非侵入式脑信号解码的新范式。
解决学术问题
该数据集直面脑信号解码领域的核心学术难题——如何在有限标注样本下从高维、低信噪比的EEG数据中提取鲁棒的神经表征。通过提供包含70,000个数字刺激对应的脑电响应记录,它解决了传统脑信号数据集规模不足、模态单一的瓶颈,使得深度学习模型能够探索跨模态(视觉与听觉)联合解码的可行性。其公开的128通道电极坐标更推动了空间拓扑特征提取方法的发展,为研究大脑对数字认知的神经编码机制提供了标准化基准,显著提升了脑机接口在字符输入等场景的实用潜力。
衍生相关工作
围绕该数据集已衍生出一系列标志性工作,其中最具代表性的是原始论文《MindBigData 2023 MNIST-8B》提出的基于卷积神经网络的时空特征融合框架,实现了对128通道EEG信号的端到端分类。后续研究进一步探索了Transformer架构在脑信号时序建模中的应用,以及对比学习范式在跨被试迁移中的有效性。部分工作还借鉴了多模态对齐技术,将视觉刺激特征与语音特征作为辅助监督信号,显著提升了小样本场景下的解码精度,这些成果共同推动了脑信号大数据时代的到来。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务