遇见数据集

JapanEEG

收藏
arXiv2026-05-31 更新2026-06-05 收录
官方服务:

资源简介:

JapanEEG是由Araya公司创建的一个大规模多模态脑电数据集,专门针对日语语音生成研究。该数据集包含1020小时的同步记录头皮脑电图、面部肌电图和语音音频数据,来自三名健康日语母语者在开放词汇朗读任务中的多次会话,覆盖三种不同通道数(62-128通道)的脑电设备。数据采集过程采用纵向、多设备和多模态同步记录策略,通过文本游戏、书籍朗读和语音语料库等多种任务激发自然语音产出,并利用Silero VAD模型进行语音事件检测与标注。该数据集主要应用于语音解码、脑机接口、多模态信号处理以及跨会话和设备适应等领域,旨在解决语音相关脑电研究中数据规模有限、设备泛化能力不足以及肌肉伪影干扰等核心挑战。

JapanEEG is a large-scale multimodal electroencephalography (EEG) dataset developed by Araya Inc., exclusively tailored for Japanese speech generation research. It encompasses 1020 hours of synchronously recorded scalp EEG, facial electromyography (EMG), and speech audio data, sourced from multiple sessions of three healthy Japanese native speakers completing open-vocabulary oral reading tasks, across EEG devices with three distinct channel counts (62–128 channels). The data collection employs a longitudinal, multi-device, and multimodal synchronous recording paradigm, where natural speech production is elicited through diverse tasks including text games, book reading, and speech corpora. Speech event detection and annotation are implemented using the Silero VAD model. This dataset is primarily utilized in research areas such as speech decoding, brain-computer interfaces (BCIs), multimodal signal processing, as well as cross-session and cross-device adaptation. Its core objective is to address key challenges in speech-related EEG research, namely limited data scale, inadequate device generalization ability and muscle artifact interference.

提供机构:
Araya 公司
创建时间:
2026-05-31
搜集汇总
数据集介绍
JapanEEG 数据集图片
构建方式
JapanEEG数据集由三位健康日语母语者在开放词汇的显性言语任务中同步采集头皮脑电图、面部肌电图和语音音频构建而成。数据采集跨越数月,使用了三套不同通道数(62–128通道)的脑电图系统,包括超高密度系统g.Pangolin以及两款帽式系统g.SCARABEO和eego™sports。每位参与者进行多种任务,如朗读电子游戏对话、书籍或语音语料库,以及进行想象言语任务。语音事件通过Silero语音活动检测模型进行分割和标注,并转录为文本,最终以脑影像数据结构(BIDS)格式存储于OpenNeuro平台。
特点
该数据集总时长约1020小时,是目前规模最大的公开日语言语脑电图数据集之一。其核心特色在于多模态同步记录——包含头皮脑电图、面部肌电图和音频,使研究者能够在分析神经信号时联合考虑言语产生的肌电伪迹。数据集涵盖三种不同通道数和类型的脑电图设备,支持跨设备、跨session的泛化性研究。此外,开放词汇的设计为语音解码、多模态信号处理、伪迹建模及脑电图表征学习提供了丰富数据资源。
使用方法
用户可通过OpenNeuro平台(https://openneuro.org/datasets/ds007808)免费获取该数据集。数据以BIDS格式组织,包含原始脑电图(.edf)、音频(.wav)、事件注释(.tsv)以及元数据文件。研究者可使用标准脑电图分析工具(如MNE-Python)读取和处理数据,或基于提供的预处理代码进行自定义分析。数据集适用于语音解码、肌电伪迹建模、跨设备迁移学习、以及脑电图基础模型预训练等研究场景,使用时需引用对应的数据集DOI和版本号。
背景与挑战
背景概述
脑电图(EEG)作为一种无创的神经活动记录技术,在神经科学、临床神经生理学及脑机接口研究中占据核心地位。然而,言语相关EEG研究长期受限于公开数据集的匮乏,尤其是缺乏覆盖开放词汇、发声言语及多设备记录的大规模资源。在此背景下,Motoshige Sato等来自Araya公司的研究人员于2026年发布了JapanEEG数据集,该数据集总计1020小时,同步采集了三名健康日语母语者的头皮脑电(62–128通道)、面部肌电及语音音频,涉及g.Pangolin、g.SCARABEO和eego™sports三种EEG系统。数据在数月内多次采集,以言语解码为核心研究问题,同时支持多模态信号处理、伪迹建模、纵向与跨设备适应及EEG表征学习。该数据集以Brain Imaging Data Structure格式公开于OpenNeuro平台,采用CC0协议,为言语EEG及更广泛的脑电研究提供了前所未有的规模化、多模态、跨时间与设备的资源,显著推动了领域发展。
当前挑战
JapanEEG数据集所解决的领域挑战在于,现有言语相关EEG数据集多局限于小规模提示集、想象言语而非发声言语、单一设备记录或非日语语言,限制了模型的泛化能力和生态效度。为此,该数据集通过覆盖开放词汇、采集发声言语、集成三大EEG系统及同步面部肌电与音频,系统性应对了言语解码中因发音肌活动污染头皮记录的核心难题。构建过程中的挑战尤为突出:需确保一名参与者跨数月多次采集时的纵向一致性,并协调三套不同通道数与采样率的设备实现时间同步;同时,需处理开放词汇任务中多样化的文本来源(如故事、漫画、游戏对话),并应用语音活动检测算法精准分割发声、想象及聆听事件,排除短时伪迹。此外,自适应滤波的采用需在抑制肌电伪迹的同时保留神经信号的时空结构,这一系列精密的设计与协调工作构成了数据集构建的重大挑战。
常用场景
经典使用场景
在非侵入性脑机接口与语音神经科学领域,JapanEEG数据集因其前所未有的规模和模态丰富性,成为研究开放词汇语音解码的标杆性资源。该数据集收录了超1000小时同步的头皮脑电图、面部肌电图及语音音频,覆盖三位母语者持续数月、跨三套脑电系统的长时间采集。研究者可借此训练端到端的语音重建模型,实现从神经信号到可理解语音的映射。经典的实验范式包括朗读文本游戏、书籍及语音语料库,并辅以默读与听觉感知任务。EMG通道的存在使得肌电伪迹建模与神经发音特征的分离成为可能,为提升解码鲁棒性提供了独特的验证平台。
衍生相关工作
基于JapanEEG的开放性与多模态特性,一系列衍生工作已在预印本与会议中涌现。经典方向之一是基于自监督学习的脑电基础模型预训练,如通过对比学习在千小时级别数据上学习通用神经嵌入,显著提升了小样本场景下的语音分类与合成性能。另一条脉络聚焦于跨设备域适应方法,研究者利用不同脑电系统间的共享神经子空间,提出了基于对抗训练或最优传输的迁移框架,将双曲度阵列上训练的模型无损迁移至轻量化设备。此外,语音-肌电-脑电多模态对齐模型也成为热点,通过时序注意力机制实现发音肌电信号的盲分离,为理解大脑运动皮层与外周肌肉的协同编码提供了计算工具。
数据集最近研究
最新研究方向
在当前脑机接口与神经语言学迅猛发展的浪潮中,JapanEEG数据集的问世为非侵入式语音解码研究注入了全新活力。该数据集以超过1000小时的高密度脑电图、面部肌电图与语音音频同步记录为核心,开创性地将开放式日语口语生产作为研究范式,覆盖了多达128通道的多设备纵向采集,为探索语音产生的神经时空动态提供了前所未有的数据基础。前沿研究正聚焦于利用这一多模态资源攻克语音脑电中的运动伪影分离与跨设备泛化难题,同时推动自监督表示学习与基础模型在非侵入式脑信号上的预训练。该数据集不仅为开发高精度、低延迟的语音脑机接口提供了基准测试平台,更因其开放复用价值,在神经信号处理、跨会话迁移学习及语音-运动耦合分析等交叉方向上展现出深远影响。
相关研究论文
  • 1
    A 1000-hour EEG-EMG-audio dataset of Japanese speech productionAraya 公司 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务