遇见数据集

TSH sEEG Dataset

收藏
github2026-07-11 更新2026-07-13 收录
官方服务:

资源简介:

这是一个大型立体脑电图(sEEG)数据集,包含19名参与者的2,882个电极接触点记录,这些参与者聆听了80分钟的中文有声读物《草房子》。该数据集提供语音材料的特征,包括声学指标、分割边界和词汇属性,并经过事件相关响应和多变量时间响应函数分析的验证。

This is a large stereoelectroencephalography (sEEG) dataset containing 2,882 electrode contact recordings from 19 participants, all of whom listened to an 80-minute Chinese audiobook entitled *The Grass House*. This dataset provides features of the accompanying speech materials, including acoustic metrics, segmentation boundaries, and lexical attributes, and has been validated via event-related response and multivariate temporal response function analyses.

创建时间:
2026-06-25
原始信息汇总

数据集概述

该数据集是一个大规模的立体脑电图(sEEG)数据集,旨在研究自然中文(普通话)语言理解。

参与者与规模

  • 包含 19名参与者 的脑电记录。
  • 数据采集自 2,882个电极触点

实验范式

  • 参与者在实验过程中收听一段 80分钟 的普通话有声读物《草房子》。

数据内容

数据集遵循 iEEG-BIDS 兼容结构组织,主要包含:

  • 原始数据

    • 受试者级别的原始sEEG记录和脑解剖影像(sub-XX/ 文件夹)。
    • 电极触点坐标及在原生/世界坐标空间中的解剖标签(coords/ 文件夹)。
  • 刺激特征 提供了三类言语材料特征:

    1. 声学指标:宽带包络、包络峰值、率峰值和梅尔频谱图。
    2. 分割边界:音素、汉字和句子的起始与结束时间。
    3. 词汇属性:汉字频率,以及来自GPT-2的惊奇度、熵和上下文汉字嵌入。 此外,还提供由HanLP生成的句法标注,包括短语边界、词性标签、依存句法树和成分句法树。
  • 神经信号衍生物

    • 预处理后的宽带和高伽马神经信号(位于 derivatives/sEEGprep/)。
    • 提取其他频段信号的代码(位于 code/preprocess/4_preprocess.py)。
  • 验证与分析

    • 通过事件相关电位和多元时间响应函数分析进行数据验证。
    • 包含预处理、刺激生成、事件相关电位分析和时间响应函数拟合的详细教程(Tutorial/ 文件夹)。
  • 代码与重现

    • 提供用于预处理、刺激生成和验证分析的代码(code/ 文件夹)。
    • 提供了重现论文中图1、图3和图5的具体命令。

环境配置

项目提供了两个虚拟环境配置文件,用于支持不同的分析任务:

  • TSH-base:支持教程、预处理、刺激特征生成、事件相关电位/时间响应函数分析及大多数验证脚本。
  • TSH-mlab-vis:支持基于Mayavi的3D大脑表面渲染。

数据下载

大规模的原始记录、解剖图像、音频文件、刺激衍生物和神经衍生物将通过官方数据发布渠道提供(引用位置待定)。

搜集汇总
数据集介绍
TSH sEEG Dataset 数据集图片
构建方式
该数据集采集了19名参与者在聆听80分钟中文有声小说《草房子》时的立体脑电图(sEEG)记录,共计2882个电极触点。数据按照iEEG-BIDS标准格式组织,包含原始记录、解剖影像、电极坐标与解剖标签、语音材料的多维声学与语言特征(如包络、音素边界、词汇频率及GPT-2生成的语境嵌入),以及预处理后的宽带与高伽马神经信号和ERP/TRF验证结果。配套提供了完整的预处理、特征生成与验证分析教程脚本。
特点
数据集以自然中文长篇语音刺激为特色,首次在sEEG层面系统融合了声学、音系、词汇与句法(短语边界、词性、依存与成分树)多层语言特征,并包含GPT-2深层语境嵌入。电极覆盖广泛,空间标注精确,信号预处理流程透明。通过事件相关电位与多元时间响应函数验证了神经编码的可靠性,为探究自然语言理解中听觉与语言层级加工机制提供了高时空分辨率的基准资源。
使用方法
用户可通过GitHub仓库下载完整数据,首先依据提供的base_environment.yml与mlab_vis_environment.yml文件创建Conda虚拟环境(TSH-base与TSH-mlab-vis)。教程目录下包含NeuroPython示例,用于原始数据预处理、语音特征提取、ERP分析与TRF模型拟合。若要复现论文图表,可直接运行code/technical_validation/下的对应Python脚本(如Fig1、Fig3、Fig5相关脚本),其中3D脑渲染需在带图形界面的环境中执行。
背景与挑战
背景概述
自然语言理解是认知神经科学的核心议题,而汉语作为一种声调语言,其神经编码机制尤为复杂。TSH sEEG Dataset由科研团队于近年创建,基于19名受试者、共计2882个立体脑电图电极触点,记录其在聆听时长80分钟的中文有声小说《草房子》时的颅内神经活动。该数据集不仅提供了原始电生理记录与解剖影像,还整合了声学特征、分割边界与词汇属性等多层级言语特征,并验证了事件相关电位与多元时间响应函数的可靠性。作为首个大规模汉语自然言语理解基准数据集,它填补了自然情境下汉语神经语言学研究的空白,为探究语音、词汇与句法层面的脑机制提供了重要资源,显著推动了语言认知计算模型的发展。
当前挑战
该数据集面临的挑战集中于两方面。其一,在领域研究层面,自然言语理解需解析语音流在连续语境中的分层编码机制,而汉语的声调与音节边界模糊性进一步增加了难度,使得从神经信号中精确映射声学到语义的转化过程成为核心难题。其二,在数据构建过程中,需应对高密度颅内记录带来的噪声与伪迹去除问题,同时确保多模态数据的时空对齐精度;此外,长达80分钟的自然刺激材料需同步提取声学、音系、词汇及句法特征,计算复杂度极高,且受试者间的个体解剖差异对电极坐标标准化构成显著挑战,这些均要求复杂的预处理与验证流程以保障数据质量。
常用场景
经典使用场景
该数据集为自然情境下中文言语理解的神经编码研究提供了独特的基准资源。通过同步采集19名受试者共计2,882个电极触点的立体脑电图数据,结合80分钟中文有声小说《草房子》的听觉刺激,研究者可探究大脑皮层对连续语音流的多层级响应机制。经典使用场景包括利用事件相关电位分析语音分割边界引发的神经反应,以及采用时间响应函数建模声学特征、词汇属性与神经活动的时域耦合关系。
解决学术问题
该数据集系统解决了自然言语加工领域长期存在的两大核心难题:一是缺乏涵盖声学、音系、词汇及句法等多维度特征的同步神经大数据;二是难以在生态效度较高的长篇连续语音情境下分离不同语言层级的神经表征。该数据集通过提供精细的刺激特征(如GPT-2词嵌入、音节边界、依存句法树)与预处理后的宽带及高伽马神经信号,使研究者得以深入剖析从底层声学特征到高层语义预测的层级化神经计算机制,推动了言语神经科学从孤立音素研究向自然故事理解的范式跃迁。
衍生相关工作
围绕该数据集已衍生出一系列经典方法论与理论工作。数据发布方提供了完整的预处理与验证流水线,包括基于iEEG-BIDS标准的数据组织格式、ERP与TRF分析的标准化教程,以及采用HanLP生成精细化句法注释的工具链。在验证分析中,研究者通过全脑尺度的单句高伽马响应可视化揭示了语音感知的时间动力学,并采用空间分布的TRF峰值坐标图量化了不同语言层级(如声学包络、词频、语境预期)在皮层上的偏侧化与层级化拓扑。这些衍生工作不仅为神经解码研究提供了可复现的基线模型代码(见code/目录下的Python脚本),还促进了颅内电生理数据与计算语言学模型的交叉融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务