遇见数据集

brain-lm-alignment-ds001894

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集基于Lytle等人2019年的研究,旨在分析儿童在单词级语音处理过程中的脑-语言模型对齐。研究包含10岁和12岁左右两次扫描的纵向数据。数据集的核心是使用表征相似性分析(RSA),将脑表征差异矩阵(RDM)与语言模型隐藏状态导出的RDM进行对比。然而,重要警告:控制测试(GATE)结果显示所有16个刺激驱动测试均未达到显著性(Holm校正后),因此数据集中的对齐数值无法作为语言模型与大脑对齐的证据,发布仅用于完整性及后续方法改进。数据包含12个任务×会话单元(任务:Phon和Orth;会话:ses-7, ses-9, ses-11, ses-11+),每个单元有96个刺激,并计算了噪声上限。模型网格涵盖15个家族(如Pythia系列、pico-decoder、beetle、babylm-gpt2等),共2096行对齐记录。每个家族包含多个检查点,对齐值以原始RSA和相关分数形式提供。数据集还提供了控制测试、RDM维度分析、噪声上限等文件。适用任务包括脑-语言模型对齐研究、表征相似性分析、纵向发展神经科学。

This dataset is based on the 2019 study by Lytle et al., aiming to analyze brain-language model alignment in children during word-level speech processing. The study includes longitudinal data with two scans around ages 10 and 12. The core of the dataset uses representational similarity analysis (RSA) to compare brain representational dissimilarity matrices (RDMs) with those derived from language model hidden states. However, important warning: control tests (GATE) showed that all 16 stimulus-driven tests were not significant (Holm-corrected), so the alignment values in the dataset cannot be considered evidence of language model alignment with the brain. The dataset is released only for completeness and future methodological improvements. The data includes 12 task × session units (tasks: Phon and Orth; sessions: ses-7, ses-9, ses-11, ses-11+), each with 96 stimuli, and noise ceilings are computed. The model grid covers 15 families (e.g., Pythia series, pico-decoder, beetle, babylm-gpt2, etc.), with a total of 2096 alignment records. Each family includes multiple checkpoints, and alignment values are provided as raw RSA and correlation scores. The dataset also provides control tests, RDM dimension analysis, noise ceiling files, etc. Applicable tasks include brain-language model alignment research, representational similarity analysis, longitudinal developmental neuroscience.

创建时间:
2026-09-07
原始信息汇总

数据集概述:Brain–language-model alignment: ds001894

基本信息

  • 数据集名称: Brain–language-model alignment: ds001894 (whole-brain)
  • 来源研究: Lytle et al. 2019 — 儿童词汇级语音处理的纵向研究,对同一批儿童在约10岁和12岁时进行了两次扫描
  • 论文: 发表于 Nature Scientific Data(https://www.nature.com/articles/s41597-019-0338-5)
  • 原始数据: OpenNeuro 数据集 ds001894 版本 1.4.2
  • 生成日期: 2026-09-07
  • 处理管线: GitHub 仓库 suchirsalhan/cdl-representations-brains-babylms

重要警告:质量控制失败

数据质量门控(GATE)状态:FAILED

  • 20个刺激物相关测试中,0个达到统计显著性(经 Holm 校正后)
  • 包括声学模型(针对儿童实际听到的音频)以及研究自身的实验对比均未通过
  • RDM 有效秩为 96个刺激物中的67个,说明表征差异矩阵携带刺激结构,非近退化矩阵
  • 因此,该数据集的对齐数值不能作为语言模型与发育中大脑对齐的证据,仅供完整性发布或供改进估计方法的研究者参考

数据构建内容

  • 共构建 37个任务×会话单元,每个单元基于该单元受试者共享的刺激物构建表征差异矩阵(RDM)
  • 体素模式在运行内进行z-score标准化后聚合,以避免测量扫描漂移而非语言信号
  • 包含受试者间噪声上限估计

任务与会话结构

  • 任务类型: Orth(正字法)和 Phon(语音学)
  • 会话: ses-7, ses-9, ses-11, ses-11+(部分单元缺失数据,如 ses-7 无噪声上限数据)
  • 刺激物数量: 每单元96个
  • 噪声上限范围: 下限 0.117–0.348,上限 0.481–0.614,受试者数 3–11

模型评估结果

总体概况

  • 模型族数量:15个,共 6550 行对齐数据
  • 平均噪声上限:0.192
  • 最佳对齐值:0.0534(占噪声上限的 40.4%)
  • 全部15个模型族均与零等效(TOST ±0.05 检验)
  • Pythia 规模趋势:ρ = +0.282,p = 0.17(不显著)

各模型族表现

模型族 检查点数量 RSA均值 RSA标准差 等效性检验p值
pythia-160m-full 21 0.0120 0.0057 0.0001
pythia-1b-full 21 0.0116 0.0030 0
pico-decoder-tiny 21 0.0105 0.0032 0
pythia-1.4b-full 21 0.0068 0.0023 0
pico-decoder-large 21 0.0017 0.0072 0.0001
beetle-humanscale-eng 18 0.0007 0.0053 0
pythia-70m-full 21 0.0006 0.0034 0
pico-decoder-small 21 0.0004 0.0052 0
pico-decoder-medium 21 0.0004 0.0043 0
beetle-fineweb3-eng 19 0.0002 0.0015 0
pythia-410m-full 21 -0.0019 0.0048 0
babylm-gpt2 9 -0.0069 0.0098 0.0003
babylm-gpt2-5 9 -0.0201 0.0038 0
babylm-gpt2-3 9 -0.0212 0.0025 0
babylm-gpt2-7 9 -0.0215 0.0030 0

数据集特殊说明

  • 这是唯一的纵向数据集:同一批儿童在两个时间点(ses-T1, ses-T2)被扫描,是语言模型检查点轨迹最接近的真实类比
  • 每个受试者的扫描年龄数据可用
  • 试验类型交叉设计正字法与语音学相似性(O+P+/O+P-/O-P+/O-P-),使 Phon 和 Orth 对比在设计上不相关
  • ses-T2 仅包含 VV 任务

数据文件结构

文件路径 内容
alignment_by_checkpoint.csv 每个模型×检查点×单元的对齐结果(含噪声上限)
alignment_by_family.csv 每个模型族的结果(含等效性检验)
alignment_by_cell.csv 每个任务×会话的结果
ceilings_ds001894.csv 每单元的噪声上限
control/ 阳性对照与RDM维度分析(质量门控)
scale_ladder.csv Pythia 70M→1.4B 规模测试
fig_*.pdf, fig_*.png 图表文件

方法说明

  • 采用**表征相似性分析(RSA)**方法
  • 每个单元构建基于刺激的大脑 RDM(GLM beta模式的相关系数距离,运行内z-score,跨受试者聚合)
  • 通过 Spearman 相关与模型 RDM 比较(模型 RDM 来自各检查点的隐藏状态)
  • 对齐结果以原始值和噪声上限百分比两种形式报告
  • 使用 PARC 套件(18个仅随机种子不同的模型)构建零假设分布
  • 刺激集排除了零试验和注视试验;配对设计中刺激身份为配对本身而非单个词
搜集汇总
数据集介绍
brain-lm-alignment-ds001894 数据集图片
构建方式
该数据集源自Lytle等人2019年的纵向研究,针对儿童在约10岁和12岁两个时间点的词语级语音处理进行了全脑功能性磁共振成像扫描。构建流程首先对每个任务和会话单元的体素模式在运行内进行z-score标准化,以消除扫描漂移影响,随后基于刺激间GLM beta模式的相关距离计算表征相似性矩阵(RDM),并跨受试者聚合,最终形成涵盖37个任务×会话单元的全脑RDM。每个RDM均伴有受试者间噪声上限的估计,为后续语言模型对齐分析提供了结构化的神经表征度量基础。
特点
此数据集的独特之处在于其纵向设计,同一批儿童在两个时间点被扫描,成为语言模型检查点轨迹的真实类比,且每个受试者的扫描年龄信息可用。实验设计通过交叉操纵正字法与语音相似性(O+P+/O+P-/O-P+/O-P-),使得语音和正字法对比在刺激层面不相关。然而,质量控制门控显示,20项刺激驱动控制检验均未达到显著性,表明这些RDM未能可验证地编码刺激特征,虽然有效秩为67/96说明其携带刺激结构,但当前对齐数值作为模型证据的解读受限,仅用于完整性和方法改进参考。
使用方法
数据集以CSV文件形式提供了每个模型、检查点、单元的对齐结果,涵盖15个模型家族、6550个对齐行,并附有等效性检验、噪声上限及尺度梯度测试。使用者可通过读取alignment_by_checkpoint.csv等文件获取原始对齐分数及其占噪声上限的比例,进而评估各语言模型家族(如Pythia、BabyLM GPT-2变体)在不同任务条件中的表征对齐程度。需注意,由于控制检验未通过,任何模型对齐结果不应被引用为模型与发育大脑对齐的证据,而应仅作为估计器修复后的参考数据。代码管道可从指定GitHub仓库获取,便于复现或改进分析流程。
背景与挑战
背景概述
该数据集由Lytle等人于2019年创建,聚焦于儿童在约10岁和12岁两个时间点进行的纵向词汇级语音处理研究,数据源自OpenNeuro的ds001894数据集。核心研究问题在于探究儿童大脑发育过程中语言处理神经表征的纵向变化,及其与语言模型内部表征的对齐程度。该数据集由计算神经科学与自然语言处理交叉领域的研究人员构建,旨在为脑-语言模型对齐研究提供唯一的纵向儿童数据资源。其影响力体现在为理解语言发展神经机制及评估语言模型的神经合理性提供了基准,但当前版本经质量控制管线检测,发现其脑表征与刺激驱动的控制条件未达显著相关,故需谨慎使用。
当前挑战
该数据集面临多重挑战。首先,在领域层面,如何从儿童发育中的大脑信号中提取可靠的语言相关神经表征是一大难题,尤其需区分语言处理与扫视伪迹等干扰。其次,构建过程面临严格控制难题:尽管RDM有效秩较高,表明脑表征包含刺激信息,但20项刺激驱动控制均未显著,涵盖声学模型及实验对比,暗示测量或受无关变异主导,导致对齐数值无法作为语言模型证据。此外,纵向设计引入年龄、任务复杂度及被试流失等变异,跨会话噪声天花板仅为0.192,进一步限制了对齐效应的可检测性,亟需改进估计器以解决控制检验失败问题。
常用场景
经典使用场景
该数据集的核心经典使用场景在于探究儿童语言发展过程中大脑表征与语言模型内部表征之间的对齐关系。依托Lytle等人(2019)纵向追踪的儿童词汇加工功能性磁共振成像数据,研究者在同一批儿童约10岁与12岁两个时间点采集全脑活动,构建基于表征相似性分析(RSA)的脑区表征差异矩阵(RDM),进而与多种语言模型的隐层表征进行系统比较。这一范式使得从神经科学视角审视语言模型的计算机制成为可能,尤其关注发展性变化如何映射于模型的不同训练阶段或架构尺度。
实际应用
在实际应用中,该数据集可作为评估语言模型神经合理性(neural plausibility)的基准测试平台。它可系统地检验不同规模、训练语料及架构的语言模型在模拟儿童词汇加工脑活动上的表现,其输出的对齐分数与等效性检验结果可用于筛选更接近人脑表征机制的模型构件。此外,该数据集独特的纵向设计使研究人员能够探索模型训练轨迹与儿童发育阶段之间的潜在同构性,从而为认知发展计算模型的构建提供实证约束,推动类脑人工智能的研发。
衍生相关工作
此数据集及其配套的自动化流程已催生一系列先驱性工作。其开发了从原始OpenNeuro数据到逐检查点对齐结果的完整处理管线,为脑-语言模型对齐研究提供了可复用的技术基础。后续研究可在此基础上,引入更丰富的刺激特征模型、优化脑表征估计方法或拓展至其他语言家族,以探明跨语言和跨文化的普适性脑-模型对齐规律。尤其值得注意的是,其公开的阴性结果(如所有模型族等效于零)可刺激方法论创新,启发改进的正向控制及更敏感的统计检验,从而推动该领域走向更为严谨的科学实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务