遇见数据集

brain-lm-alignment-ds006239

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集(ds006239)来自Wang等人2025年的研究,旨在探究10-17岁儿童和青少年在词级语音和语义阅读任务中的脑活动与语言模型表征之间的对齐。数据通过全脑fMRI采集,包含16个任务×session单元(任务:Orth、Phon、Sem、SemLocal;session:ses-11+和ses-11),每个单元基于共享刺激构建表征相异性矩阵(RDM),voxel模式在运行内进行z-score标准化,并计算了受试者间噪声天花板。每个单元的刺激数量为48至96个,受试者数量为3人。模型网格包含15个家族(如pico-decoder、pythia、babylm-gpt2等),共4192个对齐行,覆盖8个单元。对齐结果以原始值和噪声天花板分数形式呈现,并通过等效性检验评估。需要注意的是,该数据集的控制检查失败(0/38个刺激测试显著),因此对齐数字不可解释,仅作为完整性参考。数据集包含LocalSem单元,这是唯一一个刺激和运行真正交叉的单元,但受试者年龄无法从发布数据中恢复。文件包括alignment_by_checkpoint.csv、alignment_by_family.csv、control/目录等。

This dataset (ds006239) comes from a 2025 study by Wang et al., aiming to investigate the alignment between brain activity and language model representations in 10-17 year old children and adolescents during word-level phonological and semantic reading tasks. Data were collected via whole-brain fMRI, comprising 16 task×session units (tasks: Orth, Phon, Sem, SemLocal; sessions: ses-11+ and ses-11). Each unit constructs a representational dissimilarity matrix (RDM) based on shared stimuli, with voxel patterns z-scored within runs and inter-subject noise ceilings computed. Stimulus counts per unit range from 48 to 96, with 3 subjects. The model grid includes 15 families (e.g., pico-decoder, pythia, babylm-gpt2) totaling 4,192 alignment rows covering 8 units. Alignment results are presented as raw values and noise-ceiling scores, evaluated via equivalence tests. Note that the datasets control check failed (0/38 stimulus tests significant), so alignment numbers are not interpretable and are provided for completeness only. The dataset includes a LocalSem unit, the only unit with true stimulus-run crossing, but subject age cannot be recovered from the published data. Files include alignment_by_checkpoint.csv, alignment_by_family.csv, control/ directory, etc.

创建时间:
2026-08-28
原始信息汇总

数据集总结:BrainAlign/brain-lm-alignment-ds006239

一、数据集概述

该数据集为全脑语言-模型对齐分析数据集,基于Wang等人于2025年发布的词级音位和语义阅读任务数据,研究对象为10-17岁儿童及青少年。原始实验数据来自OpenNeuro数据集ds006239(版本1.0.5),生成日期为2026年9月7日。

二、数据来源与背景

  • 论文来源:ScienceDirect上的Data in Brief文章。
  • 实验数据:OpenNeuro的ds006239版本1.0.5。
  • 分析流程:具体实现代码见GitHub仓库。
  • 任务类型:包含正字法(Orth)、音位(Phon)、语义(Sem)和局部语义(SemLocal)四种任务。
  • 会话结构:包括早期会话(ses-11)和扩展会话(ses-11+),不同任务和会话条件组合共产生40个实验单元。

三、质量控制与警告

该数据集包含一个关键的门控验证,用于检查大脑RDM(表征相异性矩阵)是否能被任何刺激驱动的控制项(如刺激时长、词频、音素数、声学模型等)显著解释。验证结果如下:

  • 门控状态:失败 — 在Holm校正后,38个刺激测试中0个达到显著水平。
  • 意义说明:大脑RDM的有效秩为57(刺激总数为84),表明RDM确实包含刺激结构,但控制测试未达到显著,因此对齐数值不能作为语言模型与发育大脑对齐的证据,仅作为完整性参考。
  • 对比说明:这与ds003604数据集的失败模式不同——后者RDM有效秩极低(~3/40-48),而本数据集RDM仍具有较高有效秩,因此失败源于具体控制测试不显著,而非测量不可解释。

四、数据构建方法与主要内容

  • 分析单元:共40个任务×会话单元,每个单元生成一个RDM,基于该单元受试者共享的刺激,体素模式在每次运行内进行z-score标准化。
  • 噪声上限:报告了各单元的层间噪声上限(ceiling_lower和ceiling_upper),受试者数量为3-7人不等。
  • 模型与对齐结果
    • 模型网格:15个模型系列,共10480行对齐数据,覆盖8个单元(有效组合)。
    • 平均噪声上限:0.359。
    • 最佳对齐值:0.0913(占噪声上限的42.2%)。
    • 等价性检验:所有15个模型系列均与零效应等价(TOST ±0.05)。
    • 尺度趋势:Pythia模型规模与对齐效果相关性ρ = -0.190,p = 0.24(不显著)。
  • 各模型系列表现:按平均对齐值排序,pico-decoder-small获得最高平均RSA值(0.0047),但所有系列均未通过等价性检验。

五、数据集特有说明

  • 局部语义任务特色:该数据集包含LocalSem任务,是项目中唯一一个刺激与运行完全交叉的语言单元,可区分运行身份和刺激身份,避免了ds003604中的扫描运行混淆问题。
  • 年龄信息限制:参与者的出生日期存在但缺乏扫描日期,因此无法恢复个体年龄,数据集仅适用于组水平分析,无法承载发育轨迹研究。

六、数据文件清单

文件路径 内容 状态
alignment_by_checkpoint.csv 每个模型×检查点×单元的详细对齐值 存在
alignment_by_family.csv 按模型系列汇总对齐值及等价检验结果 存在
alignment_by_cell.csv 按任务×会话的对齐结果 存在
ceilings_ds006239.csv 每个单元的噪声上限 存在
control/ 正向控制和RDM维度信息(门控验证) 存在
scale_ladder.csv Pythia规模测试(70M→1.4B) 存在
fig_.pdf / fig_.png 结果图 存在

七、方法论简述

采用表征相似性分析(RSA)。每个单元构建大脑RDM(刺激间的相关距离,基于每次运行内z-score的GLM beta模式,跨受试者聚合),然后与模型RDM(从各检查点的隐藏状态提取)进行Spearman相关比较。对齐值以原始值和噪声上限分数形式报告,并使用PARC套件(18个仅随机种子不同的模型)作为空模型进行统计判断。刺激集排除无效和固定试验;配对设计中的刺激身份为词对而非单个词。

搜集汇总
数据集介绍
brain-lm-alignment-ds006239 数据集图片
构建方式
该数据集源自Wang等人2025年发表的一项关于10至17岁儿童与青少年词汇级音韵及语义阅读任务的脑成像研究,原始数据存储于OpenNeuro的ds006239中。构建流程聚焦于40个任务×会话单元,每个单元基于该单元被试共享的刺激生成表征不相似性矩阵(RDM),并对体素模式在运行内进行z标准化处理以避免扫描仪漂移的影响,随后跨被试聚合,并计算被试间噪声上限。针对每个单元,采用表征相似性分析(RSA),将基于GLMbeta模式的相关距离所得脑RDM,与来自15个模型家族共10480个检查点的隐藏状态所构建的模型RDM进行Spearman相关比较,对齐值以原始值及占噪声上限比例的形式呈现,同时排除无效及注视试验。
特点
该数据集的核心特征在于其包含LocalSem条件,这是该项目四个数据集中唯一真正实现运行与刺激交叉的语言单元,其刺激跨运行重复出现,使得运行身份与刺激身份可分离,从根本上避免了扫描仪运行混淆的影响。数据集的噪声上限均值为0.359,最佳对齐值为0.0913,占上限的42.2%。然而,严格的质量控制揭示了关键问题:在Holm校正后,38项刺激驱动控制测试无一显著,表明脑RDM并未可论证地编码刺激结构,因此所有对齐数值作为语言模型证据的解释力有限。此外,数据集中无法恢复个体被试年龄,因为发布数据中缺少扫描日期,限制了其仅能用于队列层面的分析。
使用方法
本数据集最适合用于方法论探索与基准测试,而非直接作为语言模型-大脑对齐的证据。使用者应首先查阅control目录下的正向控制与RDM维度评估结果,鉴于其控制失败,对齐数值应被视为对表征几何的测量,而非模型效能的结论。建议研究者可将此数据集作为测试平台,开发或改进针对发育期大脑的RSA估计器,或结合其他数据集(如ds003604)进行跨数据集的比较分析。所有对齐数据存于CSV文件(如alignment_by_checkpoint.csv),便于编程访问;相关生成管线代码可在GitHub上获取。使用时需注意,数据集仅支持队列层面的推断,不宜用于个体差异或发展轨迹的分析。
背景与挑战
背景概述
在认知神经科学与自然语言处理交叉领域,脑-语言模型对齐研究旨在揭示深层语言表征与大脑神经活动间的映射关系。2025年,Wang等人针对10至17岁儿童及青少年群体,设计词汇级语音与语义阅读任务,构建了brain-lm-alignment-ds006239数据集,源自OpenNeuro的ds006239,配套自动化处理流程。该数据集的核心研究问题在于,通过表征相似性分析(RSA)量化多种语言模型(如Pythia、BabyLM、pico-decoder等)的内部表征与全脑fMRI信号之间的对齐程度,并探索发育阶段对神经语言编码的影响。该数据集涵盖正字法(Orth)、语音(Phon)、语义(Sem)及局部语义(SemLocal)四种任务,跨多个会话与受试者,提供了丰富的行为与神经影像数据,为检验语言模型在发育大脑中的神经合理性提供了独特资源,对理解儿童语言加工的神经机制及模型评估方法论具有潜在贡献。
当前挑战
该数据集面临的核心挑战包括两方面。在领域问题层面,脑-语言模型对齐旨在揭示语言模型与大脑神经表征的对应关系,但当前数据集中的正对照检验未能通过:0/38的刺激驱动控制条件(如声学特征、实验对比)在基于置换检验的显著性校正后均不显著,提示脑RDM(表征相异矩阵)虽具有较高的有效秩(57/84),可能承载刺激结构,但未能被所选控制条件所解释,导致对齐结果难以作为语言模型神经合理性的证据。在构建过程中,数据集面临多重难题:脑RDM的计算需对voxel模式在run内进行z-score归一化以消除扫描漂移,并需跨受试者聚合以估计噪声上限,但部分单元(cell)的受试者数量有限(n=3至7),限制了统计功效;年龄信息因缺少扫描日期而无法从公开数据中恢复,仅能进行队列层面分析,无法探究发展轨迹;run与刺激的交叉设计仅存在于LocalSem任务中,其他任务可能存在run身份与刺激身份的混淆,影响测量的纯净性。此外,模型对齐结果与零模型(随机种子的PARC套件)相比,所有15个模型家族均未显示出显著优于随机的对齐,且规模趋势相关系数为负,提示当前模型或测量方法尚不足以捕获发育大脑的语言表征机制。
常用场景
经典使用场景
该数据集以10至17岁儿童与青少年为受试者,通过词级语音、语义及正字法阅读任务,构建了全脑表征相似性矩阵(RDM)。其核心应用场景在于运用表征相似性分析(RSA)范式,系统评估语言模型内部表征与发育中大脑神经活动之间的对齐程度。研究者能够借助该数据集,对多种规模与架构的语言模型(如Pythia、BabyLM等)进行逐层剖析,深入探究模型层次化表征与大脑语义、语音加工区域间的空间对应关系,为神经语言学与计算认知科学提供了实证桥梁。
实际应用
在实际应用层面,该数据集直接服务于儿童语言发展障碍的临床研究,可用于定位语音或语义加工环节的神经异常。基于其RDM对齐结果,研究人员能够筛查与成年大脑表征差异过大的语言模型,进而辅助设计针对青少年的神经反馈训练或个性化教育干预方案。同时,该数据集的质控流程(如刺激时长、词频对照)可作为神经影像社区的标准模板,引导数据发布环节严格评估脑-模型表征匹配的效应量,减少因扫描漂移或模型误标导致的信息污染,在脑机接口与教育技术融合领域具有前瞻价值。
衍生相关工作
该数据集未来可催生一系列前沿探索:一是基于其包含的LocalSem交叉设计(刺激跨run重复),衍生出更严格的脑-模型对齐因果推断方法;二是其公开的40个任务×会话RDM与全套质控数据,为开发自动化评估神经解码可靠性的算法库奠基;三是其揭示的‘多数模型等效于零效应’困境,将促使研究界构建更为敏感的基准,例如对比多尺度模型(从70M至1.4B)在噪声上限内的差异,进而评估扩展法则在脑对齐任务中的适用性;此外,该数据的不足之处还可反向推动采集含精确年龄信息的新一批公开数据集,深化发育神经语言学研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务