遇见数据集

brain-lm-alignment-ds002236

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集基于Lytle et al. 2020关于学龄儿童(8.7-15.5岁)正字法、语音和语义词汇加工的研究,采用听觉和视觉两种刺激模态。数据集构建了30个任务×session单元,每个单元生成一个表征相异矩阵(RDM),覆盖所有被试共享的刺激,体素模式在每个run内进行z-score标准化后聚合,并计算了被试间噪声上限。每个单元的刺激数量为72或96个。控制测试评估了刺激持续时间、强度、词长、频率、音素和音节数量、听觉刺激的声学模型以及实验本身的对比条件,但所有30个测试在Holm校正后均未达到显著性,表明这些RDM并未可证明地编码刺激,因此后续的模型对齐结果不可作为语言模型与大脑对齐的证据。数据集包含了15个模型家族(如pico-decoder、babylm-gpt2、pythia、beagle等)的共7260个对齐行,报告了每个家族的对齐均值、标准差、最大绝对值、占噪声上限的比例以及等效性检验(TOST ±0.05)结果。所有15个家族均被判定为等效于零。此外还提供了pythia尺度趋势(ρ = -0.221, p = 0.24)。RDM有效秩为84个刺激中的56。数据集文件包括对齐结果(按检查点、家族、单元)、噪声上限、控制测试结果、尺度梯度和图表。该数据集适用于研究表征相似性分析(RSA)方法,但注意其控制测试失败,因此不能用于评估语言模型与大脑发育的对齐程度。

This dataset is based on the study by Lytle et al. (2020) on orthographic, phonological, and semantic lexical processing in school-age children (8.7-15.5 years), using both auditory and visual stimulus modalities. The dataset consists of 30 task×session units, each generating a Representational Dissimilarity Matrix (RDM) covering stimuli shared across all subjects. Voxel patterns were z-score normalized within each run, aggregated, and the noise ceiling across subjects was computed. Each unit contains 72 or 96 stimuli. Control tests evaluated stimulus duration, intensity, word length, frequency, phoneme and syllable count, acoustic model of auditory stimuli, and contrast conditions of the experiment itself. However, all 30 tests were non-significant after Holm correction, indicating that these RDMs do not demonstrably encode stimuli, and thus subsequent model alignment results cannot be used as evidence of language model-brain alignment. The dataset includes 7260 alignment rows from 15 model families (e.g., pico-decoder, babylm-gpt2, pythia, beagle), reporting alignment mean, standard deviation, maximum absolute value, proportion of noise ceiling, and equivalence test (TOST ±0.05) results. All 15 families were judged equivalent to zero. Additionally, the pythia scaling trend (ρ = -0.221, p = 0.24) is provided. The effective rank of the RDM is 56 out of 84 stimuli. Dataset files include alignment results (by checkpoint, family, unit), noise ceiling, control test results, scaling gradients, and figures. This dataset is suitable for studying Representational Similarity Analysis (RSA) methods, but note that its control tests failed, so it cannot be used to evaluate alignment between language models and brain development.

创建时间:
2026-08-28
原始信息汇总

数据集概述:Brain–language-model alignment: ds002236

基本信息

  • 数据集名称: Brain–language-model alignment: ds002236 (whole-brain)
  • 来源研究: Lytle et al. 2020 — 学龄儿童(8.7–15.5岁)的正字法、音韵和语义词汇处理,包含听觉和视觉两种模态。
  • 论文: https://pubmed.ncbi.nlm.nih.gov/31956678/
  • 原始数据: https://openneuro.org/datasets/ds002236/versions/1.0.1
  • 生成日期: 2026-09-07
  • 处理流程: https://github.com/suchirsalhan/cdl-representations-brains-babylms

质量控制警告(GATE: FAILED)

  • 结论: 30项刺激测试中0项显著(经Holm校正),包括对儿童实际听到的音频声学模型以及研究自身的实验对比均未达到显著水平。
  • 含义: 该数据集的对齐数值不能作为语言模型证据来解释,因为所测量的表征几何结构未能明确编码刺激。数据集仅供参考或用于改进评估方法,不应引用为模型与发育中大脑对齐失败的证据
  • RDM有效秩: 84个刺激中有61个,说明RDM确实携带刺激结构,控制失败是由于特定控制未达到显著性,而非测量本身完全不可解释。

数据构建

  • 结构: 54个任务×会话单元,每个单元基于共享刺激构建RDM(表征相异性矩阵)。
  • 预处理: 体素模式在运行内进行z-score标准化(避免测量扫描漂移),并计算被试间噪声上限。
  • 任务类型: 两个任务(Phon 音韵任务、Sem 语义任务),多个会话组合(ses-9、ses-11、ses-11+——组合会话)。
  • 刺激数量: 音韵任务96个、语义任务72个。
  • 排除项: 三分之一的试验为无效编码(Tones/nullsilence.WAV),已从刺激集中排除;配对设计中刺激身份为配对整体而非单个词汇。

模型评估结果

总体统计

  • 平均噪声上限: 0.247
  • 最佳对齐值: 0.1066(约为噪声上限的80.4%)
  • 等价于零的模型家族: 15/15(所有模型家族均无法与零区分,TOST ±0.05)
  • Pythia规模趋势: ρ = +0.202, p = 0.29(不显著)

模型家族性能(共15个家族,覆盖14094行对齐数据)

家族 检查点数量 平均RSA 标准差 绝对最大对齐
pico-decoder-medium 21 0.0222 0.0237 0.1066
pythia-1b-full 21 0.0215 0.0157 0.0816
babylm-gpt2 9 0.0190 0.0252 0.0501
pico-decoder-large 20 0.0189 0.0210 0.0804
babylm-gpt2-7 9 0.0166 0.0266 0.0581
pythia-1.4b-full 21 0.0165 0.0189 0.0999
babylm-gpt2-3 9 0.0165 0.0259 0.0582
pico-decoder-small 21 0.0161 0.0166 0.0978
pythia-410m-full 21 0.0151 0.0118 0.0729
babylm-gpt2-5 9 0.0131 0.0259 0.0477
pythia-160m-full 21 0.0122 0.0114 0.0771
pythia-70m-full 21 0.0121 0.0140 0.0808
pico-decoder-tiny 21 0.0119 0.0137 0.0799
beetle-humanscale-eng 18 0.0091 0.0050 0.0727
beetle-fineweb3-eng 19 0.0001 0.0031 0.0420

数据集特色

  • 被试年龄: 数据集文章未明确标注编号,通过匹配OpenNeuro数据集名称("Cross-Sectional Multidomain Lexical Processing")和参与者年龄范围(8.67–15.5)解析为ds002236。
  • 发展轴优势: 四个数据集中最佳——有明确的每次扫描被试年龄,是连续性而非分箱数据。
  • 任务设计: 6个任务跨越模态(听觉/视觉)与判断类型(押韵/拼写/语义),提供了其他数据集所缺乏的模态控制。

包含文件

  • alignment_by_checkpoint.csv: 每个模型×检查点×单元的对齐值及噪声上限
  • alignment_by_family.csv: 每个模型家族的对齐值及等价性检验
  • alignment_by_cell.csv: 每个任务×会话的对齐值
  • ceilings_ds002236.csv: 每个单元的噪声上限
  • control/: 阳性控制及RDM维度分析(即"门控"部分)
  • scale_ladder.csv: Pythia 70M→1.4B规模测试
  • fig_*.pdf, fig_*.png: 图表文件

方法

采用表征相似性分析(RSA):对每个单元,构建大脑RDM(基于每刺激GLM beta模式间的相关距离,运行内z-score,跨被试聚合),通过Spearman相关与同一刺激集上每个检查点隐藏状态计算的模型RDM进行比较。对齐值以原始值及占被试间噪声上限的比例报告,并通过PARC套件(18个仅随机种子不同的模型)构建的零分布来判断显著性。

搜集汇总
数据集介绍
brain-lm-alignment-ds002236 数据集图片
构建方式
本数据集源自Lytle等人2020年针对学龄儿童(8.7至15.5岁)在听觉与视觉模态下进行的正字法、语音及语义词汇处理研究,其数据存储于OpenNeuro平台(编号ds002236)。数据集构建的核心理念在于采用表征相似性分析(RSA)框架,在54个任务×会话单元内,将共享刺激的体素激活模式经运行内z-score标准化后聚合生成脑表征差异性矩阵(RDM),并与来自15个语言模型家族、共计14094个检查点的隐藏层表征RDM进行Spearman相关比较。该构建流程严格排除无效试验与配对设计中的单个词语,确保每个RDM能有效承载刺激结构信息,同时提供被试间噪声上限作为评估对齐质量的基准。
特点
该数据集最显著的特点在于其对发展性大脑与语言模型对齐关系的精细刻画,提供了跨年龄连续维度(而非离散分组)的显式扫描年龄信息。其涵盖六种任务,巧妙交叉了听觉/视觉模态与押韵、拼写、语义判断,构成了其他数据集难以比拟的模态控制条件。然而,数据集中一道至关重要的质量控制门禁却未能通过:对刺激持续时间、强度、词频等30项物理与语言学控制特征的排列检验均未达到显著性,这意味着依据该数据得出的对齐数值无法作为语言模型与发育中大脑对齐的证据,仅可视为对表征几何的探索性记录,供方法论修正与后续研究参考。
使用方法
使用该数据集时,研究者应首先审阅'control'目录下的质量控制结果,并认识到当前对齐数值在门禁失败条件下不具备证据效力。若需利用其结构进行方法学探索或管道修复,可加载核心的alignment_by_checkpoint.csv、alignment_by_family.csv等文件,按任务与会话维度访问每个细胞的对齐分数与噪声天花板。模型比较可依据模型家族、检查点规模以及Pythia系列从70M到1.4B的尺度趋势进行分析。值得注意的是,数据集清晰地区分了原始对齐值与相对于噪声上限的比例,并附有基于PARC套件构建的零分布,便于用户执行等价性检验或自定义显著性评估。
背景与挑战
背景概述
该数据集源于Lytle等人于2020年发表的一项儿童语言处理研究,聚焦于8.7至15.5岁学龄儿童在听觉与视觉模态下对正字法、语音及语义信息的加工。研究团队通过OpenNeuro平台公开了原始神经影像数据,并在此基础上,由后续研究者构建了大脑-语言模型对齐数据集,旨在揭示儿童大脑表征与深度语言模型内部表示之间的对应关系。作为跨学科融合的产物,该数据集为认知神经科学与自然语言处理领域提供了独特的交叉验证资源,其构建过程遵循严格的表征相似性分析框架,并包含了跨任务、跨会话的噪声上限估计。尽管当前版本在质量控制上存在显著问题,但其发布本身反映了开放科学实践下对神经数据可复用性的追求。
当前挑战
首要挑战在于验证脑部表征的有效性。该数据集的控制测试全部未通过,意味着刺激驱动的脑活动模式未被成功捕捉,使得基于这些数据的对齐结果无法作为语言模型与发育大脑对齐的证据。其次,构建过程中面临多模态刺激整合的困难,包括声音与视觉刺激的平衡、个体差异的处理,以及任务设计的复杂性——六种任务跨越模态与判断维度,增加了数据同质性的风险。此外,数据缺失问题严重,诸多会话的噪声上限缺失或仅有少量被试,降低了统计功效。最后,模型评估面临的挑战在于,所有15个模型家族均与噪声上限等效于零,暗示现有模型无法捕捉儿童语言加工的动态特征,这一负结果可能源于测量方法的不完善或理论上对发育期神经表征的动态性理解不足。
常用场景
经典使用场景
该数据集源自Lytle等人于2020年开展的儿童词汇加工脑成像研究,覆盖8.7至15.5岁学龄儿童,涵盖语音、拼写与语义判断任务,并横跨听觉与视觉两种刺激模态。其经典使用场景在于借助表征相似性分析(RSA)框架,构建大脑体素活动模式间的表征距离矩阵(RDM),进而与各类语言模型(如Pythia、GPT-2变体等)内部隐藏状态衍生的模型RDM进行对齐比较,以探究神经表征与计算模型表征之间的几何同构性。该流程尤为关注刺激身份的置换检验与噪声上限校正,确保对齐度量的统计效力,成为神经语言学研究方法论的典型范例。
衍生相关工作
该数据集的衍生工作主要沿双重路径展开。其一,催生了关于“发展轴”的系列探讨,即以年龄连续变量为预测因子,追踪语言模型表征与儿童脑区活动之间对齐度随年龄增长的动态轨迹,与BabyLM等预训练模型的研究形成互补。其二,推动了RSA方法在感觉模态对照情境下的改进,并激励后续工作融合多数据集(如ds003604)以系统剖析RDM估计退化问题。此外,PARC套件中随机种子模型作为零分布基准的思想,也被吸纳为评估模型-大脑对齐显著性的常用工具,促进了在更广泛语料库和架构变化中对神经一致性假设的精细化检验。
数据集最近研究
最新研究方向
在神经语言表征对齐研究中,本数据集聚焦于学龄儿童(8.7至15.5岁)在听觉与视觉模态下处理正字法、语音及语义信息时的大脑活动,并创新性地采用表征相似性分析框架,评估语言模型内部表征与发育中大脑的对应关系。然而,质量控制揭示关键发现:所有30项刺激驱动检验均未达到显著性,表明当前脑区表征几何未能稳定编码刺激特征,虽然RDM有效秩高达61,暗示其具备结构承载能力,但控制条件的失败凸显了测量估计器可能存在的系统性偏差。此结果不仅警示了模型-大脑对齐结论的有效性,也指明了后续研究方向——亟需开发更精准的神经解码算法与实验范式,以在儿童群体中建立可靠的语言加工神经指标,进而为神经发育的认知模型提供坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务