brain-lm-alignment-ds006239
收藏资源简介:
该数据集(ds006239)来自Wang等人2025年的研究,旨在探究10-17岁儿童和青少年在词级语音和语义阅读任务中的脑活动与语言模型表征之间的对齐。数据通过全脑fMRI采集,包含16个任务×session单元(任务:Orth、Phon、Sem、SemLocal;session:ses-11+和ses-11),每个单元基于共享刺激构建表征相异性矩阵(RDM),voxel模式在运行内进行z-score标准化,并计算了受试者间噪声天花板。每个单元的刺激数量为48至96个,受试者数量为3人。模型网格包含15个家族(如pico-decoder、pythia、babylm-gpt2等),共4192个对齐行,覆盖8个单元。对齐结果以原始值和噪声天花板分数形式呈现,并通过等效性检验评估。需要注意的是,该数据集的控制检查失败(0/38个刺激测试显著),因此对齐数字不可解释,仅作为完整性参考。数据集包含LocalSem单元,这是唯一一个刺激和运行真正交叉的单元,但受试者年龄无法从发布数据中恢复。文件包括alignment_by_checkpoint.csv、alignment_by_family.csv、control/目录等。
This dataset (ds006239) comes from a 2025 study by Wang et al., aiming to investigate the alignment between brain activity and language model representations in 10-17 year old children and adolescents during word-level phonological and semantic reading tasks. Data were collected via whole-brain fMRI, comprising 16 task×session units (tasks: Orth, Phon, Sem, SemLocal; sessions: ses-11+ and ses-11). Each unit constructs a representational dissimilarity matrix (RDM) based on shared stimuli, with voxel patterns z-scored within runs and inter-subject noise ceilings computed. Stimulus counts per unit range from 48 to 96, with 3 subjects. The model grid includes 15 families (e.g., pico-decoder, pythia, babylm-gpt2) totaling 4,192 alignment rows covering 8 units. Alignment results are presented as raw values and noise-ceiling scores, evaluated via equivalence tests. Note that the datasets control check failed (0/38 stimulus tests significant), so alignment numbers are not interpretable and are provided for completeness only. The dataset includes a LocalSem unit, the only unit with true stimulus-run crossing, but subject age cannot be recovered from the published data. Files include alignment_by_checkpoint.csv, alignment_by_family.csv, control/ directory, etc.
数据集总结:BrainAlign/brain-lm-alignment-ds006239
一、数据集概述
该数据集为全脑语言-模型对齐分析数据集,基于Wang等人于2025年发布的词级音位和语义阅读任务数据,研究对象为10-17岁儿童及青少年。原始实验数据来自OpenNeuro数据集ds006239(版本1.0.5),生成日期为2026年9月7日。
二、数据来源与背景
- 论文来源:ScienceDirect上的Data in Brief文章。
- 实验数据:OpenNeuro的ds006239版本1.0.5。
- 分析流程:具体实现代码见GitHub仓库。
- 任务类型:包含正字法(Orth)、音位(Phon)、语义(Sem)和局部语义(SemLocal)四种任务。
- 会话结构:包括早期会话(ses-11)和扩展会话(ses-11+),不同任务和会话条件组合共产生40个实验单元。
三、质量控制与警告
该数据集包含一个关键的门控验证,用于检查大脑RDM(表征相异性矩阵)是否能被任何刺激驱动的控制项(如刺激时长、词频、音素数、声学模型等)显著解释。验证结果如下:
- 门控状态:失败 — 在Holm校正后,38个刺激测试中0个达到显著水平。
- 意义说明:大脑RDM的有效秩为57(刺激总数为84),表明RDM确实包含刺激结构,但控制测试未达到显著,因此对齐数值不能作为语言模型与发育大脑对齐的证据,仅作为完整性参考。
- 对比说明:这与ds003604数据集的失败模式不同——后者RDM有效秩极低(~3/40-48),而本数据集RDM仍具有较高有效秩,因此失败源于具体控制测试不显著,而非测量不可解释。
四、数据构建方法与主要内容
- 分析单元:共40个任务×会话单元,每个单元生成一个RDM,基于该单元受试者共享的刺激,体素模式在每次运行内进行z-score标准化。
- 噪声上限:报告了各单元的层间噪声上限(ceiling_lower和ceiling_upper),受试者数量为3-7人不等。
- 模型与对齐结果:
- 模型网格:15个模型系列,共10480行对齐数据,覆盖8个单元(有效组合)。
- 平均噪声上限:0.359。
- 最佳对齐值:0.0913(占噪声上限的42.2%)。
- 等价性检验:所有15个模型系列均与零效应等价(TOST ±0.05)。
- 尺度趋势:Pythia模型规模与对齐效果相关性ρ = -0.190,p = 0.24(不显著)。
- 各模型系列表现:按平均对齐值排序,pico-decoder-small获得最高平均RSA值(0.0047),但所有系列均未通过等价性检验。
五、数据集特有说明
- 局部语义任务特色:该数据集包含LocalSem任务,是项目中唯一一个刺激与运行完全交叉的语言单元,可区分运行身份和刺激身份,避免了ds003604中的扫描运行混淆问题。
- 年龄信息限制:参与者的出生日期存在但缺乏扫描日期,因此无法恢复个体年龄,数据集仅适用于组水平分析,无法承载发育轨迹研究。
六、数据文件清单
| 文件路径 | 内容 | 状态 |
|---|---|---|
| alignment_by_checkpoint.csv | 每个模型×检查点×单元的详细对齐值 | 存在 |
| alignment_by_family.csv | 按模型系列汇总对齐值及等价检验结果 | 存在 |
| alignment_by_cell.csv | 按任务×会话的对齐结果 | 存在 |
| ceilings_ds006239.csv | 每个单元的噪声上限 | 存在 |
| control/ | 正向控制和RDM维度信息(门控验证) | 存在 |
| scale_ladder.csv | Pythia规模测试(70M→1.4B) | 存在 |
| fig_.pdf / fig_.png | 结果图 | 存在 |
七、方法论简述
采用表征相似性分析(RSA)。每个单元构建大脑RDM(刺激间的相关距离,基于每次运行内z-score的GLM beta模式,跨受试者聚合),然后与模型RDM(从各检查点的隐藏状态提取)进行Spearman相关比较。对齐值以原始值和噪声上限分数形式报告,并使用PARC套件(18个仅随机种子不同的模型)作为空模型进行统计判断。刺激集排除无效和固定试验;配对设计中的刺激身份为词对而非单个词。





