cdl-devai-results
收藏资源简介:
CDL DevAI results 数据集是一个针对10个语言模型家族在训练过程中发育分析的综合数据集,用于评估模型表征与大脑(基于ds003604听觉语言fMRI数据集)的匹配程度、内部表征结构以及语言现象的定位。数据集包含多个CSV表格,按配置组织:主表summary_by_checkpoint(262行,涵盖10个模型的所有检查点)提供脑对齐、可解释性和定位三大轴的综合指标;summary_by_family提供每个家族的汇总统计;每个模型下有详细的脑对齐、可解释性、定位、行为及消融数据。此外,还包含诊断数据和噪声天花板分析。需注意:脑对齐指标因fMRI扫描运行混淆而无效,不可用于解释模型-大脑对齐;安全的指标包括表征参与率、基尼系数、选择性指数、最小对准确率等。数据集适用于研究语言模型发育过程中的表征压缩、稀疏性、定位专业化、行为准确性,以及跨模型家族的比较分析。
CDL DevAI results dataset is a comprehensive dataset for analyzing the developmental trajectories of 10 language model families during training. It is used to evaluate the alignment between model representations and the brain (based on the ds003604 auditory language fMRI dataset), internal representation structure, and localization of linguistic phenomena. The dataset contains multiple CSV files organized by configuration: the main table summary_by_checkpoint (262 rows covering all checkpoints of the 10 models) provides comprehensive metrics across three axes: brain alignment, interpretability, and localization; summary_by_family provides aggregated statistics for each family; each model includes detailed data on brain alignment, interpretability, localization, behavior, and ablation. Additionally, it includes diagnostic data and noise ceiling analysis. Note: Brain alignment metrics (e.g., rsa*, brain_*) are invalid due to fMRI scan run confounds and should not be used to interpret model-brain alignment; safe metrics include representation participation rate, Gini coefficient, selectivity index, minimal pair accuracy, etc. The dataset is suitable for studying representation compression, sparsity, localization specialization, behavioral accuracy during language model development, and cross-model family comparative analysis.
数据集概述:CDL DevAI Results
基本信息
- 数据集地址:https://huggingface.co/datasets/BrainAlign/cdl-devai-results
- 许可证:cc-by-4.0
- 标签:神经科学、功能磁共振成像(fMRI)、脑对齐、可解释性、语言模型
研究内容
本数据集对10个语言模型家族在ds003604听觉语言fMRI数据集上的发育分析结果。针对每个模型的每个训练检查点,同时测量了三个维度:
| 维度 | 核心问题 | 对应数据表 |
|---|---|---|
| 脑对齐 | 模型的表征几何是否与大脑匹配 | brain_alignment |
| 可解释性 | 表征内部如何组织 | interp_mechanistic, interp_layerwise |
| 定位 | 语言现象是否被隔离到专用单元 | localisation_isolation, localisation_onset |
数据结构
- 主表:
summary_by_checkpoint.csv,262行数据,每行对应一个模型×检查点,包含三个维度的全部指标 - 按模型划分:10个家族各自独立的目录,包含完整详细数据
- 诊断与天花板分析:用于验证和修正测量方法的专用数据
关键警告:脑对齐数据存在混淆问题
⚠️ 脑对齐列(rsa*、brain_*、ablation_alignment)受扫描运行混淆影响,不能作为关于语言模型的结果解读。
- 在ds003604数据集中,每个刺激只出现在一次扫描运行中,导致运行身份与刺激身份完全混淆
- 不同运行可预测脑相似度(Spearman ρ为+0.49至+0.87),而刺激属性几乎无法预测(≈0)
- 语言模型无法表达刺激出现在哪个运行中,因此其RSA值在构建上就接近0
已排除的解释
- 队列规模:从40名受试者增至98名后,结果依然一致(ρ=0.928)
- 层选择:所有层的对齐度均为−0.012至−0.021,没有中层峰值
修正方法
- 在合并运行前对每个体素按运行内Z-score标准化,可使运行预测性从+0.562降至−0.041
- 修正后的对齐峰值仅为+0.022(不显著),占噪音上限的2.6%
更新的噪音上限分析(2026-08-25)
- 噪音上限(留一法):修正后为0.849/0.859
- 受试者间信度为0.85,远高于文献中常见的0.2–0.4
- 三个不同架构的模型仅捕捉到上限的0–3%,这是一个干净、效力充足的零结果
安全指标说明
可安全使用的指标
| 类别 | 指标 | 说明 |
|---|---|---|
| 可解释性 | interp_*(norm, gini, hoyer, per, condition_number, cka_to_prev) |
仅由LM激活计算,不涉及fMRI数据 |
| 定位 | loc_*(selectivity_index, overlap, gini, entropy等) |
仅基于文本对比的内部定位 |
| 行为 | mp_accuracy(最小对准确率) |
仅文本,随机水平为0.5 |
| 消融行为 | causal_selectivity |
消融与行为的比较,不涉及fMRI |
唯一未被污染的正向结果
因果行为测试:消融现象专用回路导致最小对准确率损失1.13%,而随机回路仅为0.55%(t=1.98, p=0.049, n=316)。该结果处于临界显著,应描述为提示性而非确证性。
模型表现概览
| 模型家族 | 检查点数 | 趋势ρ (p) | interp PR | interp gini | 定位选择性 | 行为准确率 |
|---|---|---|---|---|---|---|
| pico-decoder-tiny | 21 | −0.02 (0.80) | 0.221 | 0.204 | 0.546 | 0.631 |
| pico-decoder-small | 126 | +0.16 (<0.001) | 0.184 | 0.243 | 0.551 | 0.682 |
| pico-decoder-medium | 21 | −0.10 (0.13) | 0.191 | 0.206 | 0.544 | 0.679 |
| pico-decoder-large | 21 | +0.01 (0.93) | 0.104 | 0.221 | 0.539 | 0.687 |
| beetle-humanscale-eng | 18 | −0.03 (0.71) | 0.300 | 0.077 | 0.530 | 0.510 |
| beetle-fineweb3-eng | 19 | −0.05 (0.44) | 0.241 | 0.090 | 0.558 | 0.590 |
| babylm-gpt2-3 | 9 | +0.17 (0.07) | 0.065 | 0.326 | 0.519 | 0.693 |
| babylm-gpt2-5 | 9 | +0.14 (0.14) | 0.066 | 0.324 | 0.531 | 0.687 |
| babylm-gpt2-7 | 9 | +0.12 (0.21) | 0.065 | 0.328 | 0.520 | 0.707 |
| babylm-gpt2 | 9 | −0.03 (0.73) | 0.072 | 0.293 | 0.530 | 0.707 |
关键发现
- 可解释性:babylm模型(PR=0.065)远比比格尔模型(0.24–0.30)更压缩
- 定位:所有模型的选择性指标约为0.5,中等且惊人地恒定,没有模型能尖锐隔离现象
- 行为:比格尔humanscale模型(0.51)基本处于随机水平;babylm和pico模型达到0.63–0.71
- 跨家族预测:留出交叉家族预测器得分平均R² = −2.74,比预测均值更差





