遇见数据集

cdl-devai-results

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

CDL DevAI results 数据集是一个针对10个语言模型家族在训练过程中发育分析的综合数据集,用于评估模型表征与大脑(基于ds003604听觉语言fMRI数据集)的匹配程度、内部表征结构以及语言现象的定位。数据集包含多个CSV表格,按配置组织:主表summary_by_checkpoint(262行,涵盖10个模型的所有检查点)提供脑对齐、可解释性和定位三大轴的综合指标;summary_by_family提供每个家族的汇总统计;每个模型下有详细的脑对齐、可解释性、定位、行为及消融数据。此外,还包含诊断数据和噪声天花板分析。需注意:脑对齐指标因fMRI扫描运行混淆而无效,不可用于解释模型-大脑对齐;安全的指标包括表征参与率、基尼系数、选择性指数、最小对准确率等。数据集适用于研究语言模型发育过程中的表征压缩、稀疏性、定位专业化、行为准确性,以及跨模型家族的比较分析。

CDL DevAI results dataset is a comprehensive dataset for analyzing the developmental trajectories of 10 language model families during training. It is used to evaluate the alignment between model representations and the brain (based on the ds003604 auditory language fMRI dataset), internal representation structure, and localization of linguistic phenomena. The dataset contains multiple CSV files organized by configuration: the main table summary_by_checkpoint (262 rows covering all checkpoints of the 10 models) provides comprehensive metrics across three axes: brain alignment, interpretability, and localization; summary_by_family provides aggregated statistics for each family; each model includes detailed data on brain alignment, interpretability, localization, behavior, and ablation. Additionally, it includes diagnostic data and noise ceiling analysis. Note: Brain alignment metrics (e.g., rsa*, brain_*) are invalid due to fMRI scan run confounds and should not be used to interpret model-brain alignment; safe metrics include representation participation rate, Gini coefficient, selectivity index, minimal pair accuracy, etc. The dataset is suitable for studying representation compression, sparsity, localization specialization, behavioral accuracy during language model development, and cross-model family comparative analysis.

创建时间:
2026-08-19
原始信息汇总

数据集概述:CDL DevAI Results

基本信息

  • 数据集地址:https://huggingface.co/datasets/BrainAlign/cdl-devai-results
  • 许可证:cc-by-4.0
  • 标签:神经科学、功能磁共振成像(fMRI)、脑对齐、可解释性、语言模型

研究内容

本数据集对10个语言模型家族ds003604听觉语言fMRI数据集上的发育分析结果。针对每个模型的每个训练检查点,同时测量了三个维度:

维度 核心问题 对应数据表
脑对齐 模型的表征几何是否与大脑匹配 brain_alignment
可解释性 表征内部如何组织 interp_mechanistic, interp_layerwise
定位 语言现象是否被隔离到专用单元 localisation_isolation, localisation_onset

数据结构

  • 主表summary_by_checkpoint.csv,262行数据,每行对应一个模型×检查点,包含三个维度的全部指标
  • 按模型划分:10个家族各自独立的目录,包含完整详细数据
  • 诊断与天花板分析:用于验证和修正测量方法的专用数据

关键警告:脑对齐数据存在混淆问题

⚠️ 脑对齐列(rsa*brain_*ablation_alignment)受扫描运行混淆影响,不能作为关于语言模型的结果解读。

  • 在ds003604数据集中,每个刺激只出现在一次扫描运行中,导致运行身份与刺激身份完全混淆
  • 不同运行可预测脑相似度(Spearman ρ为+0.49至+0.87),而刺激属性几乎无法预测(≈0)
  • 语言模型无法表达刺激出现在哪个运行中,因此其RSA值在构建上就接近0

已排除的解释

  • 队列规模:从40名受试者增至98名后,结果依然一致(ρ=0.928)
  • 层选择:所有层的对齐度均为−0.012至−0.021,没有中层峰值

修正方法

  • 在合并运行前对每个体素按运行内Z-score标准化,可使运行预测性从+0.562降至−0.041
  • 修正后的对齐峰值仅为+0.022(不显著),占噪音上限的2.6%

更新的噪音上限分析(2026-08-25)

  • 噪音上限(留一法):修正后为0.849/0.859
  • 受试者间信度为0.85,远高于文献中常见的0.2–0.4
  • 三个不同架构的模型仅捕捉到上限的0–3%,这是一个干净、效力充足的零结果

安全指标说明

可安全使用的指标

类别 指标 说明
可解释性 interp_*(norm, gini, hoyer, per, condition_number, cka_to_prev) 仅由LM激活计算,不涉及fMRI数据
定位 loc_*(selectivity_index, overlap, gini, entropy等) 仅基于文本对比的内部定位
行为 mp_accuracy(最小对准确率) 仅文本,随机水平为0.5
消融行为 causal_selectivity 消融与行为的比较,不涉及fMRI

唯一未被污染的正向结果

因果行为测试:消融现象专用回路导致最小对准确率损失1.13%,而随机回路仅为0.55%(t=1.98, p=0.049, n=316)。该结果处于临界显著,应描述为提示性而非确证性

模型表现概览

模型家族 检查点数 趋势ρ (p) interp PR interp gini 定位选择性 行为准确率
pico-decoder-tiny 21 −0.02 (0.80) 0.221 0.204 0.546 0.631
pico-decoder-small 126 +0.16 (<0.001) 0.184 0.243 0.551 0.682
pico-decoder-medium 21 −0.10 (0.13) 0.191 0.206 0.544 0.679
pico-decoder-large 21 +0.01 (0.93) 0.104 0.221 0.539 0.687
beetle-humanscale-eng 18 −0.03 (0.71) 0.300 0.077 0.530 0.510
beetle-fineweb3-eng 19 −0.05 (0.44) 0.241 0.090 0.558 0.590
babylm-gpt2-3 9 +0.17 (0.07) 0.065 0.326 0.519 0.693
babylm-gpt2-5 9 +0.14 (0.14) 0.066 0.324 0.531 0.687
babylm-gpt2-7 9 +0.12 (0.21) 0.065 0.328 0.520 0.707
babylm-gpt2 9 −0.03 (0.73) 0.072 0.293 0.530 0.707

关键发现

  • 可解释性:babylm模型(PR=0.065)远比比格尔模型(0.24–0.30)更压缩
  • 定位:所有模型的选择性指标约为0.5,中等且惊人地恒定,没有模型能尖锐隔离现象
  • 行为:比格尔humanscale模型(0.51)基本处于随机水平;babylm和pico模型达到0.63–0.71
  • 跨家族预测:留出交叉家族预测器得分平均R² = −2.74,比预测均值更差
搜集汇总
数据集介绍
cdl-devai-results 数据集图片
构建方式
该数据集针对十种语言模型家族在ds003604听觉语言fMRI数据集上的发展性分析而构建,系统记录了每个训练检查点的三类指标:大脑表征对齐、内部可解释性与语言现象定位。数据组织采用层级化结构,主表按模型与检查点汇总262行记录,辅以按模型细分、诊断与天花板分析等配置。构建过程严谨,明确标注了大脑对齐指标受扫描运行混淆影响的局限,并通过层内z评分校正与噪声天花板分析提供修正方案。
特点
数据集的核心特色在于多维度并置与严谨的混淆控制。它同时呈现大脑对齐、内部表征机制、定位分离及行为表现,使研究者能横向比较发展轨迹。安全指标(如可解释性、定位与行为)与受混淆的脑对齐指标明确区分,并附有详细的诊断与天花板分析,确保解读可靠性。此外,数据覆盖广泛,包含十个模型家族、262个检查点,支持跨架构比较,并坦诚报告了校正后近乎为零的脑对齐结果,体现科学诚实性。
使用方法
使用时建议从默认的summary_by_checkpoint配置入手,快速浏览整体结构。针对具体问题,可选用按模型细分的配置深入分析特定模型的脑对齐、可解释性或定位指标。需特别注意,脑对齐相关列受运行混淆影响,不可直接解读为模型结果;应参考ceiling-analysis与diagnostics中的校正分析。安全指标(如interp_*、loc_*、behaviour)可直接使用。所有表均含family与model_ref字段,便于过滤筛选,无需下载完整数据即可进行定制化分析。
背景与挑战
背景概述
随着神经科学与人工智能的交叉融合,语言模型与人类大脑表征对齐的研究成为理解语言机制的关键途径。在此背景下,2026年由suchirsalhan等研究者构建的cdl-devai-results数据集,系统评估了十个语言模型家族在训练过程中的神经对齐性、内部表征组织及语言现象定位能力。该数据集基于ds003604听觉语言fMRI数据,对262个模型检查点进行纵向分析,旨在揭示模型从初始训练到成熟阶段如何逐步优化其内部表征,以匹配大脑的神经响应模式。其核心贡献在于将脑对齐、机制可解释性与局部化分析整合于同一框架,为跨学科研究提供了标准化基准。该数据集已对神经科学和NLP社区产生初步影响,促进了关于模型-大脑相似性的可重复性讨论。
当前挑战
当前数据集面临多重挑战。首要领域难题是脑对齐测量的混淆效应:ds003604数据集中刺激呈现与扫描运行完全绑定,导致运行间的信号漂移和缩放差异成为脑表征距离矩阵的主要预测因子,而真实的语言模型特征几乎无法解释这种结构,使得原始RSA分数丧失可解释性。尽管先验者组内z-score化能有效移除该混淆,但校正后的对齐度接近零且不显著,提示模型-大脑一致性甚微。其次,构建过程面临方法论挑战,包括跨扫描会话的噪声天花板估计、多模型异构架构的可比性度量,以及如何在控制混杂变量的前提下建立可信的预测验证框架,如交叉家族留出验证的负R²值。这些挑战凸显了数据处理中严谨性与稳健性的需求,为后续研究提供了重要警示。
常用场景
经典使用场景
该数据集作为神经科学与自然语言处理交叉领域的前沿资源,提供了对10个语言模型家族在262个训练检查点上的系统发育分析。其核心价值在于并行呈现模型表征几何与大脑fMRI活动(ds003604听觉语言数据集)之间的对齐程度、模型内部表征的组织结构,以及语言现象在模型单元中的定位隔离特性。研究者可借此深入探究语言模型在训练过程中的神经拟真性演化轨迹,并基于标准化的跨模型、跨检查点指标,开展语言处理机制的计算神经科学研究。
实际应用
在人工智能安全与可解释性领域,该数据集为评估和优化语言模型的可解释性提供了量化基准。其‘interp’与‘localisation’指标可用于检测模型内部是否形成稀疏、局域化的功能电路,进而指导模型压缩与编辑技术,提升模型的可控性。此外,行为指标(最小对准确率)与因果消融实验的结合,为定位驱动特定语言能力的神经回路提供了因果证据,有助于开发更高效、更可靠的NLP系统,尤其在资源受限场景下实现模型架构的明智选择。
衍生相关工作
该数据集衍生出一系列深入探索语言模型内部机制的研究工作。基于其‘localisation’与‘ablation_behaviour’数据,研究者开展了针对语言现象(如音韵、语义)神经基质的因果分析,验证了‘局部化电路’假说。噪声上限分析激发了改进RSA方法学的工作,如提出运行内归一化策略以消除fMRI混杂。此外,跨模型、跨检查点的系统性比较催生了关于训练动态对表征几何和可解释性影响的元分析,为后续构建神经拟真性与行为性能协同优化的下一代语言模型提供了理论基础与实证支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务