遇见数据集

llm-xray-lesion-scans

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

LLM Lesion X-Ray 数据集是一个已撤回的历史数据集,包含六个约1B参数的语言模型的层损伤扫描结果。该数据集由 Tetracta AI 使用单一预注册协议生成,仅包含测量数据(KL散度值),不包含模型权重。数据集的背景在于:传统基准测试只能评估模型的知识输出,而无法揭示模型内部结构;本数据集通过逐层损伤(剪枝或加噪)并测量输出分布变化,试图回答“模型是如何构建的”这一问题。数据内容包括六个模型的扫描结果,分别为:Qwen2.5-1.5B(基础版和指令版)、van-1b(内部Transformer,基础版和SFT版)、以及znext-v43(恒定状态架构,基础版和SFT版)。其中van-1b和znext-v43是在相同数据上训练的匹配对,仅架构不同。每个模型在12个固定英语提示下,对每一层应用五种损伤强度(剪枝:5%/10%/20%/30%;噪声:σ=0.005/0.01/0.02×权重标准差),记录损伤前后的分布KL散度。数据以JSON格式存储,每个文件包含字段:etiket(标签)、n_katman(层数)、n_istem(提示数)、tohum(随机种子)、budama(剪枝结果数组)、gurultu(噪声结果数组),数组长度为层数,顺序为输入到输出。数据规模为n<1K,共6个文件。该数据集适用于模型可解释性、鲁棒性分析、剪枝研究、损伤研究等任务,但注意:数据集已撤回,不得用于支持任何位置、知识、肖像、损伤响应、模拟量化、质量、安全或部署声明。

The LLM Lesion X-Ray dataset is a withdrawn historical dataset containing layer-wise lesion scans of six ~1B parameter language models. Generated by Tetracta AI using a single pre-registered protocol, it contains only measurement data (KL divergence values) and no model weights. The dataset includes scans of six models: Qwen2.5-1.5B (base and instruct versions), van-1b (internal Transformer, base and SFT versions), and znext-v43 (constant-state architecture, base and SFT versions). van-1b and znext-v43 are matched pairs trained on the same data differing only in architecture. Each model is tested with 12 fixed English prompts, applying five lesion intensities (pruning: 5%/10%/20%/30%; noise: σ=0.005/0.01/0.02×weight standard deviation) per layer, recording the KL divergence before and after lesion. Data is stored in JSON format, each file containing fields: etiket (label), n_katman (number of layers), n_istem (number of prompts), tohum (random seed), budama (pruning results array), gurultu (noise results array), with array length equal to number of layers in input-to-output order. Data size is n<1K, 6 files total. Suitable for model interpretability, robustness analysis, pruning research, and lesion studies, but note: the dataset is withdrawn and must not be used to support any claims regarding location, knowledge, representation, lesion response, simulated quantization, quality, safety, or deployment.

创建时间:
2026-08-24
原始信息汇总

数据集概述:LLM Lesion X-Ray

基本信息

LLM Lesion X-Ray 数据集由 Tetracta AI 发布,针对六个 1B 级语言模型进行神经层损伤(layer-lesion)扫描实验,采用统一的预注册协议(pre-registered protocol)。该数据集包含的是测量数据(measurements),而非模型权重

  • 许可证:CC-BY-4.0
  • 语言:英语
  • 数据规模:小于 1K 条记录
  • 标签:可解释性、模型诊断、鲁棒性、剪枝、逐层损伤研究、评估

⚠️ 重要声明(撤回状态)

根据 2026 年 9 月 6 日的修正声明:该数据集此前发布的 Model X-Ray 结果已被撤回。这些文件被视为历史性材料而非当前证据,不得用于支持关于定位、知识、画像、病变响应、模拟量化、质量、安全或部署方面的任何主张。目前尚未发布替代数据,验证工作仍在进行中。

实验设计

实验方法

对所有模型执行相同的扫描协议:逐层对模型权重进行损伤处理——按幅度剪枝最小 5% / 10% / 20% / 30% 的权重,或添加高斯噪声(σ = 0.005 / 0.01 / 0.02 × 权重标准差),然后计算损伤前后输出分布之间的 KL 散度。

核心指标

指标 含义
fragility(脆弱性) 每单位损伤导致输出分布变化的程度
concentration(集中度) 最敏感的前 1/5 层所承载的损伤比例(均匀分布时为 20%,若模型过度依赖少数层则接近 90%)

数据集内容

数据集包含 6 个 JSON 文件,涵盖以下模型:

文件 模型 权重状态
qwen2.5-1.5b-base.json Qwen2.5-1.5B 开源
qwen2.5-1.5b-instruct.json Qwen2.5-1.5B-Instruct 开源
van-1b-base.json 内部 Transformer 模型(10.32B tokens) 未发布
van-1b-sft.json 上述模型 SFT 版本 未发布
znext-v43-base.json Z-Next v4.3 恒定状态架构(10.00B tokens) 未发布
znext-v43-sft.json 上述模型 SFT 版本 未发布

其中 van-1bznext-v43 构成匹配对:使用相同数据、相同预算训练,仅架构不同。在标准基准测试上两者仅相差 0.62 个宏平均分(95% CI [−0.06, +1.28],统计上视为相等),但实验仪器下表现截然不同。

核心发现(30% 剪枝下的平均 KL/层,×10⁻³)

模型 Base SFT 后 集中度(base → SFT)
Z-Next v4.3 7.7 12.8 37% → 39%
内部 Transformer 60.6 117.1 72% → 69%
Qwen2.5-1.5B 18.5 10.3 41% → 52%

关键结论

  1. 匹配对在脆弱性上相差 7.9 倍(base)/ 9.1 倍(SFT 后),集中度分别为 37% vs 72%
  2. 微调对集中度影响极小(37→39,72→69),该特征似乎在预训练结束时已确定
  3. 微调使 Qwen 更鲁棒(18.5→10.3),但使自家两个模型更脆弱

数据集局限

  • 不构成架构层面的因果结论:缺少独立种子控制实验,无法区分架构差异与训练随机性造成的影响
  • Qwen 对比受限:数据、规模、架构多重因素同时不同,无法解耦分析
  • 作者曾于 2026 年 7 月因控制模型显示结果位于正常噪声区间内而撤回过内部差异的发表

文件格式

字段使用土耳其语命名:etiket(标签)、n_katman(层数)、n_istem(提示数量)、tohum(种子)、budama(剪枝)、gurultu(噪声)。每个数组按层顺序存储每层一个 KL 值,跨架构比较需将层索引归一化至 0–1。

相关链接

  • 完整研究笔记:https://www.tetracta.ai/note-xray-lesion.html
  • 扫描服务与示例报告:https://www.tetracta.ai/xray.html
  • 恒定状态模型演示:https://www.tetracta.ai/zchat
  • 配对研究(含种子控制):https://huggingface.co/tetracta/llm-xray-twin-study-1b
  • 修正记录:https://www.tetracta.ai/model-xray/correction/
搜集汇总
数据集介绍
llm-xray-lesion-scans 数据集图片
构建方式
该数据集源于一项针对六款1B级语言模型的逐层损伤扫描研究,采用统一的预注册协议生成,收录的是测量数据而非模型权重。构建流程为:对每一层依次记录模型在12个固定英文提示下的完整词汇表上的下一词分布作为基线p,随后对该层权重进行不同程度的损伤处理——按幅度裁剪比例设定为5%、10%、20%及30%,或叠加高斯噪声,其标准差设为权重标准差的0.005、0.01、0.02倍——再次记录损伤后的分布q,并以KL散度KL(p‖q)作为该层的响应分数。每次扫描后精确恢复权重,并校验检查点哈希值以确保未发生变更。扫描全程无数据落盘。通过这一范式衍生出两个核心量度:脆弱性,即输出分布随单位损伤的偏移程度;集中度,即最敏感的五分之一深度所承载的损伤比例。
特点
该数据集最值得关注之处在于其包含一对经由相同数据、相同预算训练而成的孪生模型——一个常驻状态架构与一个Transformer架构,二者在标准基准测试上仅相差0.62个宏平均分点(95%置信区间[-0.06, +1.28],统计上无显著差异),但在本测量协议下却展现出截然不同的内在特性。数据揭示,常驻状态模型的脆弱性仅为Transformer的七点九分之一(基础版)至九点一分之一(微调版),集中度亦从37%对72%显示出显著分离。进一步观察,微调几乎不改变集中度(37%→39%与72%→69%),暗示该属性由预训练阶段奠定;而微调对鲁棒性的影响方向因模型而异——Qwen2.5-1.5B变得更坚韧,内部模型却更脆弱。数据集亦明确声明其局限性:未进行独立种子对照,因此差异不能直接归因于架构,所有数字仅视为既定仪器下的观测结果。
使用方法
该数据集以JSON格式提供六个扫描文件,每个文件包含层数、提示数、种子,以及裁剪和噪声条件下的逐层KL值数组。使用时可先通过归一化深度(将层索引映射至0-1区间)实现跨架构比较,再计算平均KL值作为脆弱性指标,以及排序后前五分之一层贡献份额作为集中度指标。仓库附带的Python脚本可直接复现报告中的关键数字。此外,用户可专注于特定模型(如Qwen2.5-1.5B)分析其损伤响应模式,或对比基础版与指令微调版本以探究微调对内部表征的影响。设计师亦可借助可视化脚本绘制深度-损伤响应曲线,定位模型功能的关键层位。鉴于数据集的学术性质,使用时务必遵循其声明:不做超出协议范围的结构性归因。
背景与挑战
背景概述
该数据集由Tetracta AI于2026年创建,聚焦于大型语言模型(LLM)的内部结构与可解释性研究。核心研究问题在于,传统基准测试仅能评估模型的知识输出,而无法揭示其内部构建方式。为此,研究者设计了一种基于层损伤(lesion)的扫描协议,对六个1B参数级别的模型(包括自家训练的匹配对:恒定状态架构Z-Next v4.3与Transformer,以及Qwen2.5系列模型)进行系统性损伤分析,量化其脆弱性与信息集中度。该数据集提供了模型在逐层零化最小权重或添加噪声后的KL散度变化,为模型诊断、鲁棒性评估及剪枝策略提供新视角。其发布对理解不同架构的内部差异性具有重要意义,尤其揭示了在基准分数几乎无差别的模型间,其内部机制可能存在显著差异。
当前挑战
该领域的主要挑战在于基准测试的固有局限,它无法探查模型内部结构,而这一数据集通过粗粒度但难以投机的损伤工具试图弥补这一空白。构建过程中面临多重困难:首先,设计统一的预注册协议以确保不同模型间的可比性,需精确控制损伤比例、噪声尺度及层索引归一化。其次,神经元损伤与恢复需严格保证权重状态不变,实施中采用连续校验哈希值。此外,模型差异归因于架构需独立种子对照,但本次发布未运行此类对照,使得结果仅能描述检查点差异,而非确定性的架构特征。对于Qwen模型,数据、规模和架构均不同,无法分解各因素影响,限制了解释范围。最后,作者曾因未经对照的结果被撤销,凸显了此类研究中控制变量与谨慎解读的重要性。
常用场景
经典使用场景
该数据集的核心使用场景是语言模型内部结构的‘病灶扫描’(lesion scanning),通过逐层对模型权重施加确定性损伤(如按幅度剪枝5%-30%或添加高斯噪声),并测量输出分布与完整模型的KL散度,以量化每一层对整体行为的功能贡献。这种基于干预的诊断方法超越了传统仅观察输入输出的黑箱评估,为探究模型脆弱性、信息集中度及深度敏感性提供了标准化、可复现的数据基础,特别适用于1B级模型的架构对比与训练前后变化分析。
衍生相关工作
该数据集催生了若干后续研究方向:其一,基于损伤反应的可解释性方法,如将层敏感性图用于神经元归因与模型压缩,启发低秩分解或结构化剪枝算法以最小化性能损失;其二,跨架构鲁棒性对比的研究,即利用相同协议对更多模型系列(如更大规模的LLaMA、Mistral等)进行扫描,构建‘模型脆弱性图谱’;其三,该数据集的预注册协议与失败的披露(如作者自身的回撤案例)树立了科学严谨性的标杆,推动建立因果归因的基准测试方法,并衍生出关于微调如何改变模型内部冗余度的理论探讨,以及面向特定任务(如知识编辑、遗忘去除)的层定位工具的开发。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型内部结构的可解释性诊断,通过逐层损伤(剪枝与噪声注入)测量模型输出的KL散度变化,揭示信息在深度维度的分布特性。其前沿方向在于:利用标准化损伤协议比较不同架构(如Transformer与恒定状态模型)在相近基准性能下的内部脆弱性与集中度差异,从而突破传统基准仅评估输出能力的局限。该研究关联模型鲁棒性、微调机制分析以及架构设计等热点议题,尤其揭示了微调可能加剧或改善模型脆弱性的非单调效应,以及训练初期已决定信息分布模式的启示。其意义在于为模型诊断提供了一种难以游戏化的量化工具,推动对LLM内部机制的理解,并对预注册协议与可重复性强调,为社区树立了方法学标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务