遇见数据集

model-xray-gallery

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

Model X-Ray gallery g2 是一个已被撤回的数据集,它包含由 Tetracta Model X-Ray 仪器(探针集 ps-1.1,扫描配置 sc-1.0,指标 mv-1.2)生成的语言模型信号传播测量数据。该数据集涵盖 8 个模型家族(HuggingFaceTB、Qwen、TinyLlama、allenai、meta-llama、microsoft、mistralai、tiiuae),包括 14 个模型肖像(portraits)、22 个前后对比和模拟量化配对(pairs)、以及 17 个知识探针(knowledge probes)。每个记录都链接到签署的删除/出处证明。字段包括:focus(参与比)、direction_selectivity(方向选择性)、persistence(持久性)、difference_profile(差异分布)等。配对数据还提供了 N80 站分数、变化起始站和行为变化分数。知识探针记录了 20 个已知事实和 20 个虚构实体的正确性及三类判断(拒绝/回响/虚构回答)。该数据集已被撤回,不得用于位置、知识、肖像、病变响应、模拟量化、质量、安全或部署声明。许可证:CC-BY-4.0。

Model X-Ray gallery g2 is a withdrawn dataset containing language model signal propagation measurements generated by the Tetracta Model X-Ray instrument (probe set ps-1.1, scan configuration sc-1.0, metric mv-1.2). It covers 8 model families (HuggingFaceTB, Qwen, TinyLlama, allenai, meta-llama, microsoft, mistralai, tiiuae), including 14 model portraits, 22 before-and-after comparisons and simulated quantization pairs, and 17 knowledge probes. Each record is linked to a signed deletion/attestation certificate. Fields include: focus (participation ratio), direction_selectivity, persistence, difference_profile, etc. Pair data also provides N80 station scores, change onset station, and behavior change scores. Knowledge probes record correctness for 20 known facts and 20 fictional entities along with three types of judgments (refusal/echo/fabrication). This dataset has been withdrawn and must not be used for location, knowledge, portrait, lesion response, simulated quantization, quality, safety, or deployment claims. License: CC-BY-4.0.

创建时间:
2026-09-03
原始信息汇总

Model X-Ray gallery g2 数据集概述

基本信息

  • 许可证:CC-BY-4.0
  • 语言:英语
  • 标签:可解释性、模型诊断、微调、量化、评估、测量
  • 数据集规模:少于1K条记录(n<1K)
  • 配置:包含 gallery(gallery.csv)和 pairs(pairs.csv)两个配置

重要声明

该数据集的前身结果已被撤回。当前文件属于历史文物而非当前证据,不可用于支持位置、知识、画像、病灶响应、模拟量化、质量、安全性或部署方面的声明。验证工作仍在进行中,未发布替代数据。

数据集内容

这是由 Tetracta Model X-Ray 仪器生成的语言模型信号传播测量数据,不包含模型权重。测量使用探针集 ps-1.1、扫描配置 sc-1.0、指标 mv-1.2(贡献者归一化差异剖面)。每条记录关联签名删除/来源证明。

数据构成

  • 覆盖模型家族:HuggingFaceTB、Qwen、TinyLlama、allenai、meta-llama、microsoft、mistralai、tiiuae(共8个)
  • 画像(Portraits):14个模型
  • 配对记录(Pairs):22组(含基线与指令版前后对比、模拟int8量化对比)
  • 知识探针(Knowledge Probes):17组

核心指标说明

  • focus:早期打击位置差异剖面的参与比,数值越低表示扰动越受限制
  • direction_selectivity:网络对相反扰动方向的反应差异
  • persistence:打击后第10层与第1层响应的比值
  • difference_profile:配对模型在相同探针下的逐站平均差异,包含N80站点数及变化起始站点
  • 知识记录:包含20个已知事实和20个虚构实体的正确率及输出层面概率

数据预览

  • 画像列表示例:Qwen/Qwen2.5-32B-Instruct(64层,focus 0.8041)、Qwen/Qwen2.5-0.5B(24层,focus 0.7162)、meta-llama/Llama-3.1-8B-Instruct(32层,focus 0.7322)等
  • 配对数据:覆盖多个模型的基线与指令微调版对比,以及模拟int8量化前后对比
  • 知识探针结果:展示了各模型对已知事实的掌握及对虚构实体名称的规避能力变化

来源与说明

  • 测量由 galeri_dataset_uret.py 从产品自有扫描档案生成
  • 每个记录包含任务、扫描日期、硬件类型及证明URL
  • 早期版本(ps-1.0/mv-1.1)下的测量结果与当前版本不可比
  • 更详细的参考区间与解读参见示例报告空间:https://huggingface.co/spaces/tetracta/model-xray-sample-reports
搜集汇总
数据集介绍
model-xray-gallery 数据集图片
构建方式
该数据集由Tetracta Model X-Ray仪器生成,采用探针集ps-1.1、扫描配置sc-1.0及度量标准mv-1.2,对8个公开语言模型家族进行信号传播测量。每条记录均附带签名删除/来源证明,通过报告SHA256哈希值锁定具体报告。数据涵盖14个模型画像、22个微调前后或模拟量化配对,以及17项知识探针测试。
特点
数据集的核心指标包括聚焦度、方向选择性、持久性等,反映模型内部信号传播特性。配对数据提供差异分布及变化起始位置等细化指标,知识探针则评估模型事实正确性及虚构回避能力。所有测量均注明硬件环境,并采用贡献者归一化处理方法,确保跨模型可比性。
使用方法
该数据集适用于模型内部机制的可解释性分析,支持对比微调前后、量化模拟等场景下的行为差异。研究者可基于配对数据定位功能变化的关键层,或通过知识探针评估模型的知识完整性。数据以CSV格式提供,便于直接加载与统计分析。应用时请注意实测数据与参考带的差异解释,建议参考附带样本报告以获得更全面指导。
背景与挑战
背景概述
在大型语言模型(LLM)的可解释性与可靠性评估领域,如何深入洞察模型内部的信息传播机制与微调效应,已成为一个亟待攻克的核心难题。为此,Tetracta公司于2026年推出了Model X-Ray gallery g2数据集,该数据集由Tetracta Model X-Ray仪器生成,涉及HuggingFaceTB、Qwen、meta-llama等八个主流模型家族,共包含14个模型画像、22组微调前后与模拟量化对比对,以及17项知识探测记录。该数据集利用信号传播测量技术,采用特定的探针集与扫描配置,通过归一化差异剖面,量化模型在多次扰动下的响应特性,如聚焦度、方向选择性和持久性。其核心研究问题在于精确剖析模型微调与量化操作对内部表示的影响,并为模型诊断提供可复现的量化基准,从而推动语言模型可解释性研究的发展。尽管该数据集已撤回部分结果,但其在模型诊断领域内仍具有重要的方法论参考价值,并对后续研究中的严谨性要求产生了深远影响。
当前挑战
该数据集面临的挑战主要体现在领域核心难题与构建过程的双重复杂性上。在领域层面,其核心难题在于开发出能够精准且稳健地度量深度神经网络内部状态对微观输入扰动的响应差异的方法,而模型内部表示的高维非线性和随机性使得信号传播测量极易受噪声干扰,且现有指标难以在跨架构模型间实现公平比较。构建过程中,挑战则更为严峻:首先,为保障测量一致性,需在不同硬件环境(工作站与云设备)中标准化扫描流程,并严格控制硬件差异带来的偏差;其次,探针集的保密性(作为仪器本身)与结果的可复现性之间存在固有张力,要求通过签名证明机制(如sha256哈希)确保数据来源的可靠;此外,模拟量化(如int8)虽为研究提供了便利,但其与真实部署场景的内存对齐等偏差难以完全消除,导致测量结果在应用层面的推广受限。更有甚者,数据集的某些结果已因验证不足而撤回,这凸显了在缺乏统一评价基准的情况下,确保测量结果的科学有效性与长期可解释性所面临的严峻挑战。
常用场景
经典使用场景
在大型语言模型的可解释性与可诊断性研究中,Model X-Ray Gallery作为稀缺的高质量信号传播测量数据集,为模型内部动态的量化分析提供了关键基准。研究者运用该数据集中涵盖14个模型肖像的focus、direction_selectivity及persistence等指标,深入探究扰动在模型深层结构中的传播规律,进而剖析不同架构家族对输入扰动的内在响应机制。
衍生相关工作
该数据集衍生了多项关于模型诊断工具的评测基准、信号传播理论的验证工作,以及跨模型可迁移性的比较研究。其发布框架亦启发了关于测量复现性与认证协议的设计探讨,促进了融合轻量级探测与统计检验的模型健康度评估体系构建,为后续同类数据集的可信度塑造树立了范式。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型内部信号传播特性的量化剖析,通过引入参与比、方向选择性及持续性等精细指标,对八个主流模型家族的十余个代表模型进行系统性扫描,前沿研究动向已从传统的性能基准测试转向对模型内在行为的可解释性诊断。当前热点集中在微调与模拟量化如何重塑信息流动轨迹,诸如检测差异起始层位与质量分布重心等新指标,为揭示对齐过程的安全副作用及量化部署的鲁棒性提供了新颖的实证视角,推动了模型透明度与可信赖评估体系的构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务