model-xray-gallery
收藏资源简介:
Model X-Ray gallery g2 是一个已被撤回的数据集,它包含由 Tetracta Model X-Ray 仪器(探针集 ps-1.1,扫描配置 sc-1.0,指标 mv-1.2)生成的语言模型信号传播测量数据。该数据集涵盖 8 个模型家族(HuggingFaceTB、Qwen、TinyLlama、allenai、meta-llama、microsoft、mistralai、tiiuae),包括 14 个模型肖像(portraits)、22 个前后对比和模拟量化配对(pairs)、以及 17 个知识探针(knowledge probes)。每个记录都链接到签署的删除/出处证明。字段包括:focus(参与比)、direction_selectivity(方向选择性)、persistence(持久性)、difference_profile(差异分布)等。配对数据还提供了 N80 站分数、变化起始站和行为变化分数。知识探针记录了 20 个已知事实和 20 个虚构实体的正确性及三类判断(拒绝/回响/虚构回答)。该数据集已被撤回,不得用于位置、知识、肖像、病变响应、模拟量化、质量、安全或部署声明。许可证:CC-BY-4.0。
Model X-Ray gallery g2 is a withdrawn dataset containing language model signal propagation measurements generated by the Tetracta Model X-Ray instrument (probe set ps-1.1, scan configuration sc-1.0, metric mv-1.2). It covers 8 model families (HuggingFaceTB, Qwen, TinyLlama, allenai, meta-llama, microsoft, mistralai, tiiuae), including 14 model portraits, 22 before-and-after comparisons and simulated quantization pairs, and 17 knowledge probes. Each record is linked to a signed deletion/attestation certificate. Fields include: focus (participation ratio), direction_selectivity, persistence, difference_profile, etc. Pair data also provides N80 station scores, change onset station, and behavior change scores. Knowledge probes record correctness for 20 known facts and 20 fictional entities along with three types of judgments (refusal/echo/fabrication). This dataset has been withdrawn and must not be used for location, knowledge, portrait, lesion response, simulated quantization, quality, safety, or deployment claims. License: CC-BY-4.0.
Model X-Ray gallery g2 数据集概述
基本信息
- 许可证:CC-BY-4.0
- 语言:英语
- 标签:可解释性、模型诊断、微调、量化、评估、测量
- 数据集规模:少于1K条记录(n<1K)
- 配置:包含
gallery(gallery.csv)和pairs(pairs.csv)两个配置
重要声明
该数据集的前身结果已被撤回。当前文件属于历史文物而非当前证据,不可用于支持位置、知识、画像、病灶响应、模拟量化、质量、安全性或部署方面的声明。验证工作仍在进行中,未发布替代数据。
数据集内容
这是由 Tetracta Model X-Ray 仪器生成的语言模型信号传播测量数据,不包含模型权重。测量使用探针集 ps-1.1、扫描配置 sc-1.0、指标 mv-1.2(贡献者归一化差异剖面)。每条记录关联签名删除/来源证明。
数据构成
- 覆盖模型家族:HuggingFaceTB、Qwen、TinyLlama、allenai、meta-llama、microsoft、mistralai、tiiuae(共8个)
- 画像(Portraits):14个模型
- 配对记录(Pairs):22组(含基线与指令版前后对比、模拟int8量化对比)
- 知识探针(Knowledge Probes):17组
核心指标说明
- focus:早期打击位置差异剖面的参与比,数值越低表示扰动越受限制
- direction_selectivity:网络对相反扰动方向的反应差异
- persistence:打击后第10层与第1层响应的比值
- difference_profile:配对模型在相同探针下的逐站平均差异,包含N80站点数及变化起始站点
- 知识记录:包含20个已知事实和20个虚构实体的正确率及输出层面概率
数据预览
- 画像列表示例:Qwen/Qwen2.5-32B-Instruct(64层,focus 0.8041)、Qwen/Qwen2.5-0.5B(24层,focus 0.7162)、meta-llama/Llama-3.1-8B-Instruct(32层,focus 0.7322)等
- 配对数据:覆盖多个模型的基线与指令微调版对比,以及模拟int8量化前后对比
- 知识探针结果:展示了各模型对已知事实的掌握及对虚构实体名称的规避能力变化
来源与说明
- 测量由
galeri_dataset_uret.py从产品自有扫描档案生成 - 每个记录包含任务、扫描日期、硬件类型及证明URL
- 早期版本(ps-1.0/mv-1.1)下的测量结果与当前版本不可比
- 更详细的参考区间与解读参见示例报告空间:https://huggingface.co/spaces/tetracta/model-xray-sample-reports




