遇见数据集

open-jlens-data

收藏
github2026-07-14 更新2026-07-16 收录
官方服务:

资源简介:

该数据集来自一个J-lens(Jacobian lens)测量活动,针对开放权重模型(2026年7月),包含原始数据、实验配置和代码。数据内容包括实验协议、拟合代码、运行数据(如每提示收敛CSV、元数据JSON和分析数组NPZ文件)以及日志,但排除了大型原始拟合张体和缓存。

This dataset is sourced from a J-lens (Jacobian lens) measurement campaign targeting open-weight models as of July 2026, and includes raw data, experimental configurations, and code. The data contents cover experimental protocols, fitting code, runtime data (such as per-prompt convergence CSV files, metadata JSON files, and analysis array NPZ files), as well as logs. Large raw fitting tensors and caches are excluded from this dataset.

创建时间:
2026-07-12
原始信息汇总

数据集概述

本数据集来源于针对开放权重模型进行的 J-lens(Jacobian lens)测量活动(2026年7月),包含原始数据、实验配置和代码。

内容结构

  • 实验协议program.md 文件记录了实验方案,包括模型、配方、命令和预注册设计。
  • 代码code/ 目录包含全部拟合与分析代码,例如拟合 CLI、Δ-分桶视野拟合器及其草图变体、MoE 拟合器、梯度追踪、CKA/PR 分析及测试,并附带了第三方库 jacobian-lens(Apache-2.0 许可证)。
  • 脚本scripts/ 目录包含每次运行的 Slurm 作业文件及环境配置脚本。
  • 实验运行数据runs/<experiment>/ 目录按实验组织,包含逐提示收敛 CSV 文件、拟合元数据(meta.json 记录模型/分支/提示/分片布局)、分析数组(npz)及逐分片拟合日志。具体实验包括:E1_horizon、E1_horizon_4k、E1x2_horizon_training、E2_training、E3_transplant、E4_delphi、E5_datasets、E6_moe、perf_probe。
  • 日志logs/ 目录包含 Slurm 作业日志。
  • 透镜索引FIT_INVENTORY.json 文件是所有已拟合透镜的索引,记录路径、大小和配置信息。

排除内容

由于 GitHub 文件大小限制,本数据集未包含原始拟合透镜张量文件(*.pt,每个 0.02–63 GB)及多 GB 的中间缓存。每个透镜在 FIT_INVENTORY.json 中均有索引,并可通过 program.md 中的配方及每个拟合的 meta.json 重现。超过 95 MB 的文件已被排除。

搜集汇总
数据集介绍
open-jlens-data 数据集图片
构建方式
open-jlens-data数据集源自一项针对开放权重模型的Jacobian透镜测量活动,旨在系统性地探究模型内部表征的几何结构。构建过程严格遵循实验方案,包含预注册的实验设计,并整合了实验配置与原始数据。数据集中涵盖了多种实验场景,如水平扫描、训练动态分析、移植实验等,每个实验运行均保存了逐提示的收敛CSV文件、拟合元数据及分析数组,确保数据的完整性与可复现性。
特点
该数据集的核心特色在于其模块化的组织架构与广泛的实验覆盖范围。通过将原始拟合张量排除在外,仅提供索引文件与复现配方,数据集在确保可访问性的同时避免了存储限制。此外,数据集包含了完整的拟合与分析代码,包括Δ分桶水平拟合器、MoE拟合器及梯度追踪算法,以及CKA/PR分析工具,为研究者提供了从数据到分析的一站式资源。
使用方法
用户可通过加载FIT_INVENTORY.json索引文件快速定位所需的透镜数据,并结合program.md中的实验协议与meta.json中的拟合元数据进行复现。代码目录提供了命令行接口用于执行拟合与分析,支持Slurm作业调度,适合大规模集群环境。数据集中的npz数组与CSV文件可直接用于下游分析,如计算表征相似性或追踪训练过程中的几何变化,研究人员可根据实验需求灵活调用相应脚本与工具。
背景与挑战
背景概述
open-jlens-data数据集诞生于2026年7月,由关注神经网络可解释性的研究团队发起,旨在通过雅可比透镜(Jacobian lens)技术探究开放权重模型内部表征的动态演化。其核心研究问题围绕模型在训练、微调及迁移场景中,隐层表示如何随输入和参数变化而响应,从而揭示神经网络的底层计算机制。该数据集系统性记录了多组实验(如水平扫描、训练动力学、MoE分析等)的原始数据与拟合元数据,为可解释性研究提供了标准化基准。其影响力体现在以实证方式填补了模型内部状态可观测性的空白,推动了透明机器学习领域的发展。
当前挑战
该数据集面临的挑战主要体现在两个层面。其一,在领域问题上,神经网络的高度非线性与参数规模(高达数十亿)使得精确捕捉雅可比矩阵的时空变化极为困难,传统归因方法难以应对高维表征的纠缠和长期依赖的衰减,需要设计高效的拟合算法来逼近透镜映射。其二,在构建过程中,原始透镜张量体积庞大(单次实验可达63 GB),受限于存储与传输瓶颈,仅能以索引和可复现配置形式发布,这对用户复现实验时的算力与协调能力提出要求;同时,海量多模态日志的标准化索引(如FIT_INVENTORY.json)需要精密的元数据管理,以避免不同运行批次间的配置偏差和数据碎片化问题。
常用场景
经典使用场景
在可解释性与机械可解释性研究领域,open-jlens-data 数据集为探究大型语言模型内部工作原理提供了一套系统化的实验框架与原始数据。该数据集最经典的使用场景是借助雅可比透镜(Jacobian lens)技术,对开放权重模型进行递进式的跨层次分析,通过拟合透镜来刻画模型在训练、微调或结构变换过程中神经元激活模式与功能模块的演化路径。研究者可依托其中的实验协议、代码与分片日志,复现从单个前向传播到多跳推理的梯度追踪,从而揭示模型内部知识表示的形成机制与动态重组过程。
解决学术问题
该数据集直面的核心学术问题是:在大型语言模型日益复杂、权重参数数以亿计的背景下,如何以可量化、可验证的方式剖析其内部计算图的功能组织与因果结构。传统 post-hoc 分析往往依赖浅层统计或黑箱探测,难以捕捉模型在训练与微调中的局部功能变化。open-jlens-data 通过标准化透镜拟合流程、分桶地平线分析、混合专家适配器等手段,首次在开放权重模型上建立了从原始激活到高阶因果映射的完整证据链,显著推进了机械可解释性研究向规模化、系统化方向的迈进。其发布的意义在于为社区提供了一个可复现、可扩展的实验基准,使后续研究得以在同一数据与代码生态内进行公平比较与知识积累。
衍生相关工作
围绕 open-jlens-data 数据集已衍生出一系列极具影响力的工作,方向涵盖透镜拟合的可扩展算法改进、跨模型功能对齐分析以及基于透镜激活模式的模型性能预测。在算法层面,研究者基于其提供的分片日志与拟合元数据,开发了更为高效的稀疏梯度追踪与差分地平线压缩技术,显著降低了大模型透镜拟合的计算开销。在分析框架层面,CKA 与 PR 分析工具被扩展为跨任务、跨检查点的通用功能比对管道,支持对模型训练轨迹的细粒度量化。此外,部分工作利用该数据集中的实验设计基因,提出了“功能性神经外科”式精确编辑方法,通过定位并重写关键因果节点来纠正模型行为,为模型微调和安全干预开辟了新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务