遇见数据集

lamm-mit/gemma4-materials-latent-vectors

收藏
Hugging Face2026-07-20 更新2026-07-22 收录
官方服务:

资源简介:

该数据集包含用于论文《Reading and Steering Materials Science-Mechanism Representations in an Open-Weight Language Model》中几何分析的潜在向量存档。这些状态是从模型版本`google/gemma-4-E4B-it`的修订版`a4c2d58be94dda072b918d9db64ee85c8ed34e3f`中提取的。数据集包括50个保留的材料描述、十个机制家族、每个家族五个独立编写的表述方式,以及25个注册的源层。它旨在重现报告的潜在几何、分类和可视化分析。数据集文件包括NumPy压缩存档、元数据、评估清单和几何协议文档。数组模式包含原始状态、雅可比传输状态、目标层状态、词法参考向量、解码词向量及相关元数据。数据集仅用于研究和论文的复现,不包含模型权重,使用Gemma模型需遵守Google的条款。

This repository contains the latent-vector archive used for the geometry analyses in the paper Reading and Steering Materials Science-Mechanism Representations in an Open-Weight Language Model. The states were extracted from the model `google/gemma-4-E4B-it` at a specific revision. It includes 50 held-out materials descriptions, ten mechanism families, five independently written phrasings per family, and 25 registered source layers, intended to reproduce latent-geometry, classification, and visualization analyses. The dataset consists of compressed NumPy archives, metadata, evaluation manifests, and geometry protocol documentation, with array schemas covering raw states, transported states, target states, lexical vectors, word vectors, and associated metadata. It is released for research and reproducibility, does not include model weights, and use of the underlying Gemma model is subject to Googles terms.

提供机构:
lamm-mit
搜集汇总
数据集介绍
lamm-mit/gemma4-materials-latent-vectors 数据集图片
构建方式
该数据集源自于对开源语言模型Gemma 4 E4B特定中间层隐藏状态的提取与加工。研究团队从模型第25个源层中,针对50条独立撰写的材料科学描述文本,获取了原始残差状态向量。进一步,利用三组独立训练的雅可比透镜,对这些状态进行雅可比传输变换,生成对应的传输后状态。此外,还提取了目标层、词级词汇参考以及解码单词等多元向量,共同构成一个结构化的潜向量档案,以支持几何分析与可解释性研究。
特点
数据集涵盖了10种不同的材料机理家族,每个家族有5种不同措辞的描述,共计50个提示样本。数据以压缩的NumPy档案格式存储,包含原始状态、传输后状态、目标状态、词汇状态及词向量等多个数组,维度清晰且类型统一为float16。同时,数据集附带了详尽的元数据、提取协议及评估清单,确保了分析的透明性与可复现性,特别适用于材料科学领域的模型表示几何分析。
使用方法
研究者可通过Hugging Face Hub的下载工具直接获取NPZ压缩文件,并利用NumPy库进行加载解析。加载后,即可访问所有预定义的数组,如原始状态、传输后状态及对应层深度等。数据集配合公开的代码仓库与雅可比透镜资源,能够复现论文中关于潜空间几何、分类及可视化的全部分析流程,适用于模型可解释性与材料科学表示机制的研究探索。
背景与挑战
背景概述
在可解释性研究与材料科学交叉的前沿,如何从大语言模型中提取与材料机理相关的结构化表征,成为理解模型内部工作机制的关键问题。Gemma 4 E4B Materials Latent Vectors数据集由麻省理工学院Lamm实验室于2024年创建,依托Google开源的gemma-4-E4B-it模型,聚焦于材料科学领域隐藏状态向量的几何分析。该数据集的核心研究问题在于揭示语言模型如何编码材料科学中的机制性知识,并通过雅可比透镜技术将模型内部状态映射到可解释空间。作为《Reading and Steering Materials Science-Mechanism Representations in an Open-Weight Language Model》论文的附属数据资源,它为后续模型可解释性研究提供了可复现的基准,推动了材料科学知识与深度学习模型表征对齐的探索。
当前挑战
该数据集面临的挑战体现在两个层面。领域问题层面,如何从大语言模型高维、非线性的激活空间中提取与材料科学机制对应的语义方向,并验证这些方向是否真正反映了材料的物理化学特性,而非模型统计伪像,是核心难题。构建过程层面,研究人员需解决50条精选材料描述在25个模型层上的状态提取与对齐问题,包括确保候选短语的多样性以避免词汇偏差、通过三项独立雅可比透镜拟合消除单透镜的系统性误差,以及在向量提取前预先注册几何分析协议以避免事后分析的统计混用。此外,有限样本量(50个提示、10个机制家族)对泛化能力的推断构成了天然约束,要求分析框架具备严格的统计严谨性。
常用场景
经典使用场景
在材料科学与可解释人工智能的交叉领域,潜向量分析为揭示大型语言模型内部物理机制的表征方式提供了独特视角。该数据集收录了从Gemma 4模型中提取的50条材料科学文本的隐藏状态,涵盖10种机制族和5种独立措辞,并包含原始残差状态、雅可比传输状态及目标层状态等多维张量。研究者可借此复现几何分析,探索语言模型如何编码材料科学中的因果机制与结构关系,成为连接模型内部表征与外部物质世界的桥梁。
解决学术问题
该数据集的构建直面一个核心学术挑战:如何将语言模型的黑箱表征与可验证的物理机制回路相锚定。传统可解释性研究多聚焦于语法或常识推理,而材料科学领域复杂的实体关联与因果逻辑亟需专用基准。通过提供规范化的潜几何协议与验证清单,该数据集使研究者得以系统评估模型是否真正习得了材料失效、相变等机理的分布式表征,而非单纯记忆语料模式,推动了机械解译从定性走向量化。
衍生相关工作
该数据集催生了一系列前沿探索,其中最值得关注的是雅可比透镜技术的推广。配套发布的透镜库让研究者能跨层追踪材料相关概念的演变轨迹,并衍生出诸如语义子空间操纵、机制回路剪枝等研究方向。此外,该工作所确立的潜几何协议已成为评估大型模型在专业领域可解释性的范例,激励了化学、生物学等更广泛科学领域的类似数据集构建,形成了可复现的开放科学新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务