遇见数据集

gemma4-materials-mechanism-prompts

收藏
Hugging Face2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

Gemma 4 Materials-Mechanism Prompt Corpus 是一个用于研究开放权重语言模型中材料科学机制表示可解释性的提示词数据集。它收集了论文《Reading and Steering Materials Science-Mechanism Representations in an Open-Weight Language Model》中使用的精确科学提示词和相关元数据,旨在作为提示词和协议资源,而非现成的训练集。数据集通过21个Hugging Face配置进行组织,涵盖历史开发提示词、冻结评估、证伪测试和探索性后续研究,总计3,047行(提示词出现次数)。所有配置共享统一的字段结构,包括`system_prompt`、`user_prompt`、`expected_answer`、`answer_options`等模型交互文本,以及`family_id`、`domain`、`relation`、`law_id`等科学分组和关系物理元数据,还包含`prompt_role`、`evidence_status`、`split`等实验角色信息。数据规模在1K到10K之间,适用于问答和文本分类任务,具体场景包括材料科学机制表示的可读性分析、因果干预实验、关系物理推理以及探索性边界研究。数据集强调其特定研究范围,预期标签不应被视为超出原论文范围的专家评审事实,若用于训练需注意避免数据污染。数据集以CC-BY-4.0许可证发布,语言为英语,关联模型为google/gemma-4-E4B-it。

Gemma 4 Materials-Mechanism Prompt Corpus is a prompt dataset for studying the interpretability of materials science mechanism representations in open-weight language models. It collects exact scientific prompts and registered metadata used in the paper Reading and Steering Materials Science-Mechanism Representations in an Open-Weight Language Model, intended as a prompt and protocol resource rather than a ready-made training set. The dataset is organized via 21 Hugging Face configurations, covering historical development prompts, frozen evaluations, falsification tests, and exploratory follow-up studies, totaling 3,047 rows (prompt occurrences). All configurations share a unified field structure, including model interaction text such as `system_prompt`, `user_prompt`, `expected_answer`, `answer_options`, as well as scientific grouping and relational physics metadata like `family_id`, `domain`, `relation`, `law_id`, and experimental role information such as `prompt_role`, `evidence_status`, `split`. The data scale ranges from 1K to 10K, suitable for question answering and text classification tasks, with specific scenarios including readability analysis of materials science mechanism representations, causal intervention experiments, relational physics reasoning, and exploratory boundary studies. The dataset emphasizes its specific research scope, and expected labels should not be considered as expert-reviewed facts beyond the original papers context; caution is needed to avoid data contamination if used for training. It is released under the CC-BY-4.0 license, in English language, and associated with the model google/gemma-4-E4B-it.

创建时间:
2026-07-22
原始信息汇总

数据集概述

Gemma 4 Materials-Mechanism Prompt Corpus 是一个为研究材料科学机理表示而设计的提示词(prompt)数据集,由 Markus J. Buehler 创建。该数据集用于论文 “Reading and Steering Representations of Materials-Science Mechanisms in an Open-Weight Language Model”,专门用于探究开放权重语言模型(google/gemma-4-E4B-it)在材料科学领域的因果干预与可解释性。

  • 语言:英语
  • 许可证:Creative Commons Attribution 4.0 International(CC-BY-4.0)
  • 任务类别:问答、文本分类
  • 数据规模:1,000 < n < 10,000 条
  • 标签:材料科学、机械可解释性、因果干预、科学推理

数据集结构与配置

数据集共包含 21 个配置(configurations),总计 3,047 条提示。每个配置对应不同的实验目的和证据状态。所有配置共享相同的字段模式(schema),包括系统提示、用户提示、预期答案、答案选项、科学分组元数据、角色、证据状态与分割等。

可读性与开放词汇解释

配置名称 行数 目的 证据状态
readability_heldout 50 控制词汇与开放词汇的隐藏状态读出 冻结的保留集
readability_development_122 122 早期开发阶段的异质读出集 仅开发,非总体证据
option_free_questions 72 自然问题,无可见答案选项 冻结的现有队列
automated_interpreter 5 用于分类发现的词汇集的盲审提示 回顾性二次分析
lexical_adversarial_discovery 72 分离词汇表面线索与物理关系的匹配提示 冻结的发现队列
lexical_adversarial_replication 72 对词汇对抗设计的独立复制 冻结的复制集
answer_code_binding 72 A/B 答案代码控制的预期性证伪测试 失败的操控检查,已如实报告

因果干预

配置名称 行数 目的 证据状态
steering_initial_pilot 15 早期 A/B 干预试验 仅开发,非主要证据
steering_layer_selection 18 用于初步层比较的校准提示 仅开发,用于层选择
steering_preliminary_confirmation 24 早期 A/B 确认提示 仅开发,非主要证据
steering_direction_fit 9 每个机理家族三个提示,用于拟合干预方向 冻结的方向拟合集
steering_broad_screen 60 30 种物理条件,包含两种答案顺序 冻结的确认性筛选
steering_grain_confirmation 24 预期的晶粒细化/粗化接收器,包含两种答案顺序 冻结的预期性确认

关系物理

配置名称 行数 目的 证据状态
relational_development 128 16 条定律的初始队列,用于开发关系状态分析 仅开发
relational_fresh_screen 256 开发分析后的新一轮 16 条定律筛选 冻结的新鲜筛选
relational_disjoint_confirmation 192 12 条定律的独立确认 冻结的确认
relational_final_60 960 60 条本构定律,包含中性、直接、反向条件及匹配的答案顺序控制 冻结的最终基准

探索性边界与组合研究

配置名称 行数 目的 证据状态
symbolic_monotonicity_pilot 128 符号单调性试验 探索性开发
symbolic_equivalence_pilot 256 符号等价试验 探索性开发
abstract_physics_composition 256 抽象代码组合后续研究 探索性后续
abstract_physics_semantic 256 语义组合后续研究 探索性后续

数据加载方式

可使用 Hugging Face datasets 库按配置逐次加载。示例代码如下:

python from datasets import load_dataset

heldout = load_dataset("lamm-mit/gemma4-materials-mechanism-prompts", "readability_heldout", split="test") final_laws = load_dataset("lamm-mit/gemma4-materials-mechanism-prompts", "relational_final_60", split="test")

相关资源

引用信息

论文正在准备投稿中。待档案标识符可用后,请引用论文及本数据集发布。当前可引用 arXiv 预印本:

@misc{buehler2026readingsteeringrepresentationsmaterialsscience, title={Reading and Steering Representations of Materials-Science Mechanisms in an Open-Weight Language Model}, author={Markus J. Buehler}, year={2026}, eprint={2607.20058}, archivePrefix={arXiv}, primaryClass={cs.AI}, url={https://arxiv.org/abs/2607.20058}, }

搜集汇总
数据集介绍
gemma4-materials-mechanism-prompts 数据集图片
构建方式
该数据集源自一篇关于开放权重语言模型中材料科学机制表征的研究,由Markus J. Buehler构建。数据集并非简单的文本集合,而是作为一项严谨科学实验的提示与协议资源,包含了研究中所使用的确切科学提示及其注册元数据。其构建方式遵循实验设计逻辑,将历史开发提示、冻结评估集、证伪测试以及探索性后续实验有序组织为21个独立的Hugging Face配置,避免了将不同性质的数据混为一谈。每个配置均明确了其证据状态(如开发集、冻结集、确认集或探索集),并保留了完整的提示构建记录,确保实验的可重复性与可追溯性。
特点
该数据集的核心特点在于其精细的实验结构化与丰富的元数据标注。它并非一个通用的训练集,而是专为研究语言模型内部表征和因果干预而设计的精准工具。数据集覆盖了可读性评估、因果转向、关系物理以及边界探索等多个维度,每个配置都承载着特定的实验目的与证据角色。所有样本共享一个统一的字段架构,详细记录了系统提示、用户提示、预期答案、科学分组信息、关系属性及答案顺序等。尤为关键的是,数据集提供了稳定的链接以追溯至原始仓库工件,并排除了模型生成的响应,确保了数据的纯净与协议的权威性。
使用方法
研究者可通过Hugging Face的datasets库便捷地加载数据,建议根据研究目标按需选取单一配置进行使用。例如,可使用`load_dataset`函数指定配置名称(如`readability_heldout`或`relational_final_60`)并设置相应的split(如`test`)来获取冻结的评估集。由于不同配置在证据状态上存在明确区分,用户应严格遵循其原始设计意图:开发集可用于方法探索,而冻结集则应用于最终评估。数据集还提供了重建与验证脚本,鼓励使用者通过运行`scripts/build_hf_prompt_dataset.py`等工具来校验数据的完整性,以确保复现研究的准确性。
背景与挑战
背景概述
该数据集由Markus J. Buehler于2026年创建,隶属于麻省理工学院,旨在探究开放权重语言模型(如Gemma 4)内部材料科学机制的神经表征。核心研究问题聚焦于能否从语言模型隐藏状态中读取并操纵材料行为相关的物理概念,例如本构关系与因果干预。数据集收录了超过3000条精准科学提示,覆盖可读性分析、因果转向、关系物理及边界探索等21个配置,为机械可解释性领域提供了系统化的实验协议。其影响力体现在将材料科学与可解释AI交叉,建立了可复现的提示构建与验证框架,推动了语言模型在科学推理中的透明化应用。
当前挑战
该数据集面临的挑战包括:1) 如何确保语言模型对材料科学概念的内部表征真实反映物理关系,而非依赖表面词汇线索,为此设计了词汇对抗性提示与假说检验来分离因果机制;2) 构建过程中需平衡实验设计的可复现性与探索灵活性,通过将提示分为开发集、冻结集、确认集和探索集来维护证据层级,同时确保不同配置间的提示不产生统计依赖;3) 避免数据污染对后续研究的影响,要求使用者在报告时明确标注数据复用情况,以维持基准的清洁性。
常用场景
经典使用场景
该数据集主要用于材料科学领域中的语言模型可解释性研究,其经典使用场景是作为受控实验的提示集合,用于探测和引导大语言模型内部对材料科学机制的隐式表征。研究者借助该数据集中精心设计的科学提示,通过隐藏状态读取、因果干预和关系物理分析等手段,系统性地探究模型如何编码诸如应力-应变关系、断裂机制等核心材料知识。数据集明确划分了开发集、冻结测试集和探究性随访集,确保实验的可重复性和证据层次的清晰性,成为连接材料科学知识与机械可解释性研究的理想平台。
解决学术问题
该数据集直面材料科学领域中一个关键学术难题:如何揭示并验证预训练语言模型内部是否形成了具有物理一致性的材料机制表征。传统方法多依赖模型输出表面的正确性,而忽略了内部推理过程的可靠性。该数据通过设计包括对抗性测试、关系物理基准和转向干预实验在内的多层次评估体系,解决了模型表征的因果性与鲁棒性问题。其意义在于为理解大模型在科学知识上的泛化边界提供了方法论基础,推动了从单纯评估模型答案正确性到验证其内部物理推理一致性的学术范式转变。
衍生相关工作
该数据集的发布催生了一系列方法论上的经典衍生工作。其核心贡献在于提出了一个完整的材料科学可解释性研究范式,包括雅可比透镜分析、激活空间中的转向向量拟合,以及基于图同构网络的关系物理基准测试。研究者基于该数据集的提示架构和实验协议,拓展了对模型内部社区结构的分析,并开发了用于监控模型科学推理一致性的自动化解释器。此外,该工作还提供了经过严格分层的实验证据标准,为后续在多个科学领域内构建类似的高保真可解释性数据集确立了重要参考框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务