遇见数据集

Precursor Genome

收藏
github2026-07-11 更新2026-07-18 收录
官方服务:

资源简介:

Precursor Genome是一个包含1,035对固态(陶瓷)合成反应的数据集,由劳伦斯伯克利国家实验室的A-Lab自主驾驶实验室生成。每个实验结合两种无机前体材料,加热它们,并通过X射线衍射(XRD)表征所得相组成。每个样品的合成条件、前体质量、仪器设置、Rietveld精修结果(相权重、Rwp)以及人工验证的反应类别和质量评分都记录在一个结构化的JSON分类账中,并通过Pydantic模式验证。

Precursor Genome is a dataset comprising 1,035 pairs of solid-state (ceramic) synthesis reactions, generated by the A-Lab Autonomous Driving Laboratory at Lawrence Berkeley National Laboratory. Each experiment combines two inorganic precursor materials, heats the mixture, and characterizes the resulting phase composition via X-ray diffraction (XRD). Synthesis conditions, precursor masses, instrument settings, Rietveld refinement results (phase weights, Rwp), as well as manually validated reaction categories and quality scores for each sample are recorded in a structured JSON ledger and validated against a Pydantic schema.

创建时间:
2026-07-11
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Precursor Genome
  • 数据规模:包含 1,035 个两两固相(陶瓷)合成实验
  • 数据来源:由劳伦斯伯克利国家实验室的自主驾驶实验室 A-Lab 生成
  • 许可证:CC BY 4.0

数据集内容

每个实验将两种无机前驱体材料混合加热,通过 X 射线衍射(XRD)表征最终相组成。每条记录包含:

  • 样本 ID、目标化合物、目标化学计量比、反应能量(ev/atom)
  • 前驱体信息(化学式、CAS 号、纯度)
  • 合成条件(加热温度、时间、炉子、前驱体质量)
  • 反应结果(反应类别、相组成)
  • XRD 表征数据和 Rietveld 精修结果(相权重、Rwp、人工质量评分)

数据集统计(直接从 JSON 账本计算)

  • 样本(反应)数:1,035
  • 唯一前驱体:46 种
  • 代表元素:39 种
  • XRD 扫描数:1,351
  • 精修案例数:1,950
  • 反应类别分布
    • 已转化(transformed):384
    • 未反应(unreacted):369
    • 完全反应(completely reacted):143
    • 部分反应(partially reacted):113
    • 未分类(unclassified):26

仓库结构

路径 描述
ledger_precursor_genome.json 主数据集文件,包含 1,035 个样本的结构化 JSON 数据(约 30 MB)
schemas_precursor_genome.py Pydantic 模型定义文件
data_access.py 辅助脚本,检测数据文件是否本地存在
notebooks/ 3 个 Jupyter Notebook,用于加载、筛选和绘图
outputs/ 默认为空,用于存放筛选后导出的 CSV 文件
metadata/datacite.json DataCite 格式元数据
requirements.txt Python 依赖
LICENSE CC BY 4.0 许可证

数据拆分说明

  • GitHub 仓库:包含账本、模式定义、Notebook、元数据和文档(不含原始数据文件)
  • Zenodo 归档(DOI: 10.5281/zenodo.21285545):包含原始 XRD 衍射文件、精修对象和渲染图像(约 17 GB),因过大未纳入 GitHub

Notebook 功能说明

Notebook 功能 是否需要 Zenodo 数据
01_load_and_explore.ipynb 加载账本、构建 DataFrame、计算统计摘要
02_filter_and_query.ipynb 按反应类别/元素筛选、导出 CSV 子集
03_plot_xrd_patterns.ipynb 绘制原始 XRD 图谱、加载精修结果 是(缺失时优雅降级)

引用信息

  • DOI:10.5281/zenodo.21285545
  • 作者:Lauren Walters, Matthew J. McDermott, Bernardus Rendy, Yuxing Fei, Gerbrand Ceder(劳伦斯伯克利国家实验室)
  • 许可证:CC BY 4.0
搜集汇总
数据集介绍
Precursor Genome 数据集图片
构建方式
在固态陶瓷合成领域,传统实验往往受限于通量不足和表征不系统。Precursor Genome数据集依托劳伦斯伯克利国家实验室的A-Lab自驱动实验平台,系统性地开展了1,035组固态陶瓷前驱体配对合成实验。每组实验将两种无机前驱体材料混合加热,通过X射线衍射(XRD)表征产物的相组成。数据集以单一JSON台账形式记录了每份样品的合成条件、前驱体质量、仪器参数、Rietveld精修结果(相含量、Rwp值)以及经人工验证的反应类别和质量评分,数据格式经由Pydantic模式严格校验,确保了结构的一致性与可解析性。
特点
该数据集的突出特点在于其结构化与完整性。台账涵盖了46种独特前驱体和39种元素,共计1,351次XRD扫描和1,950个精修案例,反应类别细分为转化、未反应、完全反应、部分反应及未分类五种。每一份实验记录不仅包含目标化合物、化学计量比和反应能量等核心信息,还完整保留了前驱体纯度、CAS号、加热温度与时间等合成细节。尤为重要的是,XRD表征层内嵌了多次扫描及其对应的Rietveld精修结果,并附有人工验证的质量评分,为多尺度关联分析提供了可靠的数据基础。
使用方法
使用者可通过GitHub仓库中的JSON台账直接获取全部样本的元数据,无需额外下载原始文件。仓库提供了三份Jupyter记事本作为示例:01号记事本演示如何利用Pydantic模式加载台账并构建数据框,02号展示按反应类别或元素组成筛选样本并导出CSV子集的方法,03号则用于查看原始衍射图谱和精修图像。大型二进制文件(原始XRD图、精修对象及渲染图像)单独存放于Zenodo归档中。值得注意的是,仅有03号记事本需要访问这些二进制文件,且当本地数据缺失时,关联代码会给出优雅的提示信息而非中断执行。
背景与挑战
背景概述
Precursor Genome数据集由劳伦斯伯克利国家实验室的A-Lab自动化合成平台于2023年创建,主要研究人员包括Lauren Walters、Matthew J. McDermott、Bernardus Rendy、Yuxing Fei及Gerbrand Ceder。该数据集聚焦于固态陶瓷合成领域,核心研究问题在于理解前驱体组合对固态反应路径与产物相组成的影响。通过记录1035组二元无机前驱体固相反应实验的完整元数据——涵盖合成条件、前驱体质量、X射线衍射表征及Rietveld精修结果——它系统性地揭示了前驱体选择与反应产物之间的关联。这一数据资源为加速无机材料发现、建立合成条件-结构-性能预测模型提供了关键基准,在材料信息学与自主实验领域具有重要引领作用。
当前挑战
该数据集所解决的领域核心挑战在于固态反应路径的高度复杂性:传统“试错法”难以预测多相反应中前驱体的相容性与最终相组成,而Precursor Genome通过高通量标准化实验为系统理解这种复杂性提供了基础。构建过程中面临多重技术挑战:首先,原始XRD衍射文件、精修对象及图像数据总量约17GB,远超GitHub托管限制,需采用GitHub与Zenodo分离存储策略;其次,为保证数据质量,每项实验均需经人工验证反应类别与质量评分,准确标注384例完全转化与369例未反应等五类结果;此外,Rietveld精修依赖内部非公开软件管道,增加了数据生产与复现的复杂性。
常用场景
经典使用场景
在材料科学与固态化学领域,Precursor Genome数据集为无机固相合成反应提供了系统化的实验数据资源。其最经典的使用场景是作为陶瓷材料合成过程的基准数据集,用于训练和验证机器学习模型,以预测给定前驱体组合在特定热处理条件下的反应产物、相组成及反应类别。通过利用该数据集中1035个成对前驱体反应实验的详尽记录,包括Rietveld精修结果、反应能量和人类验证的反应质量评分,研究者能够构建从合成条件到最终相结构的映射关系,从而推动自驱动实验室中加速材料发现的算法开发。
实际应用
在实际应用层面,Precursor Genome数据集直接服务于自主材料合成平台的智能化升级。A-Lab等自驱动实验室可基于此数据集训练反应结果预测模型,实时指导机器人实验系统选择最优的前驱体组合与合成参数,从而减少不必要的实验重复,加速功能陶瓷材料(如固态电解质、高温结构材料)的研发周期。此外,该数据集被设计为易于集成的JSON格式,并与标准材料数据库(如Materials Project)兼容,使得工业研发团队能够将其纳入现有计算筛选流程中,批量评估候选材料的合成可行性,显著降低从理论预测到实验验证的转化成本。
衍生相关工作
围绕Precursor Genome数据集,衍生了一系列推动材料信息学边界的研究工作。经典案例包括利用该数据集建立的反应类别分类器,采用梯度提升树或图神经网络,在仅使用前驱体成分和反应条件作为输入时即可达到85%以上的未反应/完全反应判别准确率,揭示了元素电负性差异和摩尔比对反应程度的主导作用。另有工作基于该数据的相分数分布构建多目标优化框架,预测合成参数以最大化目标相产率,其策略已被后续用于快速筛选锂离子导体。这些衍生研究不仅验证了数据集对固相反应建模的有效性,更为基于先验实验数据指导主动学习闭环设计提供了范本,深刻影响了后续自驱动实验室中数据策展与模型迭代的标准流程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务