遇见数据集

phonon_scoring_json_cif_bundle_seed20260605_allgen

收藏
github2026-07-03 更新2026-07-05 收录
官方服务:

资源简介:

该数据集用于PhononScore实验,包含四个主要分割:pretrain(133,389条记录,使用MatterSim声子标签从生成的晶体候选结构和MP40结构中获取)、dft_posttrain(8,221条记录,使用DFT-PBE声子标签用于将PhononScore后训练为PhononScore-DFT)、test_mp20_8models(8,000条记录,来自八个MP20晶体生成模型的生成结构)和test_dft_pbe_balanced(1,000条记录,平衡的DFT-PBE测试集,包含500个稳定和500个不稳定结构)。数据集存档于Zenodo,旨在重现训练/测试分割和评估分析。

This dataset is designed for the PhononScore experiment and includes four main splits: 1. pretrain: 133,389 records, obtained from generated crystal candidate structures and MP40 structures using phonon labels from MatterSim; 2. dft_posttrain: 8,221 records, which use DFT-PBE phonon labels to fine-tune PhononScore into PhononScore-DFT; 3. test_mp20_8models: 8,000 records, consisting of generated structures from eight MP20 crystal generative models; 4. test_dft_pbe_balanced: 1,000 records, a balanced DFT-PBE test set containing 500 stable and 500 unstable structures. The dataset is archived on Zenodo to enable reproducibility of the train/test splits and corresponding evaluation analyses.

创建时间:
2026-06-08
原始信息汇总

数据集概述

PhononScore 是一个面向晶体材料快速动力学稳定性排序的声子感知评分函数,以CIF结构文件为输入,在开销较大的声子计算之前输出连续评分,用于候选池重排序。

数据集来源与归档

  • 归档位置:Zenodo(https://zenodo.org/records/21157982
  • 归档文件phonon_scoring_json_cif_bundle_seed20260605_allgen.zip
  • 内容:包含四个主要数据划分(seed20260605)及其对应的CIF文件,每个划分目录包含原始JSON清单、cifs/子文件夹(含复制的CIF文件)和local_manifest.jsoncif_path指向本地CIF,original_cif_path保留原始路径)。

数据集划分与规模

划分 记录数 说明
pretrain 133,389 来自生成晶体候选和MP40结构的MatterSim声子标签,用于预训练PhononScore。
dft_posttrain 8,221 DFT-PBE声子标签,用于将PhononScore后训练为PhononScore-DFT。
test_mp20_8models 8,000 来自八个MP20晶体生成模型的保留生成结构,用于测试。
test_dft_pbe_balanced 1,000 平衡的DFT-PBE保留测试集,包含500个稳定结构和500个不稳定结构。

数据集用途

  • 主要用于复现论文中的训练/测试划分及评估分析。
  • 模型检查点与示例CIF文件已包含在GitHub仓库中,不要求用户下载该数据集即可运行快速推理示例。

解压方式

bash unzip phonon_scoring_json_cif_bundle_seed20260605_allgen.zip

输出评分字段

  • id:输入CIF stem,用于排序/报告。
  • cif_pathcif_namecif_stem:传递给评分器的文件路径、名称、stem。
  • resolved_cif_pathresolved_cif_nameresolved_cif_stem:解析符号链接后的原始CIF路径/名称/stem,用于追踪基准子集文件。
  • prediction:最小声子频率回归头输出。
  • threshold_score:多阈值稳定性头部的平均概率。
  • pair_geometry_score:MDN几何分支的周期性局部几何对数似然。
  • final_score:使用训练时内部权重的原始检查点评分。
  • standardized_score:经z-score归一化后的候选池重排序评分。对于单个CIF,因无法校准z-score,显示为NA

默认重排序公式(针对候选池)

standardized_score = z(prediction) + 2.0 * z(threshold_score) + 0.25 * z(pair_geometry_score)

搜集汇总
数据集介绍
phonon_scoring_json_cif_bundle_seed20260605_allgen 数据集图片
构建方式
PhononScore数据集的构建源自对晶体材料动力稳定性的快速筛选需求,旨在为昂贵声子计算前的候选材料提供优先级排序。该数据集以种子编号seed20260605为基础,整合了四个主要数据划分:预训练集包含133,389条来自MatterSim声子标签的生成晶体候选及MP40结构数据;DFT后训练集包含8,221条DFT-PBE声子标签数据,用于将PhononScore微调为PhononScore-DFT;测试集包含来自八种MP20晶体生成模型的8,000个留出结构,以及由500个稳定与500个不稳定结构构成的平衡DFT-PBE留出测试集。每个划分目录均包含原始JSON清单、CIF文件副本及指向本地CIF的清单文件,确保了数据复现的完整性与可追溯性。
特点
该数据集的核心特点在于其声子感知评分机制的创新性应用,通过结合预训练与后训练策略,实现了对晶体材料动力稳定性的连续评分。数据集中每个划分均保留了原始CIF路径与本地路径的双重索引,便于溯源与复现实验。数据集规模均衡,测试集特别设计了平衡的稳定/不稳定结构比例,避免了模型对某一类别的偏向。此外,数据集与PhononScore模型紧密结合,支持直接用于模型训练、测试与评估分析,无需额外预处理流程。
使用方法
使用该数据集时,首先需从Zenodo下载压缩包并通过unzip命令解压。数据集与PhononScore代码库配合使用,用户可通过配置conda环境激活phononscore环境后,直接运行推理脚本。对于CIF文件夹的评分,支持GPU与CPU两种模式,通过调整模型类型(phononscore_pretrain或phononscore_dft)、设备与批次大小灵活调用。脚本输出包含详细评分指标的CSV文件与记录模型参数、吞吐量等信息的TXT文件。若需在候选材料库中进行重排序,可使用standardized_score字段,该分数融合了预测值、阈值分数与几何分数的Z-score,用于提升动力稳定材料在排名中的优先级。
背景与挑战
背景概述
PhononScore数据集的诞生,根植于计算材料科学领域对晶体材料动力学稳定性高效评估的迫切需求。传统的基于密度泛函理论(DFT)的声子计算方法虽精度高,但计算成本高昂,难以大规模筛选候选材料。该数据集由研究团队于特定时间(基于seed20260605划分)创建,核心研究人员依托MatterSim模拟与DFT-PBE计算,构建了包含预训练(133,389条)、DFT后训练(8,221条)及多元测试子集的综合资源。通过引入声子感知评分函数,数据集旨在解决从生成式模型输出的海量晶体结构候选池中快速排序动力学稳定性的核心问题,显著降低后续昂贵声子计算的前置筛选成本,对材料基因组学与高通量材料筛选领域产生了深远影响。
当前挑战
该数据集面临的核心挑战主要集中于两大层面。在领域问题层面,尽管PhononScore能高效排序,但本质上仍为替代模型,无法完全替代MatterSim或DFT声子计算的绝对验证,候选材料的最终动力学稳定性仍需后续精确计算确认,存在误判风险。在构建过程中,预训练数据依赖MatterSim产生的声子标签,其准确性与泛化性受限于模拟方法本身;DFT后训练数据仅涵盖8,221条记录,样本量有限,可能难以充分代表多样化的晶体畸变模式。此外,不同来源数据的格式统一、CIF文件的路径解析与批量化处理中的鲁棒性,以及评分函数中多分支头(预测、阈值、几何)权重的经验标定,均构成了技术层面的严峻挑战。
常用场景
经典使用场景
在晶体材料的高通量筛选领域, PhononScore 数据集最经典的使用场景是作为候选材料池的快速动力学稳定性重排序工具。该数据集包含从 MatterSim 声子标签和 MP40 结构中提取的超过十三万条预训练记录,以及经 DFT-PBE 声子计算精修的后训练数据。研究者可将任意 CIF 格式的晶体结构输入模型,通过结合最小声子频率预测、多阈值稳定性概率和周期几何似然度,计算出一个连续的标准化分数。这一分数能够有效提升动力学稳定结构在候选列表顶部的富集程度,从而大幅降低后续对大量候选进行昂贵声子计算的需求。该流程特别适用于材料基因组学和高通量虚拟筛选,能够在数分钟内对成千上万个晶体结构进行初步的动力学稳定性评估,为后续的精确验证提供精选的优先候选项。
实际应用
PhononScore 数据集在实际科研与工业场景中具有广泛的应用价值。在新型热电材料、光伏材料以及锂离子电池电极材料的探索中,动力学不稳定性常常导致实验室合成失败。通过 PhononScore 快速评分,研究者可以在数小时内从数千个候选结构中筛选出热力学稳定且动力学可行的材料,显著降低实验试错成本。在工业界,该工具可集成至自动化材料发现平台中,作为高通量计算与实验验证之间的高效过滤器。例如,在计算模拟生成大量假设晶体结构后,PhononScore 能够自动剔除声子软模结构,将候选列表缩减至合理规模,再由 DFT 声子计算进行精确验证。这一流程已在多个材料基因组学项目中得到验证,展示了其在缩短新材料研发周期方面的巨大潜力。
衍生相关工作
PhononScore 数据集的发布催生了一系列衍生研究工作。最直接的是 PhononScore-DFT 模型,它通过在 DFT-PBE 声子标签上进行后训练,进一步提升了评分函数在精确计算数据上的泛化能力。该数据集还支持了多阈值稳定性头部网络的设计创新,使得模型能够对不同振动频率范围的稳定性进行概率预测。此外,数据集中包含的平衡测试集(稳定与不稳定结构各 500 个)为后续动力学稳定性评分方法的基准测试提供了标准化评估平台。围绕该数据集,社区发展出了晶体图神经网络与周期性几何似然度结合的混合架构,以及基于 Z-score 归一化的候选池重排序策略。这些工作共同推动了材料信息学中动力学筛选方法的发展,为将机器学习直接应用于声子尺度属性预测开辟了新的路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务