遇见数据集

ELEMENTA

收藏
github2026-07-27 更新2026-07-29 收录
官方服务:

资源简介:

ELEMENTA是一个大规模、低先验的密度泛函理论(DFT)弛豫轨迹数据集,用于原子机器学习。它提供了在明确化学空间边界内的连续覆盖,不同于从更大语料库中随机采样。公共发布版本是更大规模2.1亿帧ELEMENTA工作的一个组成完整子集,包含单质和二元化学系统以及化学计量系数总和最多为四的三元简化公式。数据集支持磁性状态和多态势能面研究。

ELEMENTA is a large-scale, low-prior density functional theory (DFT) relaxation trajectory dataset for atomistic machine learning. It offers continuous coverage within well-defined chemical space boundaries, unlike datasets randomly sampled from larger corpora. The public release version is a complete subset of the larger 210-million-frame ELEMENTA project, containing elemental and binary chemical systems, as well as simplified ternary formulas with the sum of stoichiometric coefficients up to four. This dataset supports investigations of magnetic states and multiple potential energy surfaces.

创建时间:
2026-07-22
原始信息汇总

数据集概述

ELEMENTA 是一个大规模、低先验的密度泛函理论(DFT)弛豫轨迹数据集,专为原子级机器学习设计。与从大型语料库中随机采样不同,ELEMENTA Open 在明确的化学空间边界内提供连续覆盖。

数据集内容

档案 内容 帧数
ELEMENTA_open.extxyz.tar.zst 主要 DFT 弛豫数据集 38,808,603
ELEMENTA_spin.extxyz.tar.zst 自旋初始化结构与磁态 4,713,110
合计 43,521,713

主要发布版本涵盖:

  • 所有一元和二元化学体系;
  • 化学计量系数之和不超过四的三元简化分子式。

此公开版本是更大的 2.1 亿帧 ELEMENTA 数据集中成分完整的子集。自旋数据集支持对磁性和多态势能面的研究。

访问与格式

  • 可从 Hugging Face 上的 ELEMENTA 数据集仓库 下载档案。
  • 档案未存储在此 Git 仓库中。
  • 数据结构使用扩展 XYZ(extxyz)格式。
  • 帧包含晶格向量、元素种类、位置、能量、力、应力、磁矩,以及 materialformulastructure 等标识符。
  • 弛豫元数据包括 ionic_stepnelm 等字段;自旋帧可能额外包含 spin
  • 建议使用流式读取器处理大文件。

仓库内容

文件/目录 说明
dataset/README.md 数据集说明与访问链接
example/CrSb/ VASP 输入示例
figs/figure_toc.png 概览图
pp/mp_relax_set_potcar_mapping.csv PBE PAW 势映射
script/gen_vasp.py VASP 输入生成器
script/pipeline_config.yaml 工作流与 DFT 默认设置
script/task01_MAE.py 能量 MAE 评估
script/task02_GS.py 基态 top-1 评估
script/task03_rank.py 精确全排序评估

评估

评估工具需要 Python 3.10 或更高版本,并从 JSONL 文件读取模型预测。

脚本 目的 所需预测字段
task01_MAE.py 每结构和每原子的能量 MAE ok, natoms, dft_energy_eV, pred_energy_eV
task02_GS.py DFT 基态 top-1 选择 任务 01 字段加上 formulaframe_indexsample_index
task03_rank.py 每个分子式内的精确全排序 与任务 02 相同

VASP 输入

  • script/gen_vasp.py 使用 pymatgen 的 MPRelaxSet 从 POSCAR/CONTCAR、CIF、XYZ 或 extxyz 结构生成自旋极化的 VASP 输入。
  • 支持弛豫、单点和分子动力学模式。
  • 需要 pymatgenPyYAMLASE
  • 默认设置记录在 script/pipeline_config.yaml 中,包括 ENCUT = 520 eVEDIFF = 1e-5 eVEDIFFG = -0.05 eV/ÅNSW = 99ISPIN = 2
  • POTCAR 映射记录在 pp/mp_relax_set_potcar_mapping.csv 中。
  • 许可的 VASP 赝势不随此仓库分发。

预期用途

ELEMENTA Open 支持:

  • 原子模型训练与评估
  • 能量和力预测
  • 超出成分泛化
  • 多晶型与基态识别
  • 结构排序与生成
  • 磁性态研究

引用与许可

  • 使用本数据集时请引用 ELEMENTA: Toward Unbiased Scaling of Materials Data from First Principles
  • 完整报告和发布文档将提供最终书目条目、数据许可、DFT 协议和质量控制细节。
  • ELEMENTA 项目已获得 VASP Software GmbH 的官方授权。VASP 软件和赝势的使用仍须遵守适用的许可条款。基于包含的 VASP 工作流程进行的计算也应引用相应的 VASP 方法论文。
搜集汇总
数据集介绍
ELEMENTA 数据集图片
构建方式
ELEMENTA数据集是基于密度泛函理论(DFT)弛豫轨迹构建的大规模、低先验原子机器学习数据集。其构建策略并非从更大语料库中随机采样,而是在明确的化学空间边界内实现连续覆盖。主发布版本涵盖所有单质与二元化学体系,以及化学计量系数之和不超过四的三元简化式结构。该公开版本是包含2.1亿帧的完整ELEMENTA项目的一个组分完备子集,此外还包含一个自旋初始化结构与磁态子集,用于支持磁性势能面研究。
特点
该数据集的显著特点在于其组分完备性与化学空间覆盖的连续性,突破了传统随机采样的局限性。总帧数超过4350万,其中主数据集包含3880万帧DFT弛豫轨迹,自旋子集额外提供471万帧。数据结构采用扩展XYZ格式,涵盖晶格矢量、原子种类与坐标、能量、力、应力、磁矩等关键物理量,并包含弛豫元数据如离子步数和电子步数。自旋帧可额外提供磁态信息,为多态势能面研究提供支撑。
使用方法
用户可通过Hugging Face仓库下载压缩包,并使用zstd解压工具完成数据提取。推荐采用ASE库的流式读取器(iread)逐帧处理大规模文件,避免内存溢出。官方提供三项标准化评估脚本:task01_MAE计算能量平均绝对误差,task02_GS执行基态择优选择,task03_rank实现精确全排序。实验需生成JSONL格式预测文件,包含能量、原子数、配方及帧索引等必需字段。此外,gen_vasp.py脚本可基于pymatgen自动生成自旋极化VASP输入文件,支持弛豫、单点与分子动力学多种计算模式。
背景与挑战
背景概述
ELEMENTA数据集由Kairos Material研究团队于近期创建,旨在为原子尺度机器学习提供大规模、低先验知识的密度泛函理论(DFT)弛豫轨迹数据集。该数据集不同于从大型语料库中随机采样的方式,而是通过明确化学空间边界实现连续覆盖,涵盖了所有单质和二元化学体系以及化学计量系数之和不超过四的三元简化式。其核心研究问题在于推动材料科学中机器学习模型的训练与评估,特别是在能量与力预测、多晶型识别、基态确定及磁性状态研究等方面。ELEMENTA作为更大规模2.1亿帧数据集的公开子集,提供了约4352万帧结构数据,为材料AI基础模型的无偏缩放奠定了重要数据基础,对材料信息学领域具有深远的影响力。
当前挑战
ELEMENTA数据集所解决的领域挑战主要包括:1)材料科学中机器学习模型对高质量、大规模、连续化学空间覆盖的第一性原理计算数据的迫切需求,传统数据集常因稀疏采样或实验噪声限制模型泛化能力,而ELEMENTA通过系统覆盖明确化学空间边界,克服了数据不连续带来的外推难题;2)弛豫轨迹数据中能量、力、应力及磁矩等多物理量的联合预测问题,要求模型同时捕获结构弛豫过程中的复杂能量景观与磁性状态变化。在构建过程中,数据集面临了以下挑战:1)高精度DFT计算的庞大数据量与计算资源需求,需平衡计算精度与数据规模;2)多源结构数据的格式统一与元数据标注,确保所有帧包含一致的晶格矢量、原子种类、位置及弛豫参数;3)海量数据的高效压缩与流式读取支持,以应对近4400万帧结构的存储与访问瓶颈。
常用场景
经典使用场景
在原子尺度机器学习领域,ELEMENTA数据集的核心价值在于其为训练和评估原子间势能模型提供了海量且连续覆盖的低先验密度泛函理论弛豫轨迹。该数据集囊括了所有单质与二元化学体系,并延伸至化学计量系数之和不超过四的三元简化分子式,从而在明确的化学空间边界内实现了成分完备的采样。研究者常利用该数据集构建通用型原子间势能模型,通过大量能量、力及应力标签的监督学习,提升模型对未见过成分与结构的预测泛化能力。此外,其丰富的弛豫元数据还支持对模型在势能面探索中的动态行为进行系统性评估。
衍生相关工作
ELEMENTA数据集的发布催生了一系列典范性的衍生研究工作。首先,它直接赋能了对现有主流机器学习势函数模型(如MACE、NequIP、CHGNet)在成分外推任务上的系统性横向比较与消融研究,确立了全新且更为严格的基准评估范式。其次,研究者基于该数据集的成分完备特性,发展了若干用于主动学习与数据采样优化的算法,以最小的数据获取成本最大化势能面的覆盖精度。在预训练策略方面,ELEMENTA助推了大规模原子基础模型的涌现,例如通过对比学习和掩码建模,从弛豫轨迹中预训练通用的结构表示,进而微调至下游的力场任务。此外,该数据集还为探索新颖的图神经网络架构(如面向动态弛豫过程的时域信息融合)提供了理想的数据实验平台。
数据集最近研究
最新研究方向
ELEMENTA数据集的发布标志着材料科学人工智能领域向无偏规模化迈出了关键一步。该数据集包含超过4300万帧密度泛函理论弛豫轨迹,覆盖所有一元和二元化学体系及部分三元化学组分,为原子级机器学习提供了前所未有的连续化学空间覆盖。当前前沿研究方向聚焦于利用ELEMENTA进行原子模型训练与能量、力预测,尤其是在外推至未见组分时的泛化能力提升。此外,该数据集支持多晶型识别、基态预测及磁态研究,与近期材料基因组学和自主实验发现的热点事件紧密关联。其影响在于推动材料AI从依赖随机采样转向系统化组分空间探索,显著降低先验偏差,为高通量虚拟筛选和逆向材料设计奠定数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务