ELEMENTA
收藏资源简介:
ELEMENTA是一个大规模、低先验的密度泛函理论(DFT)弛豫轨迹数据集,用于原子机器学习。它提供了在明确化学空间边界内的连续覆盖,不同于从更大语料库中随机采样。公共发布版本是更大规模2.1亿帧ELEMENTA工作的一个组成完整子集,包含单质和二元化学系统以及化学计量系数总和最多为四的三元简化公式。数据集支持磁性状态和多态势能面研究。
ELEMENTA is a large-scale, low-prior density functional theory (DFT) relaxation trajectory dataset for atomistic machine learning. It offers continuous coverage within well-defined chemical space boundaries, unlike datasets randomly sampled from larger corpora. The public release version is a complete subset of the larger 210-million-frame ELEMENTA project, containing elemental and binary chemical systems, as well as simplified ternary formulas with the sum of stoichiometric coefficients up to four. This dataset supports investigations of magnetic states and multiple potential energy surfaces.
数据集概述
ELEMENTA 是一个大规模、低先验的密度泛函理论(DFT)弛豫轨迹数据集,专为原子级机器学习设计。与从大型语料库中随机采样不同,ELEMENTA Open 在明确的化学空间边界内提供连续覆盖。
数据集内容
| 档案 | 内容 | 帧数 |
|---|---|---|
ELEMENTA_open.extxyz.tar.zst |
主要 DFT 弛豫数据集 | 38,808,603 |
ELEMENTA_spin.extxyz.tar.zst |
自旋初始化结构与磁态 | 4,713,110 |
| 合计 | 43,521,713 |
主要发布版本涵盖:
- 所有一元和二元化学体系;
- 化学计量系数之和不超过四的三元简化分子式。
此公开版本是更大的 2.1 亿帧 ELEMENTA 数据集中成分完整的子集。自旋数据集支持对磁性和多态势能面的研究。
访问与格式
- 可从 Hugging Face 上的 ELEMENTA 数据集仓库 下载档案。
- 档案未存储在此 Git 仓库中。
- 数据结构使用扩展 XYZ(
extxyz)格式。 - 帧包含晶格向量、元素种类、位置、能量、力、应力、磁矩,以及
material、formula和structure等标识符。 - 弛豫元数据包括
ionic_step和nelm等字段;自旋帧可能额外包含spin。 - 建议使用流式读取器处理大文件。
仓库内容
| 文件/目录 | 说明 |
|---|---|
dataset/README.md |
数据集说明与访问链接 |
example/CrSb/ |
VASP 输入示例 |
figs/figure_toc.png |
概览图 |
pp/mp_relax_set_potcar_mapping.csv |
PBE PAW 势映射 |
script/gen_vasp.py |
VASP 输入生成器 |
script/pipeline_config.yaml |
工作流与 DFT 默认设置 |
script/task01_MAE.py |
能量 MAE 评估 |
script/task02_GS.py |
基态 top-1 评估 |
script/task03_rank.py |
精确全排序评估 |
评估
评估工具需要 Python 3.10 或更高版本,并从 JSONL 文件读取模型预测。
| 脚本 | 目的 | 所需预测字段 |
|---|---|---|
task01_MAE.py |
每结构和每原子的能量 MAE | ok, natoms, dft_energy_eV, pred_energy_eV |
task02_GS.py |
DFT 基态 top-1 选择 | 任务 01 字段加上 formula 和 frame_index 或 sample_index |
task03_rank.py |
每个分子式内的精确全排序 | 与任务 02 相同 |
VASP 输入
script/gen_vasp.py使用 pymatgen 的MPRelaxSet从 POSCAR/CONTCAR、CIF、XYZ 或 extxyz 结构生成自旋极化的 VASP 输入。- 支持弛豫、单点和分子动力学模式。
- 需要
pymatgen、PyYAML和ASE。 - 默认设置记录在
script/pipeline_config.yaml中,包括ENCUT = 520 eV、EDIFF = 1e-5 eV、EDIFFG = -0.05 eV/Å、NSW = 99和ISPIN = 2。 - POTCAR 映射记录在
pp/mp_relax_set_potcar_mapping.csv中。 - 许可的 VASP 赝势不随此仓库分发。
预期用途
ELEMENTA Open 支持:
- 原子模型训练与评估
- 能量和力预测
- 超出成分泛化
- 多晶型与基态识别
- 结构排序与生成
- 磁性态研究
引用与许可
- 使用本数据集时请引用 ELEMENTA: Toward Unbiased Scaling of Materials Data from First Principles。
- 完整报告和发布文档将提供最终书目条目、数据许可、DFT 协议和质量控制细节。
- ELEMENTA 项目已获得 VASP Software GmbH 的官方授权。VASP 软件和赝势的使用仍须遵守适用的许可条款。基于包含的 VASP 工作流程进行的计算也应引用相应的 VASP 方法论文。




