遇见数据集
官方服务:

资源简介:

Cu-Au DFT训练数据是一个用于机器学习原子间势(MLIPs)训练和基准测试的材料科学数据集。它包含约96,000个小型(每个晶胞含1-8个原子)的周期性铜、金和铜-金合金结构。每个结构都提供了通过密度泛函理论计算的总能量(以电子伏特eV为单位)和原子力(以eV/Å为单位)。数据集的独特之处在于,基于相同的结构生成协议,提供了使用三种不同交换关联泛函(PBE、LDA和R2SCAN)进行计算的结果,形成了三个独立的子集(配置)。这些子集(pbe、lda、r2scan)分别包含约32,000个结构,总计约53万个原子数据点。结构覆盖了从纯铜、纯金到铜-金混合的各种组成,并特意包含了高度畸变和高能量的构型,以确保训练的原子间势具有鲁棒性。每个数据样本包含结构标识符、化学符号列表、原子序数列表、原子笛卡尔坐标(单位Å)、晶胞向量(单位Å)、DFT总能(单位eV)、原子力(单位eV/Å)和原子数。所有计算均使用VASP软件完成,平面波截断能为550eV。该数据集适用于开发、训练和评估针对铜、金及其合金的机器学习原子间势模型,也可用于比较不同DFT泛函对计算结果的影响。

Cu-Au DFT Training Data is a materials science dataset for training and benchmarking machine-learned interatomic potentials (MLIPs). It contains approximately 96,000 small (1-8 atoms per unit cell) periodic structures of copper (Cu), gold (Au), and copper-gold (Cu-Au) alloys. For each structure, the dataset provides total energy (in electron volts, eV) and atomic forces (in eV/Å) calculated using density functional theory (DFT). The uniqueness of this dataset lies in its provision of results computed with three different exchange-correlation functionals (PBE, LDA, and R2SCAN) based on the same structural generation protocol, forming three independent subsets (configurations). These subsets (pbe, lda, r2scan) each contain approximately 32,000 structures, totaling about 530,000 atomic data points. The structures cover compositions ranging from pure Cu and pure Au to Cu-Au mixtures, and intentionally include highly distorted and high-energy configurations to ensure the robustness of trained interatomic potentials. Each data sample includes the following fields: structure identifier (name), list of chemical symbols (symbols), list of atomic numbers (numbers), atomic Cartesian coordinates (positions, in Å), unit cell vectors (cell, in Å), DFT total energy (energy, in eV), atomic forces (forces, in eV/Å), and number of atoms (number_of_atoms). All calculations were performed using the VASP software with a plane-wave cutoff energy of 550 eV. This dataset is suitable for developing, training, and evaluating machine-learned interatomic potential models for copper, gold, and their alloys, and can also be used to compare the effects of different DFT functionals on computational results.

创建时间:
2026-07-15
原始信息汇总

数据集概述

数据集名称: Cu-Au DFT Training Data
许可协议: CC-BY-4.0
标签: 化学、材料科学、密度泛函理论(DFT)、原子间势、机器学习原子间势、铜、金
数据规模: 10K < n < 100K(约96,000个结构)

数据集内容

该数据集包含约96,000个小周期性Cu、Au和Cu-Au结构(每晶胞1–8个原子)的DFT总能和原子受力,使用三种交换关联泛函计算。旨在作为机器学习原子间势的训练/参考数据。

每种泛函对应一个独立的子集(配置):

  • pbe(默认)
  • lda
  • r2scan

所有子集使用相同的结构生成协议,仅在参考计算所用的泛函上不同。

子集统计

配置 结构数 总原子数 Cu-only Au-only Cu-Au 每原子能量范围 (eV)
pbe 32,228 178,269 8,844 8,971 14,413 −3.73 … +6.64
lda 31,931 176,630 8,736 8,928 14,267 −4.69 … +5.43
r2scan 31,892 176,358 8,728 8,923 14,241 −4.25 … +6.10

所有结构均为全周期(pbc = TTT),具有一般三斜晶胞。数据集中有意包含强扭曲和高能构型,以进行稳健的势拟合。

计算细节

  • 平面波截断能:550 eV
  • k点间距:0.1/Å
  • 收敛标准:至少10⁻⁶ eV
  • 展宽方法:Methfessel-Paxton,宽度0.2 eV
  • 计算软件:VASP

数据字段

字段名 类型 描述
name 字符串 结构标识符,编码成分和生成族,如 CuEverything_Cu8VolMinAllMinRandom_structure_885
symbols 列表[字符串] 化学符号,长度 N
numbers 列表[整数] 原子序数(29 = Cu, 79 = Au)
positions 列表[列表[浮点数]] 笛卡尔坐标,单位 Å,形状 (N, 3)
cell 列表[列表[浮点数]] 以行为单位的晶胞向量,单位 Å,形状 (3, 3)
energy 浮点数 DFT总能,单位 eV
forces 列表[列表[浮点数]] 原子受力,单位 eV/Å,形状 (N, 3)
number_of_atoms 整数 原子数 N(1–8)

使用示例

加载数据集

python from datasets import load_dataset

ds = load_dataset("thermoatoms/CuAu", "pbe", split="train") # 或 "lda", "r2scan" row = ds[0]

重建ASE Atoms对象

python from ase import Atoms

atoms = Atoms( numbers=row["numbers"], positions=row["positions"], cell=row["cell"], pbc=True, ) energy = row["energy"] # eV forces = row["forces"] # eV/Å

结构生成方法

采用ASSYST方法生成结构:对称性随机候选晶胞(最多8个原子),跨越空间群采样(841个Cu样品、841个Au样品、1335个Cu-Au样品)。经过连续体积弛豫和全弛豫后,通过随机抖动(σ = 0.5 Å)和静水/剪切应变变体增强,以获得振动和弹性采样。结构族编码在 name 字段中(例如 VolMinAllMinRandomVolMinTraceVolMinAllMinTrace)。小晶胞设计使得使用多个泛函重新标记同一结构池变得高效,这也是三个子集的获取方式。

引用信息

若使用该数据集,请引用:

@misc{Menon2026, title={Computing binary alloy phase diagrams with explicit configurational and vibrational entropy}, author={Sarath Menon and Marvin Poul and Tilmann Hickel and Jörg Neugebauer and Ralf Drautz}, year={2026}, eprint={2607.14795}, archivePrefix={arXiv}, primaryClass={cond-mat.mtrl-sci}, url={https://arxiv.org/abs/2607.14795}, }

搜集汇总
数据集介绍
CuAu 数据集图片
构建方式
CuAu数据集基于密度泛函理论计算框架构建,旨在为机器学习原子间势能模型提供高质量的训练与参考数据。数据集涵盖了铜、金及其二元合金的约96,000个小型周期性结构,每个结构包含1至8个原子。结构生成采用ASSYST方法,首先通过对称性随机采样生成候选晶胞,再对空间群中的元素组合进行采样,随后依次进行体积优化和完全结构弛豫。为了增强数据集的鲁棒性,还对弛豫后的低能构型施加了随机扰动(σ=0.5 Å)以及静水与剪切应变,从而模拟原子振动与弹性形变,获得多样化且包含高度畸变和高能构型的结构池。
特点
该数据集的一个显著特点是提供了同一结构池在三种不同交换关联泛函下的计算结果,即PBE、LDA和r2SCAN,分别存储为独立的子集,便于泛函对比与多精度模型训练。每个结构均包含完整的总能量、原子受力、晶胞参数及原子位置信息,且所有结构采用全周期性边界条件。数据集中刻意包含了大量强扭曲和高能构型,有助于提升所训练势能模型的泛化能力与数值鲁棒性。此外,每个结构均通过唯一标识符编码其组成与生成族,方便溯源与结构筛选。
使用方法
用户可通过Hugging Face的datasets库便捷加载该数据集,以PBE子集为例,只需调用`load_dataset("thermoatoms/CuAu", "pbe", split="train")`。返回的数据行包含名称、元素符号、原子序数、笛卡尔坐标、晶胞矢量、总能量及原子受力等字段;借助ASE库可轻松将数据重构为`Atoms`对象,从而无缝衔接后续的分子动力学模拟或机器学习势函数训练。数据集默认划分为训练集,无需额外分割,可直接用于监督学习任务。
背景与挑战
背景概述
CuAu数据集由Menon、Poul、Hickel、Neugebauer和Drautz等研究人员于2026年创建,旨在为机器学习原子间势能提供高质量的密度泛函理论(DFT)训练数据。该数据集包含约96,000个小周期铜(Cu)、金(Au)及铜金合金(Cu-Au)结构,每个结构由1至8个原子组成,并分别采用PBE、LDA和r2SCAN三种交换关联泛函计算了总能量与原子受力。通过ASSYST方法系统生成并扰动结构,覆盖了从低能到高能、从对称到畸变的广泛构型空间,为二元合金热力学性质(如相图计算)的研究提供了关键参考。CuAu数据集在计算材料科学领域具有重要影响力,显著推进了基于机器学习的合金势能开发与熵效应整合研究。
当前挑战
CuAu数据集所解决的领域核心挑战在于如何高效且准确地描述铜金二元合金的复杂构型与振动熵,以克服传统DFT计算在相图预测中的高昂成本与有限精度。具体挑战包括:1)生成足够多样化的结构样本以覆盖合金的构型空间,包括高度扭曲和高能构型,从而确保机器学习势能模型的鲁棒性;2)在不同交换关联泛函下一致地计算能量与受力,以兼容多种理论框架并评估泛函依赖性;3)在维持小晶胞(≤8原子)计算效率的同时,避免因周期边界效应导致的结构偏差,使数据可用于跨尺度建模。这些挑战的解决路径为后续二元乃至多元合金势能的训练与相图预测奠定了数据基础。
常用场景
经典使用场景
CuAu数据集的核心设计初衷在于为铜-金二元合金体系提供高精度的密度泛函理论(DFT)参考数据,以训练机器学习原子间势能(MLIP)。该数据集包含约96,000个周期性小体系结构(每晶胞1–8个原子),覆盖纯Cu、纯Au以及Cu-Au合金,并分别采用PBE、LDA和R2SCAN三种交换关联泛函进行计算。研究者可借助该数据集构建通用的原子间势能模型,高效且准确地预测合金在广泛热力学条件下的能量与受力,从而为后续的材料模拟奠定坚实基础。
实际应用
在实际应用中,基于CuAu数据集训练的机器学习势能可直接服务于合金材料设计领域。例如,在电子封装与微纳制造中,Cu-Au合金被广泛用作焊料与连接材料时,其力学响应与相变行为可以通过势能驱动的大规模分子动力学模拟进行评估。此外,该数据集还可辅助预测合金的弹性模量、热膨胀系数及扩散系数等关键工程参数,减少对昂贵且耗时的实验试错依赖,为工业界的成分优化与工艺设计提供可靠的计算支撑。
衍生相关工作
CuAu数据集的发布催生了若干重要的衍生研究工作。首先,ASSYST结构生成方法作为该数据的构建基础被系统性地总结,并发表于npj Computational Materials(Poul, Huber & Neugebauer, 2025),为后续类似数据集的自动生成提供了标准化流程。其次,Menon等人利用该数据集训练的机器学习势能,耦合构型熵与振动熵,首次实现了Cu-Au二元合金相图的从头计算构建,相关成果以预印本形式发布。此外,该数据集还被用于开发适用于多泛函迁移学习的势能框架,探索不同交换关联泛函下势能模型的一致性与差异,拓宽了机器学习势能在多尺度材料模拟中的适用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务