遇见数据集

CATALIUST TI2C-MXENE

收藏
arXiv2026-05-31 更新2026-06-05 收录
官方服务:

资源简介:

CATALIUST TI2C-MXENE是由林雪平大学研究团队创建的高质量计算催化数据集,专注于二维Ti2CTy MXene材料在催化应用中的表面化学行为研究。该数据集包含总计6万条密度泛函理论计算数据,涵盖原子尺度系统规模从2至923个原子,核心训练集与测试集共6万条,另附1000条扩展大体系测试数据以评估模型泛化能力;数据来源包括几何优化、反应路径计算及随机扰动结构等多种DFT计算类型,涉及H2、CO2、H2O、O2和HCOOH等分子在MXene表面的吸附构型。数据集通过系统性第一性原理计算构建,采用rev-vdW-DF2泛函精确描述范德华相互作用,并统一使用形成能作为能量基准以确保物理一致性。该数据集旨在解决MXene催化材料在真实反应条件下动态表面化学的模拟难题,为机器学习势函数训练提供基准,推动高效催化行为研究,应用于二氧化碳还原、氢析出反应等能源催化领域。

CATALIUST TI2C-MXENE is a high-quality computational catalysis dataset developed by the research team from Linköping University, focusing on the surface chemical behavior of two-dimensional Ti₂CTᵧ MXene materials in catalytic applications. The dataset consists of 61,000 total density functional theory (DFT) calculation entries: 60,000 entries for the core training and test sets, covering atomic-scale systems with sizes ranging from 2 to 923 atoms, plus an additional 1,000 extended large-system test datasets for evaluating the generalization ability of machine learning models. The data is sourced from multiple DFT calculation types including geometric optimization, reaction path simulations, and randomly perturbed structures, involving adsorption configurations of molecules such as H₂, CO₂, H₂O, O₂ and HCOOH on the MXene surface. The dataset is constructed via systematic first-principles calculations, using the rev-vdW-DF2 functional to accurately describe van der Waals interactions, and uniformly taking formation energy as the energy benchmark to ensure physical consistency. This dataset aims to resolve the simulation challenges regarding the dynamic surface chemistry of MXene catalytic materials under realistic reaction conditions, provide benchmarks for training machine learning potential functions, advance research on efficient catalytic behaviors, and be applied in energy catalysis domains such as carbon dioxide reduction and hydrogen evolution reaction.

创建时间:
2026-05-31
原始信息汇总

数据集概述:Catalys_mxenes

许可证:cc-by-nc-sa-4.0
语言:英语
标签:MLIP,2D Mxenes
数据集大小:10,000 < 样本数 < 100,000
别名:Catalys_mxenes

数据结构

  • 数据集存储于 datasets/ 目录,提供 .h5.xyz 两种格式。
  • 包含 1000 个较大系统的子集。
  • 对于 .h5 格式(用于 EquiformerV2 模型),训练集和验证集的划分在加载时自动处理;其余模型使用 .xyz 格式。

模型与训练代码

  • 模型实现、训练代码、评估代码及检查点均位于 models/ 目录下。

  • 每个模型子目录包含:

    • runs/:存储训练好的模型检查点。
    • scripts/:包含训练和评估的 shell 脚本。
  • 所有脚本需从仓库根目录启动,示例命令: bash ./models/<model_name>/scripts/eval_<model_name>.sh

  • 其他设置(如其他模型)可在 shell 脚本内部修改。

安装说明

  • 提供 conda/mamba 环境文件(catalyst_env.yml),适用于所有四个模型。

  • 创建环境: bash mamba env create -f catalyst_env.yml

  • 激活环境: bash mamba activate catalyst

  • 若部分包因依赖冲突安装失败,需手动使用 pipmamba 安装缺失包。

搜集汇总
数据集介绍
CATALIUST TI2C-MXENE 数据集图片
构建方式
CATALIUST TI2C-MXENE数据集的构建基于密度泛函理论(DFT)计算,聚焦于Ti2CTy MXene材料及其与多种分子(H2、CO2、H2O、O2、HCOOH)的相互作用。数据集包含50,000个训练样本和10,000个测试样本,涵盖不同表面终端覆盖度和类型的MXene构型,以及分子吸附体系。计算类型包括几何优化、反应路径计算(如爬坡弹性带方法)和随机扰动结构,以覆盖从近平衡到远平衡的多样化化学环境。此外,还额外构建了1,000个约5倍原子数量的大型体系,专门用于评估模型对系统尺寸的泛化能力。所有DFT计算均采用rev-vdW-DF2泛函和VASP软件,确保能量和力的数值收敛。
使用方法
该数据集适用于训练和评估等变机器学习原子间势模型(MLIP),以近似DFT计算的能量与原子力,从而加速MXene催化过程的模拟。推荐使用MACE、EquiformerV2、UPET、MatRIS或PET等模型架构进行训练,并可采用预训练基础模型进行微调以提升性能。训练时,应关注力与能量的平均绝对误差(MAE)作为主要指标,并结合保守力预测机制确保物理一致性。对于已训练好的模型,可应用于分子动力学模拟,研究表面终端在反应条件下的动态演化,实现约千倍以上的计算加速。数据集与模型代码已在Hugging Face平台开源,支持直接下载与使用。
背景与挑战
背景概述
在计算催化领域,平衡精度与效率始终是核心难题。密度泛函理论虽能可靠描述表面化学性质,但其高昂的计算成本限制了对催化剂动态行为的研究,尤其对于表面化学环境极为丰富的二维过渡金属碳化物而言。CATALIUST TI2C-MXENE数据集由瑞典林雪平大学的研究团队于近年构建,聚焦于催化性能优异的Ti2CTy MXene材料。该数据集涵盖了50,000个用于训练的密度泛函计算与10,000个测试样本,并额外包含1,000个更大尺度的体系以评估模型泛化能力。通过系统研究表面终止基团对催化活性的影响,该数据集为利用机器学习加速MXene催化进程探索奠定了重要基础,在催化与材料科学领域产生了广泛影响。
当前挑战
该数据集所解决的领域挑战在于,现有机器学习势函数基础模型在MXene催化体系上迁移性极差,根源在于MXene复杂且多样的表面终止基团在训练数据中严重不足,导致其对能量和力的预测失准。此外,构建过程中面临严峻挑战:密度泛函理论计算需处理从非终止到过终止的广泛表面覆盖度,并涵盖混合O/OH基团、高温分子动力学及反应路径等非平衡构型,计算成本极高;同时,数据集需确保化学环境的多样性,即便仅包含四种原子类型,其在不同键合模式下的行为差异使得模型学习极为困难。最终,模型需要在高精度(力误差约±10 meV/Å,能量误差约±1 meV)下实现千倍以上的计算加速,这对方法设计与验证提出了极高要求。
常用场景
经典使用场景
在二维过渡金属碳化物(MXene)催化研究领域,CATALIUST TI2C-MXENE数据集最经典的使用场景是作为训练和验证机器学习原子间势(MLIP)模型的基准资源。该数据集涵盖了50,000个密度泛函理论(DFT)计算训练样本和10,000个测试样本,以及1,000个更大规模系统的额外测试集,为研究Ti2CTy MXene的表面化学与催化行为提供了丰富且多样化的构型空间。研究者可借此数据集系统性地训练并评估诸如EquiformerV2、MACE、MatRIS和UPET等对称性感知的MLIP模型,以实现对原子受力和形成能的高精度预测,从而在保持近DFT精度的前提下,将计算效率提升数个数量级。
解决学术问题
该数据集解决了催化研究中一个长期存在的根本性学术难题:如何在高效计算的同时,精准描述二维MXene材料在真实反应条件下的动态表面化学行为。传统DFT方法受限于高昂的计算成本,仅能模拟小型体系和短时间尺度,难以捕捉催化剂结构随反应条件演化的动态特性。而现有MLIP基础模型因MXene复杂且异质的表面官能团化在训练数据中代表性不足,导致迁移性差。CATALIUST TI2C-MXENE通过构建高密度、物理自洽的DFT计算数据库,成功弥合了理想化模型与实际催化环境之间的鸿沟,使研究者能够对MXene在工况下的表面终止基团演变、反应路径及催化活性进行高效且可靠的模拟,为理解此类材料的催化机理提供了坚实的理论基础。
实际应用
在实际应用中,CATALIUST TI2C-MXENE数据集及其训练的MLIP模型加速了多个关键的催化过程研究,尤其是在二氧化碳还原制甲酸、析氢反应和析氧反应中展现出巨大潜力。凭借高达数千倍的计算加速优势,这些模型使得在常规CPU上进行大尺度、长时程的分子动力学模拟成为可能,从而能够在接近实验工况的条件下评估不同表面终止构型对催化活性的影响。这不仅有助于高通量筛选更具活性的MXene基催化剂,还能指导实验团队精准设计催化材料的表面化学环境,为化工行业降低碳排放、实现绿色可持续催化工艺提供了强有力的计算工具。
数据集最近研究
最新研究方向
针对二维过渡金属碳化物Ti2CTy MXene催化性能评估的前沿研究,当前正从传统第一性原理计算向机器学习原子间势能模型深度融合演进。CATALIUST TI2C-MXENE数据集应运而生,它通过系统性生成包含5万训练样本与1万测试样本的高保真密度泛函理论计算数据,并额外构建千个规模扩展五倍的大体系测试集,攻克了现有基础模型在MXene表面复杂官能团环境下泛化能力薄弱的瓶颈。该工作标志着催化研究从静态能垒筛选迈向了动态表面化学模拟的新阶段,通过训练等变图神经网络模型实现对原子受力与形成能的高精度近瞬态预测,在CPU上获得四个数量级以上的计算加速。这一数据集不仅为CO₂还原制甲酸、析氢与析氧反应等关键催化过程提供了坚实的数据基石,更为破解二维材料在真实工况下的结构演化之谜开辟了通途。
相关研究论文
  • 1
    Benchmark Dataset for Catalysis on 2D MXenes林雪平大学·计算机视觉与学习系统系; 林雪平大学·材料设计系; 瓦伦堡可持续发展材料科学倡议 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务