遇见数据集

HIP-UMA-OMol25

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

HIP-UMA-OMol25 是一个面向原子尺度分子动力学的数据集,包含 UMA-S-1.2 模型对 OMol-1 训练集几何结构的预测结果及其自动梯度 Hessian 矩阵。数据存储于 HDF5 文件中,每个文件包含分子配置信息,如原子序数、坐标、原子数、电荷、自旋、自旋多重度、是否非限制性计算、能量、力和密集 Hessian 矩阵(扁平化)。此外,还提供了用于重建变长数组的原子指针和 Hessian 指针,以及 OMol 匹配字段(如 omol_index、source、data_id、sid、reference_source、composition)和可选的 OMol 参考 DFT 标签(dft_energy、dft_forces、has_dft_labels)。标签精度为 float32,能量单位 eV,力单位 eV/Å,Hessian 单位 eV/Ų。数据源自 OMol-1 训练集(release 260123),采用固定种子均匀采样(种子 20260729),使用 UMA-S-1.2 模型生成,Hessian 模式为循环,精度 float32。HDF5 格式为发布格式,支持随机访问和变长密集 Hessian 矩阵,无需填充。该数据集适用于图机器学习任务,尤其是分子性质预测、力场训练和 Hessian 相关建模。

HIP-UMA-OMol25 is a dataset for atomic-scale molecular dynamics, containing the predictions of the UMA-S-1.2 model on the geometries of the OMol-1 training set and their automatic gradient Hessian matrices. The data is stored in HDF5 files, each containing molecular configuration information such as atomic numbers, coordinates, number of atoms, charge, spin, spin multiplicity, whether it is unrestricted calculation, energy, forces, and dense Hessian matrices (flattened). Additionally, atomic pointers and Hessian pointers for reconstructing variable-length arrays are provided, along with OMol matching fields (e.g., omol_index, source, data_id, sid, reference_source, composition) and optional OMol reference DFT labels (dft_energy, dft_forces, has_dft_labels). Label precision is float32, energy unit is eV, force unit is eV/Å, and Hessian unit is eV/Ų. The data originates from the OMol-1 training set (release 260123), sampled uniformly with a fixed seed (seed 20260729), generated using the UMA-S-1.2 model with cyclic Hessian mode and float32 precision. The HDF5 format is the release format, supporting random access and variable-length dense Hessian matrices without padding. This dataset is suitable for graph machine learning tasks, especially molecular property prediction, force field training, and Hessian-related modeling.

创建时间:
2026-08-04
原始信息汇总

数据集概述:HIP-UMA-OMol25

基本信息

  • 数据集名称:HIP-UMA-OMol25
  • 任务类型:图机器学习(graph-ml)
  • 标签:原子模拟、分子动力学、Hessian矩阵、UMA、OMol25

数据内容

该数据集包含基于OMol-1训练几何结构、使用omol任务生成的UMA-S-1.2预测结果及自动微分Hessian矩阵。每个HDF5文件存储分子构型,包含以下字段:

基础结构信息

  • 原子序数(atomic_numbers
  • 坐标(coords
  • 原子数(natoms

分子属性

  • 电荷(charge
  • 自旋(spin
  • 自旋多重度(spin_multiplicity
  • 非限制性标志(unrestricted

物理量标签

  • 能量(energy,单位:eV)
  • 力(forces,单位:eV/Å)
  • 稠密Hessian矩阵(hessian_flat,单位:eV/Ų)
  • 指针字段(atom_ptrhessian_ptr)用于重构变长数组

OMol匹配字段

  • omol_indexsourcedata_idsid
  • reference_sourcecomposition

可选参考标签

  • dft_energydft_forceshas_dft_labels

所有教师标签均以float32精度存储。

数据来源与采样

  • 来源数据集:OMol-1训练集,版本260123
  • 采样方式:固定种子均匀采样,种子为20260729
  • 生成模型uma-s-1p2
  • Hessian计算模式:循环(loop)
  • 精度:float32

omol_index字段对应父数据集OMol-1训练集ASE-LMDB中的索引,额外包含身份字段和分子几何信息,便于交叉验证及独立使用。

使用说明

  • 复现UMA输入需设置task_name=omol、UMA-S-1.2、FP32精度,并使用120 Å的分子模拟盒
  • OMol25的spin字段表示自旋多重度
  • 电荷和自旋是必需的条件输入,需通过等效r_data_keys=["spin", "charge"]传递

格式说明

  • 发布格式:HDF5,支持随机访问和变长稠密Hessian矩阵存储,无需填充
  • 生成建议:FairChem图/训练缓存需根据本地FairChem版本和训练配置从原始文件生成,因为其表示形式依赖于具体环境
搜集汇总
数据集介绍
HIP-UMA-OMol25 数据集图片
构建方式
HIP-UMA-OMol25数据集的构建依托于OMol-1训练集的精选几何构型,通过固定种子均匀采样策略,确保了样本的代表性与可复现性。利用UMA-S-1.2模型在FP32精度下,于120埃的分子盒中执行omol任务,以循环模式计算得到密集Hessian矩阵。每个HDF5文件均包含原子序数、坐标、电荷、自旋多重度等基础属性,同时提供能量、力与Hessian的浮点数值,并附有指向父数据集的索引及多种标识字段,便于交叉验证与独立使用。
特点
该数据集的核心特色在于其丰富的物理量标注与灵活的存储格式。教师标签采用float32精度,能量单位eV,力与Hessian分别以eV/埃与eV/埃^2记录,保证了数值的精确性。HDF5格式支持随机访问与变长矩阵的无填充存储,显著提升了数据读取效率。数据涵盖了OMol匹配字段、参考来源及可选的DFT标签,为多维度分析提供了便利。此外,数据集明确要求将电荷与自旋作为条件输入,凸显了其对于分子电子结构描述的深度与专业性。
使用方法
使用时,应充分利用HDF5格式的随机访问特性,直接加载所需的分子构型。需注意复现UMA输入的条件,即采用task_name=omol、UMA-S-1.2模型、FP32精度及120埃的分子盒,并确保电荷与自旋通过r_data_keys传递。对于图神经网络训练,建议基于提供的HDF5文件在本地生成FairChem缓存,以适配具体训练配置。数据集内的omol_index可关联父数据集OMol-1 train,便于扩展使用,而自带的标识字段则支持独立使用,无需依赖外部数据。
背景与挑战
背景概述
HIP-UMA-OMol25数据集由科研团队于2026年创建,旨在利用UMA-S-1.2模型为OMol-1训练集中的分子几何结构提供高精度的能量、力和Hessian矩阵标签。该数据集的核心研究问题在于生成高质量、可复现的原子级模拟数据,以支持分子动力学和势能面建模。通过整合QM计算标签与模型预测,HIP-UMA-OMol25为机器学习势函数的发展提供了丰富的训练资源,推动了原子尺度模拟领域的进展,并对图神经网络在分子性质预测方面的应用产生了显著影响。
当前挑战
该数据集面临的挑战包括:在原子级模拟中,精确计算Hessian矩阵需要极高的计算成本,且对数值稳定性要求严格;构建过程中,需确保不同分子构型的电荷、自旋等条件输入一致,以维持模型预测的准确性;此外,UMA-S-1.2模型的泛化能力受限于训练数据的分布,对于未覆盖的化学空间可能产生偏差,且Hessian的存储与处理在可变尺寸下增加了数据管理的复杂性。
常用场景
经典使用场景
HIP-UMA-OMol25数据集作为分子动力学与机器学习势函数领域的宝贵资源,其核心经典使用场景在于为原子尺度模拟提供高精度的力场训练数据。该数据集包含大量分子的几何构型、能量、原子受力以及完整的Hessian矩阵,这些信息对于发展深度学习势能面模型至关重要。研究者可据此训练模型以精确预测分子的势能、原子间作用力及振动频率,从而支撑从头算分子动力学模拟、材料力学性质预测以及化学反应机理探索等前沿研究。
解决学术问题
该数据集有效解决了传统从头算方法计算成本高昂、难以覆盖大尺度复杂体系的难题,推动机器学习势函数在量子化学精度与分子模拟效率之间取得突破。通过提供由UMA模型生成的稠密Hessian矩阵,它使研究者能够开发同时预测能量、力与振动性质的统一模型,从而深入研究分子振动光谱、热力学性质及化学反应的过渡态结构。这一资源极大地促进了可迁移、可泛化神经网络势场的发展,为计算化学和材料科学中的多尺度模拟奠定了坚实的数据基础。
衍生相关工作
基于HIP-UMA-OMol25数据集,已衍生出多项开创性工作。一方面,研究者利用该数据集探索了基于图神经网络与Transformer架构的新型势场模型,显著提升了模型对分子能量与力场的预测精度。另一方面,该数据集被用于评估和校准密度泛函理论中的交换关联泛函,为改进量子化学计算提供经验参考。还催生了针对Hessian矩阵稀疏性分解的算法研究,以实现分子振动谱的快速预测。这些衍生研究不仅拓展了数据集的科学价值,也推动了机器学习与计算化学交叉方向的持续创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务