遇见数据集

graphs-datasets/MD17-uracil

收藏
Hugging Face2023-02-07 更新2024-03-04 收录
官方服务:

资源简介:

`uracil`数据集是一个分子动力学(MD)数据集,包含使用PBE+vdW-TS电子结构方法计算的总能量和力标签。所有几何结构以埃为单位,能量和力分别以kcal/mol和kcal/mol/A为单位。数据集包含133769个图,平均每个图有12个节点和128.89条边。每个图的数据字段包括节点特征、边索引、边属性和标签等。数据集未进行分割,建议使用交叉验证。

The `uracil` dataset is a molecular dynamics (MD) dataset containing total energy and force labels calculated via the PBE+vdW-TS electronic structure method. All geometric structures are reported in angstroms, with energy and force units being kcal/mol and kcal/mol/Å respectively. The dataset consists of 133,769 graphs, with an average of 12 nodes and 128.89 edges per graph. Data fields for each graph include node features, edge indices, edge attributes, labels and other related contents. This dataset has not been pre-split, and cross-validation is recommended for subsequent analysis.

提供机构:
graphs-datasets
原始信息汇总

数据集概述

数据集描述

  • 数据集名称: uracil
  • 数据集类型: 分子动力学(MD)数据集
  • 计算方法: 使用PBE+vdW-TS电子结构方法计算总能量和力标签
  • 单位: 几何结构以Angstrom为单位,能量和力分别以kcal/mol和kcal/mol/A为单位

数据集总结

  • 任务类型: 有机分子属性预测,回归任务
  • 评估指标: 能量预测的平均绝对误差(meV)

数据集结构

数据属性

  • 规模: 大
  • 图数量: 133769
  • 平均节点数: 12.0
  • 平均边数: 128.88676085818943

数据字段

  • node_feat (列表: #nodes x #node-features): 节点特征
  • edge_index (列表: 2 x #edges): 构成边的节点对
  • edge_attr (列表: #edges x #edge-features): 边特征
  • y (列表: #labels): 可用于预测的标签数量
  • num_nodes (整数): 图的节点数

数据分割

  • 分割方式: 未分割,建议使用交叉验证

附加信息

许可信息

  • 许可类型: 未知

引用信息

@inproceedings{Morris+2020, title={TUDataset: A collection of benchmark datasets for learning with graphs}, author={Christopher Morris and Nils M. Kriege and Franka Bause and Kristian Kersting and Petra Mutzel and Marion Neumann}, booktitle={ICML 2020 Workshop on Graph Representation Learning and Beyond (GRL+ 2020)}, archivePrefix={arXiv}, eprint={2007.08663}, url={www.graphlearning.io}, year={2020} }

@article{Chmiela_2017, doi = {10.1126/sciadv.1603015}, url = {https://doi.org/10.1126%2Fsciadv.1603015}, year = 2017, month = {may}, publisher = {American Association for the Advancement of Science ({AAAS})}, volume = {3}, number = {5}, author = {Stefan Chmiela and Alexandre Tkatchenko and Huziel E. Sauceda and Igor Poltavsky and Kristof T. Schütt and Klaus-Robert Müller}, title = {Machine learning of accurate energy-conserving molecular force fields}, journal = {Science Advances} }

搜集汇总
数据集介绍
graphs-datasets/MD17-uracil 数据集图片
构建方式
在分子动力学模拟与量子化学计算的交汇领域,MD17-uracil数据集专为有机分子性质预测而设计。该数据集基于尿嘧啶分子的动力学轨迹构建,所有几何构型均以埃为单位记录,其能量与力的标签通过PBE+vdW-TS电子结构方法精确计算得出,能量和力的单位分别为千卡每摩尔和千卡每摩尔每埃。数据集的构建依托于PyGeometric框架,每个样本以图结构形式呈现,包含节点特征、边索引、边属性及目标标签等字段,共计133769个图样本,平均每个图包含12个节点和约128.89条边,为回归任务提供了丰富的训练素材。
特点
该数据集的核心特点在于其高精度与大规模的结合。能量预测的评估采用平均绝对误差(以毫电子伏特计),确保了模型性能的量化可靠性。数据未预先划分训练集、验证集或测试集,推荐使用交叉验证策略进行模型评估,这有助于提升泛化能力的稳定性。此外,数据集来源于SGDML项目,其科学文献引用支持了数据来源的权威性,而图结构的标准化表示则使其易于融入图神经网络的研究流程。
使用方法
使用MD17-uracil数据集时,可通过HuggingFace的datasets库加载,并借助PyTorch Geometric进行图数据处理。具体步骤包括:首先利用load_dataset函数获取数据,然后将训练集(或验证集、测试集)中的每个图转换为torch_geometric.data.Data对象,最后通过DataLoader构建批处理加载器。这一流程简化了从数据读取到模型输入的转换,适用于有机分子能量与力的回归预测任务,研究者可基于此基准开展图表示学习方法的比较与优化。
背景与挑战
背景概述
MD17-uracil数据集是分子动力学模拟领域的重要基准资源,由Stefan Chmiela、Alexandre Tkatchenko等研究人员于2017年创建,源自对有机分子尿嘧啶的精确势能面建模需求。该数据集采用PBE+vdW-TS电子结构方法计算总能量与原子力标签,涵盖133,769个分子构象,每个构象以图结构表示,节点对应原子,边描述原子间相互作用。其核心研究问题在于利用图机器学习方法预测分子能量,推动力场从传统经验模型向数据驱动模型的范式转变。作为MD17系列的关键成员,该数据集为有机分子性质预测领域提供了标准化测试平台,尤其在能量回归任务中,平均绝对误差(meV)的评估指标被广泛采纳,显著促进了图神经网络在计算化学中的发展与应用。
当前挑战
MD17-uracil数据集面临的核心挑战在于高精度分子力场学习的多维度复杂性。从领域问题看,有机分子能量预测要求模型捕获原子间长程相互作用与量子力学效应,而尿嘧啶作为含氮杂环化合物,其非共价相互作用(如氢键)的精确建模对现有图神经网络构成严峻考验,易出现能量预测的局部偏差。从构建过程看,数据集虽采用高精度PBE+vdW-TS方法,但电子结构计算本身存在近似误差,且构象采样空间有限,可能遗漏关键反应路径或高能构型,导致模型泛化性不足。此外,133,769个样本的规模在分子动力学数据中虽属较大,但对于训练复杂深度模型仍显不足,易引发过拟合,且未划分训练-验证-测试集,需依赖交叉验证,增加了结果可比性的难度。
常用场景
经典使用场景
MD17-uracil数据集作为分子动力学模拟领域的经典基准,广泛应用于有机分子性质预测任务,尤其是针对尿嘧啶分子的势能面学习与力场建模。该数据集包含逾13万条分子构象,每个构象以图结构表示,节点为原子,边为化学键或空间邻近关系,节点特征与边属性共同刻画微观几何与电子结构信息。研究者通常利用图神经网络(如SchNet、DimeNet等)在该数据集上进行回归任务,以预测分子总能量和原子受力,目标是通过机器学习模型逼近第一性原理计算(PBE+vdW-TS方法)的精度,从而替代昂贵的密度泛函理论计算。这一场景的核心挑战在于如何在有限的训练样本下捕捉高维势能面的复杂非线性特征,同时保证能量守恒与物理一致性。
衍生相关工作
围绕MD17-uracil数据集,学术界衍生出一系列里程碑式工作。Chmiela等人提出的对称梯度域机器学习(sGDML)框架首次在该数据集上实现了能量守恒力场的精确重构,开创了数据驱动力场的新范式。后续研究如SchNet(Schütt et al., 2018)利用连续滤波卷积操作,将原子间相互作用建模为连续函数,显著提升了能量预测的泛化能力;DimeNet(Gasteiger et al., 2020)则引入方向消息传递机制,捕捉多体效应与角度信息,进一步降低了力场预测的均方误差。此外,该数据集被广泛用于评估等变神经网络(如SE(3)-Transformer、EGNN)的物理一致性,以及对比不同分子表示方法(如原子中心对称函数、库仑矩阵)在图学习框架下的表现,成为验证模型是否符合物理对称性(平移、旋转、置换不变性)的标准测试床。
数据集最近研究
最新研究方向
在计算化学与机器学习交叉领域,MD17-uracil数据集正成为推动有机分子力场精确建模的核心基准。该数据集基于PBE+vdW-TS电子结构方法生成的高精度能量与力标签,为图神经网络在分子动力学模拟中的能量预测任务提供了丰富的监督信号。当前前沿研究聚焦于利用图神经网络与等变架构,如SE(3)-Transformer和GemNet,从该数据集中学习能量守恒的分子力场,旨在突破传统力场在复杂有机分子上的精度瓶颈。这一方向与近期AI for Science热潮紧密相连,尤其在高通量虚拟筛选和药物分子设计等热点应用中,MD17-uracil所支撑的模型能够以量子力学级别的精度预测势能面,显著加速新材料的发现进程。其意义在于为可迁移、可解释的分子表示学习奠定数据基础,推动计算化学从经验参数化向数据驱动范式的根本转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务