遇见数据集

InstaDeepAI/SPICE2_curated_v2

收藏
Hugging Face2026-06-08 更新2026-06-14 收录
官方服务:

资源简介:

SPICE2_curated_v2数据集是基于OMOL25数据集的SPICE子集,包含约200万个结构,这些结构在ωB97M-V/def2-TZVPD理论级别下计算。与之前版本相比,该版本更新了数据源(使用OMOL25的SPICE子集替代原始SPICE数据集),明确包含了带电系统,并通过添加钙、钾、锂、镁和钠等元素,将覆盖元素从12个扩展到17个。数据集按90/9/1的比例分割为训练集、验证集和测试集,分割基于分子SMILES,确保同一分子的不同构象不出现在不同集合中。训练集包含1,763,962个结构,覆盖17种化学元素(硼、溴、碳、钙、氯、氟、氢、碘、钾、锂、镁、氮、钠、氧、磷、硫、硅);验证集包含172,838个结构,覆盖17种元素;测试集包含17,477个结构,覆盖13种元素(这是按SMILES分割的自然结果)。过滤过程移除了非物理结构(仅保留所有氢原子恰好有一个键的结构)和高力结构(应用总力过滤器0.1 eV/Å和最大力过滤器15 eV/Å)。该数据集用于训练新的预训练模型,并基于OMOL25数据集(来源:https://doi.org/10.48550/arXiv.2505.08762)。

SPICE2_curated_v2 is a dataset based on the SPICE subset of the OMOL25 dataset, comprising approximately 2 million structures computed at the ωB97M-V/def2-TZVPD level of theory. Compared to previous versions, it introduces an updated data source (filtering on the SPICE subset of OMOL25 instead of the original SPICE dataset), explicit inclusion of charged systems, and expanded chemical coverage from 12 to 17 elements by adding Ca, K, Li, Mg, and Na. The dataset is split into training, validation, and test sets with a 90/9/1 ratio, partitioned per molecular SMILES to ensure different conformations of the same molecule do not appear across sets. The training set contains 1,763,962 structures covering 17 chemical elements (B, Br, C, Ca, Cl, F, H, I, K, Li, Mg, N, Na, O, P, S, Si), the validation set has 172,838 structures across 17 elements, and the test set contains 17,477 structures across 13 elements (a natural result of the per-SMILES split). The filtering process removed unphysical structures (keeping only those where all hydrogen atoms have exactly one bond) and high-force structures (applying a total force filter of 0.1 eV/Å and a maximum force filter of 15 eV/Å). It is used to train new pre-trained models and is sourced from the OMOL25 dataset (https://doi.org/10.48550/arXiv.2505.08762).

提供机构:
InstaDeepAI
搜集汇总
数据集介绍
InstaDeepAI/SPICE2_curated_v2 数据集图片
构建方式
SPICE2_curated_v2数据集是基于OMOL25数据集中SPICE子集精心筛选与重构而成的优质分子结构数据集。其原始计算数据源自ωB97M-V/def2-TZVPD理论水平下生成的约200万个结构。数据集的构建过程中,严格剔除了所有氢原子成键数不为1的非物理构型,并施加了总力阈值0.1 eV/Å与最大力阈值15 eV/Å的过滤条件,从而确保剩余结构的物理合理性与计算可靠性。最终,采用基于分子SMILES字符串的划分策略,以90%、9%与1%的比例将数据分配至训练集、验证集与测试集,有效避免了同一分子的不同构象跨集合出现。
特点
该数据集相较于先前版本实现了多方位的显著升级:首先,数据来源更新为OMOL25的SPICE子集,替代了原有的SPICE数据集,提升了数据一致性与丰富度。其次,明确加入了带电体系,拓展了模型训练的物理化学场景。更重要的是,涵盖的化学元素种类从12种增长至17种,新增了钙、钾、锂、镁、钠五种金属元素,显著增强了元素覆盖的广度与多样性。最终训练集涵盖超过176万结构与17种元素,验证集与测试集亦分别包含17万与1.7万结构,展现了大规模且分布均衡的优越数据形态。
使用方法
此数据集专为预训练机器学习势能模型而设计,用户可直接利用来自HuggingFace的数据仓库完成下载与加载。使用时建议按照官方提供的训练、验证与测试三部分划分进行模型训练与评估,确保评估结果的公正性与可复现性。该数据集支持在mlip等分子学习框架中作为训练数据直接使用,尤其适用于需要庞大且多样化分子构象与力的回归任务。用户在构建模型时,可充分利用其包含的带电体系与多种金属元素,开展更为广泛的化学反应动力学与热力学性质预测研究。
背景与挑战
背景概述
SPICE2_curated_v2数据集由InstaDeep研究团队于2025年基于OMOL25数据集中的SPICE子集精心构建,旨在推动机器学习原子间势能(MLIP)预训练模型的性能提升。该数据集以ωB97M-V/def2-TZVPD理论水平计算了约200万个分子结构,覆盖从12种扩展至17种化学元素(新增Ca、K、Li、Mg、Na),并首次明确纳入带电体系。作为OMOL25系列的高质量子集,它继承了原始SPICE数据集在分子模拟领域的基准地位,为解决力场精度不足、化学空间覆盖有限等核心问题提供了标准化训练与测试资源,对计算化学与材料科学领域的深度学习研究具有重要影响。
当前挑战
该数据集所应对的领域挑战集中于机器学习力场对不同化学体系(特别是含带电离子及碱金属/碱土金属)的预测准确性与泛化能力不足。构建过程中面临的技术挑战包括:从OMOL25的庞大数据量中筛选具有物理合理性的结构,通过限制每个氢原子仅形成单键剔除不合理构象;施加总力(0.1 eV/Å)与最大力(15 eV/Å)的双重阈值过滤高应力结构,避免异常梯度误导模型训练;此外,基于SMILES字符串的分子级划分策略需确保不同构象不跨集出现,在保持组间元素分布自然差异的同时,实现训练、验证与测试集90/9/1的比例分配,对数据分离逻辑的严密性提出高要求。
常用场景
经典使用场景
SPICE2_curated_v2数据集是面向量子化学领域、特别是分子动力学模拟中机器学习力场(MLIP)模型训练的核心资源。该数据集基于OMOL25中的SPICE子集,包含了约200万个在ωB97M-V/def2-TZVPD理论水平上计算的结构,涵盖了17种化学元素。其经典使用场景在于作为预训练模型的训练基础,研究人员利用这一精心筛选的数据集构建高精度的势能面,从而加速新型催化反应、分子构象搜索以及材料设计等领域的计算研究。通过引入带电体系并扩大元素覆盖范围,该数据集的发布为构建更通用、更鲁棒的机器学习力场模型提供了可靠的知识支撑。
解决学术问题
该数据集主要解决了传统量子化学计算中精度与效率难以兼得的瓶颈问题。在学术研究中,第一性原理方法如密度泛函理论虽然精准,但计算成本高昂,难以直接用于大体系或长时间尺度的模拟。SPICE2_curated_v2通过提供海量高质量的结构与能量数据,使机器学习力场模型能够拟合出接近第一性原理精度的势能面。它有效回应了化学空间覆盖不足、带电分子处理困难以及元素多样性缺失等长期困扰学界的问题,推动了从头算精度计算向更大体系、更复杂化学环境的迁移,为理论化学与材料科学的基础研究开辟了新路径。
衍生相关工作
SPICE2_curated_v2的发布催生了一系列衍生性研究工作。围绕该数据集,研究者开发了多种基于等变神经网络(如MACE、NequIP)的预训练力场模型,并探索了在不同化学体系间的迁移学习策略。同时,该数据集的筛选流程与标签规范也被借鉴用于构建更大规模的多元素通用数据集,推动了OMOL系列数据集的持续演进。此外,基于该数据的模型压缩与知识蒸馏技术逐渐兴起,旨在保留精度的前提下降低计算资源的消耗,从而更广泛地应用于边缘计算与实时解析场景中。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务