遇见数据集

GoldDIGR

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

GoldDIGR是一个大规模开放的DFT反应计算数据集,包含约1,000,000个xTB/DFT反应计算。数据来源于已发表化学论文的支持信息,并通过统一的处理流程(包括几何结构/过渡态搜索、IRC、单点DFT计算以及xTB自旋/结构扫描)重新计算得到。每个计算是一个自包含的.zip文件,整个语料库以425个.tar包的形式分发,总数据量约为800 GB。数据集持续更新,新的DFT计算结果会定期注入,受影响的包会被重新上传。数据集适用于化学、计算化学、DFT、反应机理等领域的研究和应用,特别适合用于开发和分析反应计算模型。每个反应.zip文件内部包含DFT-SinglePoint目录(ORCA单点计算输出,包括.out、.xyz、.inp文件、CHELPG电荷、模糊/Mayer/Wiberg键级矩阵以及status.json)、xTB-scan目录(GFN2-xTB自旋/结构扫描数据,包括每帧几何结构、spin_scan_summary.csv以及bem_snapshots/step_*.json)和IRC_Analysis目录(IRC帧分析及反应摘要),此外还包含轨迹文件(.trj、.xyz)和元数据文件(.yaml)。数据处理过程包括无损清理原始输出,去除冗余信息,但保留了所有科学量(几何结构、能量、电荷、键级、轨道能量)。数据集采用CC-BY-4.0许可证发布。

GoldDIGR is a large-scale open-access DFT reaction calculation dataset containing approximately 1,000,000 xTB/DFT reaction calculations. The data is sourced from the supporting information of published chemistry papers, and recalculated via a unified processing workflow including geometric structure/transition state search, IRC, single-point DFT calculations, and xTB spin/structure scanning. Each calculation is a self-contained .zip file, and the entire corpus is distributed as 425 .tar packages with a total data volume of approximately 800 GB. The dataset is continuously updated, with new DFT calculation results added regularly, and affected packages will be re-uploaded. The dataset is applicable to research and applications in fields such as chemistry, computational chemistry, DFT, and reaction mechanisms, and is particularly suitable for developing and analyzing reaction calculation models. Each reaction .zip file internally contains the DFT-SinglePoint directory (ORCA single-point calculation outputs, including .out, .xyz, .inp files, CHELPG charges, fuzzy/Mayer/Wiberg bond order matrices, and status.json), the xTB-scan directory (GFN2-xTB spin/structure scan data, including per-frame geometric structures, spin_scan_summary.csv, and bem_snapshots/step_*.json), and the IRC_Analysis directory (IRC frame analysis and reaction summaries). Additionally, it includes trajectory files (.trj, .xyz) and metadata files (.yaml). The data processing process includes lossless cleaning of raw outputs to remove redundant information while retaining all scientific quantities: geometric structures, energies, charges, bond orders, and orbital energies. The dataset is released under the CC-BY-4.0 license.

创建时间:
2026-06-28
原始信息汇总

数据集名称

  • GoldDIGR (DFT Reaction Calculation Dataset)

规模与格式

  • 包含约 1,000,000 个 xTB/DFT 反应计算数据。
  • 总大小约 800 GB,分为 425 个 .tar 压缩包(每个包含 ≤2500 个 .zip 文件)。
  • 每个计算任务为一个独立的 .zip 文件。

数据结构与布局

  • 目录结构
    • bundles/:存放 425 个 .tar 包及校验文件(SHA256SUMS、每个包的 .sha256 校验和)。
    • bundle_manifest.tsv:映射每个 .zip 到其所属的 bundle。
    • bundle_lists/bundle_XXXX.paths:每个 bundle 内的 .zip 列表。
  • .zip 文件存储路径<DOI_prefix>/<DOI_suffix>/<SI_stem>/<reaction>_<charge>_<multiplicity>.zip(例如 10.1039/C8SC02758G/c8sc02758g2/03_1_1.zip)。

每个反应 .zip 文件内容

  • DFT-SinglePoint/:ORCA 单点计算输出(.out, .xyz, .inp, CHELPG 电荷、模糊/Mayer/Wiberg 键级矩阵),以及 status.json(记录各驻点计算状态)。
  • xTB-scan/:GFN2-xTB 自旋/结构扫描数据(每帧几何、spin_scan_summary.csv 各自旋能量、bem_snapshots/ 每步能量+电荷+键级 JSON)。
  • IRC_Analysis/:IRC 轨迹分析(JSON + CSV)及反应总结。
  • 其他:TS-opt/IRC 轨迹文件(.trj, .xyz, .yaml)及元数据。

数据来源与处理

  • 从已发表化学论文的支持信息中挖掘原始输出,使用统一流程重新计算(几何优化/过渡态搜索、IRC、单点 DFT、xTB 自旋/结构扫描)。
  • 处理过程:无损清理(去除横幅、引用、压缩冗余文件),保留所有科学量(几何、能量、电荷、键级、轨道能量)。

更新机制

  • 持续更新,新 DFT 结果增量加入。
  • 仅重建和重新上传受影响的 bundle(通过 bundle_manifest.tsv 追踪)。

许可证

  • CC-BY-4.0

标签

  • chemistry, computational-chemistry, dft, reaction-mechanisms, orca, xtb。
搜集汇总
数据集介绍
GoldDIGR 数据集图片
构建方式
GoldDIGR数据集源自对已发表化学论文补充材料中约百万级反应计算的系统挖掘,并经过统一的自动化流程重新计算,涵盖几何优化、过渡态搜索、内禀反应坐标分析、单点DFT计算以及xTB自旋/结构扫描。原始输出经无损或仅移除冗余信息的清洗处理,如去除ORCA/xTB日志中的版权声明与网格模板、重新压缩未压缩成员、删除中间崩溃运行文件以及能量已保留于汇总文件中的逐帧xTB输出文件,最终以自包含的ZIP格式存储,并按DOI路径组织为425个TAR包分布发布。
特点
该数据集的核心特色在于其大规模与一致性,包含约百万个经统一计算流程处理的DFT反应数据,总容量约800 GB,且持续更新,新增DFT结果仅重构受影响的包并重新上传,利用Hugging Face的Xet后端实现跨版本去重。数据涵盖多种量子化学信息,包括ORCA单点计算输出的几何、能量、电荷、键级及轨道能量,xTB扫描的每帧几何与自旋扫描汇总,以及IRC分析中的反应路径摘要,为理论化学研究提供了标准化、完整的反应计算资源库。
使用方法
用户可通过Hugging Face CLI工具下载数据集,例如使用`huggingface-cli download`命令获取单个或全部TAR包,解压后即可在统一目录树中访问ZIP文件。每个反应ZIP包含DFT单点计算、xTB扫描和IRC分析三个子目录,并提供`status.json`文件记录各驻点的计算状态,便于筛选完整计算的任务。用户还可通过`bundle_manifest.tsv`文件查询每个ZIP对应的包编号,利用`sha256sum -c SHA256SUMS`验证数据完整性。
背景与挑战
背景概述
GoldDIGR数据集由国际计算化学团队构建,于2024年发布,旨在解决计算化学领域反应机理数据稀缺且缺乏标准化的问题。核心研究问题是:如何从已发表论文的支持信息中系统挖掘并重新计算反应路径数据,以构建大规模、高质量的DFT反应计算数据集。该数据集包含约100万个xTB/DFT反应计算实例,覆盖了从几何优化、过渡态搜索到IRC分析和单点能量计算的完整流程,为反应机理研究、机器学习势函数开发和计算化学基准测试提供了宝贵资源。其统一的计算管线(ORCA/xTB)和标准化输出格式,显著提升了数据的可复现性和可比性,已迅速成为计算化学领域的重要基础数据集,推动着自动化反应发现和数据驱动催化剂设计的进程。
当前挑战
GoldDIGR所解决的领域问题是计算化学研究中高质量反应数据缺乏的瓶颈,传统上研究者依赖手工采集或小规模计算,难以支撑机器学习模型的训练需求。构建过程中面临多重挑战:首先,从众多论文的支持信息中提取原始数据需要设计鲁棒的文本挖掘流程,处理各种非标准格式和缺失信息;其次,对百万级反应实例执行统一的DFT计算管线需解决计算资源调度和任务崩溃恢复问题,原始输出中混杂的崩溃运行文件和冗余日志必须被清洗;此外,数据以425个tar包(约800 GB)分发,需设计增量更新机制以保持长期可维护性,每个新计算结果的注入都需重新打包并同步版本,确保用户始终能获取一致的数据快照。
常用场景
经典使用场景
在计算化学领域,GoldDIGR数据集以其约100万条通过统一计算管线(包含xTB/DFT几何优化、过渡态搜索、内禀反应坐标分析及单点能计算)处理后的反应数据,为反应机理研究提供了标准化、大规模的参考基准。研究者常利用该数据集进行反应路径预测、过渡态几何与能量的高精度校验,以及通过对比不同理论级别(如GFN2-xTB与DFT)的结果,评估半经验方法的可靠性,从而加速催化反应中关键中间体和能垒的识别。
衍生相关工作
GoldDIGR的出现催生了一系列衍生研究工作,包括基于其反应能量和几何特征构建的图神经网络反应预测模型,这些模型能够从分子结构直接预测反应产率和选择性;此外,该数据集也被用于验证和改进半经验量子力学方法的参数化方案,以及作为迁移学习中的源域数据来增强小样本反应数据集的训练效果,进一步拓展了机器学习在有机合成和催化机制理解中的应用边界。
数据集最近研究
最新研究方向
GoldDIGR数据集代表了计算化学领域一项里程碑式的资源整合,通过从已发表论文的支撑信息中系统挖掘并统一重计算了约100万条xTB/DFT反应数据,覆盖几何优化、过渡态搜索、IRC分析及单点能计算等关键环节。该数据集为反应机理的深度学习与高通量虚拟筛选提供了标准化基准,尤其适用于训练基于图神经网络的反应能垒预测模型和自动化反应路径解析工具,推动了从实验数据碎片化到大规模可复现计算数据库的范式转变。其持续更新机制与统一的元数据架构(如携带多级电荷、自旋态及键级信息)更强化了在催化机理、有机合成设计及材料发现等前沿领域的应用价值,为构建可解释的量子化学机器学习模型奠定了数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务