遇见数据集

GoldDIGR-Past

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

GoldDIGR-Past 是 GoldDIGR 数据集的点时间快照集合,主要用于记录数据来源和进行版本追踪。该数据集由多个独立的快照组成,每个快照被分割成若干 tar 部分(按文件列表而非字节分割),提取所有部分后可合并成一个完整的目录树,无需使用 cat 命令重组。数据集内容涵盖多个变体,包括 doi_zips_slim(精简版)、doi_tar_zsts(压缩版)和 doi_zips_full(完整未精简版),以及一个单独策划的反应类别数据集(RxnClass-082025)。数据规模从 37.8 GB 到 2.1 TB 不等,总数据量巨大。反应类别快照包含按出版商(如 AAAS、CellPress、ACS、RSC 等)组织的化学反应数据,每个来源提供两种归档文件:一种包含渲染的 PDF 文件和过渡态优化结构的 xyz 坐标,另一种仅包含过渡态几何结构的 xyz 坐标。该数据集适用于化学信息学、计算化学、反应机理研究等领域,支持数据溯源、版本比较和化学反应数据的存储与分析。使用注意事项包括特定快照的提取方式(如无顶级目录)和文件前缀处理。

GoldDIGR-Past is a collection of point-in-time snapshots of the GoldDIGR dataset, used for recording data sources and version tracking. The dataset consists of multiple independent snapshots, each split into several tar parts (based on file lists rather than bytes), which can be extracted and merged into a complete directory tree without using the cat command for reassembly. It includes multiple variants such as doi_zips_slim (slim version), doi_tar_zsts (compressed version), and doi_zips_full (full unslimmed version), along with a separately curated reaction category dataset (RxnClass-082025). The data size ranges from 37.8 GB to 2.1 TB, with a massive total volume. The reaction category snapshots contain chemical reaction data organized by publishers (e.g., AAAS, CellPress, ACS, RSC), with each source providing two types of archive files: one includes rendered PDF files and xyz coordinates of transition state optimized structures, and the other contains only xyz coordinates of transition state geometries. The dataset is suitable for fields like cheminformatics, computational chemistry, and reaction mechanism research, supporting data provenance, version comparison, and storage and analysis of chemical reaction data. Usage notes cover extraction methods for specific snapshots (e.g., no top-level directory) and file prefix handling.

创建时间:
2026-06-30
原始信息汇总

GoldDIGR-Past 数据集概述

基本信息

  • 许可证: CC-BY-4.0
  • 用途: 提供 GoldDIGR 数据集的时间点快照,用于历史溯源
  • 当前可浏览数据集: GoldDIGR

数据格式

每个快照由独立的 tar 部分文件组成(按文件列表分割,非按字节分割),解压每个部分后合并为一棵树,无需 cat 重新组装。

快照内容

子文件夹 变体 日期 文件数量 大小
doi_zips_slim/20260605/ doi_zips_slim 2026-06-05 20 815.7 GB
doi_tar_zsts/20260524/ doi_tar_zsts 2026-05-24 5 37.8 GB
doi_tar_zsts/20260531/ doi_tar_zsts 2026-05-31 5 37.9 GB
doi_tar_zsts/20260609_lean/ doi_tar_zsts (精简版) 2026-06-09 2 41.5 GB
doi_zips_full/20260420/ doi_zips (完整未精简版) 2026-04-20 20 2.1 TB
RxnClass-082025/ 反应类 TS 优化包 2025-08 24 102.2 GB

RxnClass-082025 子集

这是一个独立整理、按出版商分类的反应类数据集(2025年8月快照)。每个来源包含两个压缩包:

  • <Publisher>-all-pdf-xyz-TSOPT-RxnClass.tar.gz:渲染的 PDF 文件及经过 TS 优化的结构 xyz 文件
  • <Publisher>-all-xyz-TS-TSOPT-RxnClass.tar.gz:过渡态几何文件

来源出版商: AAAS、CellPress、ACS(First/New/Other/Final)、JPCC、RSC、Wiley、SpringerNature。共 24 个压缩包,约 102 GB。

注意事项

  • doi_tar_zsts/20260524/ 快照没有顶层目录(条目直接从 10.1021/... 开始),需要自行创建目录后解压。
  • 其他快照会保留其 doi_zips_slim/doi_tar_zsts/ 前缀目录结构。
搜集汇总
数据集介绍
GoldDIGR-Past 数据集图片
构建方式
GoldDIGR-Past数据集作为GoldDIGR数据集的时间点快照集合,旨在为数据溯源提供历史版本记录。其构建方式采用独立tar分片策略,每个快照由多个按文件列表而非字节拆分的数据包构成,用户无需进行cat重新组装,仅需解压所有分片即可合并为统一的目录树。数据集包含多个变体与时间戳版本,例如doi_zips_slim、doi_tar_zsts及doi_zips_full等子文件夹,分别对应不同的数据压缩格式与时间点,并额外收纳了基于出版商的反应类过渡态优化结构包RxnClass-082025。
特点
该数据集的核心特点在于其时间点快照机制与模块化存储设计,为科研数据的可重复性与版本管理提供了可靠支持。各快照独立存储且包含明确的日期标识,便于研究者追溯特定时间节点的数据状态。数据集覆盖多种数据变体,从精简版doi_zips_slim到完整版doi_zips_full,数据量跨度从数十GB至数TB,可满足不同粒度的需求。尤其值得关注的是RxnClass-082025子集,它整合了来自AAAS、ACS、RSC等多家出版商的过渡态几何与PDF文件,为化学反应机理研究提供了结构化素材。
使用方法
用户可直接通过HuggingFace数据集页面获取各快照,根据所需时间点与数据变体选择对应子文件夹。每个快照由多个tar分片组成,下载后需将所有分片置于同一目录下逐一解压,即可自动合并为完整的数据树。对于doi_tar_zsts_20260524版本,需注意其缺少顶层目录,解压前应手动创建目标文件夹。RxnClass-082025子集则包含两类归档文件,分别存储渲染PDF与过渡态势能面优化结构,用户可按需提取使用。所有数据均遵循CC-BY-4.0许可协议,便于学术共享与二次开发。
背景与挑战
背景概述
GoldDIGR-Past数据集由研究团队于2025至2026年间创建,旨在为化学反应中间体(如过渡态)的几何结构提供高保真的时间点快照。该数据集聚焦于计算化学与材料科学领域,通过整合来自AAAS、ACS、RSC、Wiley、SpringerNature等多家权威出版商的结构化数据,解决了催化反应机理研究中高质量三维分子构型数据稀缺的难题。其发布促进了过渡态优化、反应路径预测等方向的发展,为机器学习驱动的化学模拟提供了基准资源,在计算化学领域具有重要的开源数据价值。
当前挑战
该数据集面临的挑战主要体现在两方面。在领域问题层面,化学反应过渡态的非平衡态特性导致实验获取困难,而理论计算数据的一致性(如不同泛函下的几何偏差)难以保证,这限制了模型对反应能垒的精确预测。在构建过程中,数据来源的异构性(如PDF结构、XYZ坐标格式差异)以及跨出版商版权协议下的数据清洗与标准化任务繁重,同时超大体积(如doi_zips_full版本达2.1TB)的分片存储与版本追踪也增加了维护复杂度。
常用场景
经典使用场景
GoldDIGR-Past数据集作为化学信息学与反应机理研究的基石,其核心价值在于提供了海量、可追溯的化学文献数据快照,尤其聚焦于反应类别的标注与过渡态结构的精确记录。研究者常将此数据集用于训练和评估机器学习模型,旨在从无序的文献集合中抽提反应模式、预测反应路径,并揭示反应条件的隐匿规律。凭借其多时间点快照特性,该数据集支持对数据演变过程的追溯分析,为动态研究数据增长导致的偏差漂移提供了独特视角,从而在计算化学与数据驱动发现交汇处开辟了新的探索维度。
衍生相关工作
围绕GoldDIGR-Past衍生的经典工作集中在反应表征学习与生成式化学模型两大前沿。例如,有团队利用其多源反应分类数据训练了基于图神经网络的反应类型分类器,实现了给定反应物与产物间机理类型的自动标注。另一些研究则从该数据集提供的过渡态几何结构出发,开发了能量走势预测模型,大幅提升了反应势能面采样的效率。此外,基于时间快照的版本对比分析,催生了数据漂移检测技术,使模型能自适应地抵抗文献出版趋势对预测稳定性的干扰,这些工作共同构筑了计算化学与数据科学交叉创新的坚实谱系。
数据集最近研究
最新研究方向
GoldDIGR-Past数据集作为化学领域反应数据集的时间序列快照集合,为反应过渡态几何结构、DOI元数据及反应分类的时序分析提供了独特资源。当前前沿研究方向聚焦于利用该数据集的多个时间节点快照(如2025-2026年间不同日期与变体的数据)追溯化学信息学的数据演变轨迹,支持反应预测模型的时间维度验证与历史版本对比。特别值得注意的是,其中RxnClass-082025子集整合了来自AAAS、CellPress、ACS等多家顶级出版商的反应分类数据,涵盖过渡态优化结构与渲染PDF,为开发基于出版物的自动化反应分类算法及大规模过渡态几何机器学习模型提供了关键基准。这一数据资产管理方式在推动化学数据库溯源标准化的同时,催化了反应动力学与高级计算化学结合的跨学科研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务