遇见数据集

Monomer database datasets

收藏
github2026-07-30 更新2026-07-31 收录
官方服务:

资源简介:

单体数据库数据集,包含生成的结构化表示、确定性表格转换、制表符分隔转换、2D结构及所有JSON字段作为分子属性的SD文件,以及JSON Schema和校验和文件。

This single-molecule database dataset comprises generated structural representations, deterministic table conversions, tab-separated format conversions, 2D molecular structures, SD files with all JSON fields serving as molecular properties, as well as JSON Schema files and checksum files.

创建时间:
2026-07-18
原始信息汇总

数据集概述

Monomer database datasets 是一个由 ProteinQure 组织创建和维护的公开数据集仓库,提供单体数据库(Monomer Database)的版本化输出文件。该数据集基于权威源仓库 monomer-database-source 生成,并通过 Zenodo 提供存档和下载服务。本数据集专为可重复性研究设计,用户应使用标记的 GitHub 发布版本或对应的 Zenodo 版本,而非 main 分支。


数据内容与文件格式

每个版本发布包含以下六种文件,均存放于 data/ 目录下:

  • monomers.json:生成的 JSON 结构化表示,记录字段结构一致。
  • monomers.csv:由 JSON 确定性转换的表格数据。
  • monomers.tsv:制表符分隔的等价转换文件。
  • monomers.sdf:包含 2D 结构和所有 JSON 字段作为分子属性的 SD 文件。
  • monomers.schema.json:JSON 数据的模式定义(JSON Schema)。
  • SHA256SUMS:上述五个数据文件的校验和列表。

所有文件采用 UTF-8 编码和 LF 行尾格式。表格列的顺序遵循 JSON 首条记录的键顺序。


验证与使用

  • 快速校验:下载全部六个文件后,可在 data/ 目录下运行以下命令验证校验和,无需额外软件: bash sha256sum --check SHA256SUMS

  • 完整验证:若需全面验证,可将六个文件置于仓库的 data/ 目录下,运行 uv run scripts/verify_release.py data。该脚本会从 JSON 源重建 CSV、TSV 和 SDF,进行字节级比较,验证 JSON Schema,并检查 SHA256SUMS。依赖通过内联 PEP 723 元数据声明,测试可运行 uv run scripts/run_tests.py


来源与版本控制

  • 每个数据集发布均源自相同标签的源仓库发布(例如,数据集标签 v0.0.1 对应源标签 v0.0.1)。
  • 源仓库负责转换流程,本仓库独立重建各输出格式,进行字节级比对、校验和验证,然后创建数据集 GitHub 发布。
  • main 分支可能在发布后更新;标签、GitHub 发布或版本特定的 Zenodo DOI 标识不可变快照。
  • 最新存档数据集可通过 Zenodo 全版本记录 获取;版本 v1.0.0 永久可用,DOI 为 10.5281/zenodo.21684534

贡献与纠错

  • 请勿直接编辑生成的文件或在仓库中提出数据修改建议。
  • 数据、模式、工具或文档的相关问题或建议应提交至 ProteinQure/monomer-database-source,并注明受影响的记录标识符及版本或 DOI。

引用与许可

  • 使用版本 v1.0.0 时,请引用:

    ProteinQure. (2026). Monomer database datasets (Version v1.0.0) [Dataset]. Zenodo. https://doi.org/10.5281/zenodo.21684534

  • 其他版本请参考对应 Zenodo 记录上的引用信息和版本特定 DOI。
  • 数据集、模式及文档采用 Creative Commons Attribution-ShareAlike 4.0 International 许可;仓库自动化代码采用 GNU Affero General Public License v3.0 或更高版本 许可。要求的署名为 ProteinQure
搜集汇总
数据集介绍
Monomer database datasets 数据集图片
构建方式
该数据集由ProteinQure组织构建,源自权威的monomer-database-source仓库,通过自动化工作流生成并定期发布。数据集以版本化方式提供,每个版本包含JSON、CSV、TSV、SDF及JSON Schema等多种格式的产物,并附有SHA256SUMS校验和文件,确保数据的完整性和可复现性。构建过程严格遵循源仓库的标签版本,保证了产出的可追溯性与一致性。
使用方法
使用者可通过GitHub标签或Zenodo DOI获取固定版本的数据集,避免使用动态的main分支以保证可复现性。下载后,可使用sha256sum命令校验文件完整性,或运行仓库中的验证脚本自动重建CSV、TSV和SDF文件并与JSON比对。数据记录采用一致的字段结构,UTF-8编码,便于解析。引用时需遵循CITATION.cff或Zenodo记录,注明ProteinQure为创作者,以符合许可要求。
背景与挑战
背景概述
Monomer database datasets是由ProteinQure团队于2026年创建并维护的结构化单体数据库版本化输出集合,旨在为计算化学与药物设计领域提供一致、可验证的单体分子数据。该数据集通过Zenodo存档,并配有完整的校验与版本管理机制,其核心研究问题在于如何以可复现的方式生成和分发高精度的单体结构数据,以支持分子模拟、虚拟筛选及机器学习模型的训练。自发布以来,该数据集凭借其严谨的构建流程和开放许可,已成为相关领域研究的重要参考资源,促进了跨机构合作与数据共享。
当前挑战
该数据集面临的挑战主要集中于数据一致性与可复现性层面。在构建过程中,需要确保从源存储库到各格式(JSON、CSV、TSV、SDF)转换的字节级一致性,并验证所有字段的完整性与Schema合规性,这要求极其严格的自动化测试与校验流程。此外,领域问题层面,单体数据库需要涵盖多样化的化学结构,同时保持数据的高精度与时效性,以应对药物设计中快速演进的需求。版本管理也是一大难点,需在保证不可变快照的同时,支持持续更新与社区贡献,避免数据分叉或错误引入,这对数据治理和协作机制提出了高标准要求。
常用场景
经典使用场景
该单体数据库数据集为计算化学与药物设计领域提供了标准化的分子构建模块信息,其经典使用场景集中在基于片段的药物发现(FBDD)与虚拟筛选流程中。研究者可借助JSON、CSV、TSV及SDF等多元格式,高效集成单体分子的二维结构及其理化性质,作为组合库设计的核心数据源。通过SHA256校验和确保数据完整性,该数据集支持可重复的分子对接、药效团建模及定量构效关系(QSAR)分析,成为连接分子结构信息与计算模拟的关键桥梁。
解决学术问题
此数据集系统性地解决了学术研究中单体分子数据碎片化、格式不统一及来源不可追溯等长期痛点。其采用严格的版本控制与不可变快照机制,为数据溯源与结果复现提供了坚实基础。通过标准化字段定义与确定性格式转换,该数据集大幅降低了数据清洗与预处理成本,使研究者得以将精力聚焦于核心科学问题,如分子多样性分析、化学空间探索及新药先导物优化,从而加速计算驱动的基础研究发现。
实际应用
在实际应用中,该数据集广泛服务于药物研发管线中的多个环节,包括虚拟化合物库的构建、分子相似性搜索以及机器学习模型的训练与验证。制药企业与生物技术机构可依据此数据集快速生成候选分子集合,用于高通量筛选的预筛选,或作为生成式化学模型的训练语料。其SDF格式与主流分子建模软件无缝兼容,支持直接导入到分子编辑与可视化工具中,显著提升了从数据到实验验证的转化效率。
数据集最近研究
最新研究方向
在计算化学与药物设计领域,单体数据库的规范化与版本化成为支撑可重复性研究的关键基础设施。该数据集通过Zenodo归档与GitHub发布流程,提供了JSON、CSV、TSV及SDF等多种格式的确定性转化产物,并配套JSON Schema与SHA256SUMS校验文件,确保了数据完整性与可追溯性。前沿研究方向聚焦于将此类结构化单体数据整合进自动化药物发现管线,利用2D结构信息与分子属性驱动深度学习模型训练,以及构建跨平台的数据互操作标准。随着开放科学倡导可验证的计算工作流,该数据集的出现回应了科研界对数据溯源和版本控制的迫切需求,其影响在于降低复现门槛、促进合作研究,并为单体库的持续演进提供了权威参照,推动了计算化学从数据私有化向开放共享的范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务