Monomer database datasets
收藏资源简介:
单体数据库数据集,包含生成的结构化表示、确定性表格转换、制表符分隔转换、2D结构及所有JSON字段作为分子属性的SD文件,以及JSON Schema和校验和文件。
This single-molecule database dataset comprises generated structural representations, deterministic table conversions, tab-separated format conversions, 2D molecular structures, SD files with all JSON fields serving as molecular properties, as well as JSON Schema files and checksum files.
数据集概述
Monomer database datasets 是一个由 ProteinQure 组织创建和维护的公开数据集仓库,提供单体数据库(Monomer Database)的版本化输出文件。该数据集基于权威源仓库 monomer-database-source 生成,并通过 Zenodo 提供存档和下载服务。本数据集专为可重复性研究设计,用户应使用标记的 GitHub 发布版本或对应的 Zenodo 版本,而非 main 分支。
数据内容与文件格式
每个版本发布包含以下六种文件,均存放于 data/ 目录下:
monomers.json:生成的 JSON 结构化表示,记录字段结构一致。monomers.csv:由 JSON 确定性转换的表格数据。monomers.tsv:制表符分隔的等价转换文件。monomers.sdf:包含 2D 结构和所有 JSON 字段作为分子属性的 SD 文件。monomers.schema.json:JSON 数据的模式定义(JSON Schema)。SHA256SUMS:上述五个数据文件的校验和列表。
所有文件采用 UTF-8 编码和 LF 行尾格式。表格列的顺序遵循 JSON 首条记录的键顺序。
验证与使用
-
快速校验:下载全部六个文件后,可在
data/目录下运行以下命令验证校验和,无需额外软件: bash sha256sum --check SHA256SUMS -
完整验证:若需全面验证,可将六个文件置于仓库的
data/目录下,运行uv run scripts/verify_release.py data。该脚本会从 JSON 源重建 CSV、TSV 和 SDF,进行字节级比较,验证 JSON Schema,并检查SHA256SUMS。依赖通过内联 PEP 723 元数据声明,测试可运行uv run scripts/run_tests.py。
来源与版本控制
- 每个数据集发布均源自相同标签的源仓库发布(例如,数据集标签
v0.0.1对应源标签v0.0.1)。 - 源仓库负责转换流程,本仓库独立重建各输出格式,进行字节级比对、校验和验证,然后创建数据集 GitHub 发布。
main分支可能在发布后更新;标签、GitHub 发布或版本特定的 Zenodo DOI 标识不可变快照。- 最新存档数据集可通过 Zenodo 全版本记录 获取;版本
v1.0.0永久可用,DOI 为 10.5281/zenodo.21684534。
贡献与纠错
- 请勿直接编辑生成的文件或在仓库中提出数据修改建议。
- 数据、模式、工具或文档的相关问题或建议应提交至
ProteinQure/monomer-database-source,并注明受影响的记录标识符及版本或 DOI。
引用与许可
- 使用版本
v1.0.0时,请引用:ProteinQure. (2026). Monomer database datasets (Version v1.0.0) [Dataset]. Zenodo. https://doi.org/10.5281/zenodo.21684534
- 其他版本请参考对应 Zenodo 记录上的引用信息和版本特定 DOI。
- 数据集、模式及文档采用 Creative Commons Attribution-ShareAlike 4.0 International 许可;仓库自动化代码采用 GNU Affero General Public License v3.0 或更高版本 许可。要求的署名为 ProteinQure。




