Monomer database
收藏官方服务:
资源简介:
ProteinQure单体数据库的源数据,包含单体信息的JSON格式数据。
The source data of the ProteinQure Monomer Database is JSON-formatted data containing monomer information.
创建时间:
2026-07-18
原始信息汇总
Monomer Database 数据集总结
概述
Monomer Database 是 ProteinQure 开发的一个单体数据库,以 JSON 格式存储权威数据。该数据集是 ProteinQure 单体数据库的唯一可编辑来源,主要用于记录和发布单体分子的结构数据及相关属性。
数据内容与格式
- 核心数据文件:
data/monomers.json,是一个非空的 JSON 对象数组,每个对象必须具有完全相同的字段。 - 输出格式:支持 CSV、TSV、SDF 三种格式的转换。其中 SDF 格式利用每条记录的
SMILES值生成二维结构,并将所有 JSON 字段作为 SD 属性包含在内。 - 字段与类型约束:由
schema/monomers.schema.json定义机器可读的字段与类型契约。 - 特殊值处理:布尔值转换为
true/false,null转换为空单元格,嵌套数组或对象转换为紧凑键值排序的 JSON 字符串。
数据管理机制
- 源仓库(当前仓库):负责权威 JSON 数据、转换与验证代码、测试及发布自动化,接受数据修改。
- 生成仓库(
monomer-database-datasets):仅包含版本化的输出文件(供下载和 Zenodo 存档),不接受直接修改;每个发行版对应源仓库中的标签。 - 验证流程:通过运行测试、模式校验和格式转换验证(脚本对 CSV、TSV、SDF 分别执行验证)。
版本发布与可复现性
- 当发布带有语义化版本标签(如
v0.0.1)的 GitHub 版本时,会自动触发发布流程。 - 发布流程包括:验证源 JSON 模式 → 构建并验证所有输出格式 → 复制输出及模式到数据集仓库 → 生成
SHA256SUMS校验文件 → 提交生成文件 → 推送不可变标签 → 数据集仓库验证并创建供 Zenodo 存档的 GitHub 版本。
引用与许可
- 数据许可:数据、模式和文档采用 Creative Commons Attribution-ShareAlike 4.0 International 许可。
- 代码许可:可执行代码、测试和自动化采用 GNU Affero General Public License v3.0 或更高版本 许可。
- 署名要求:请求的署名名称为 ProteinQure,其为组织创建者。
搜集汇总
数据集介绍

构建方式
在蛋白质设计研究的广阔天地中,构建体的化学多样性是探索新型治疗分子的基石。Monomer database应运而生,其构建源于对可合成化学空间的系统性梳理。该数据集以权威的JSON文件为唯一真相源,精心编排了每个单体的结构信息,包括SMILES表达式、物化性质及序列标识。借助自动化转换脚本,数据被精准地映射至CSV、TSV与SDF等多种格式,确保信息在不同应用场景下的无缝流转。整个构建流程融入了严格的质量控制,通过模式验证与一致性检查,保障了数据的完整性与可靠性。
使用方法
使用者可便捷地获取该数据集,通过GitHub发布下载或Zenodo档案获取版本化格式。本地操作时,借助uv工具与内置脚本,能够轻松执行格式转换与验证。例如,运行`uv run scripts/convert.py --output-type sdf data/monomers.json build/monomers.sdf`即可生成SDF文件。所有输出均统一采用UTF-8编码与LF换行,确保了跨平台的兼容性。对于深度集成,机器可读的JSON Schema定义了字段与类型的契约,便于程序化解析。数据集以CC BY-SA 4.0协议授权,便于学术共享,而代码则以AGPL v3.0保护,使用时应遵循相应条款,并正确署名ProteinQure。
背景与挑战
背景概述
Monomer database是由ProteinQure团队构建的权威性单体数据库,旨在为计算蛋白质设计与药物发现提供标准化的化学构件数据。随着人工智能驱动的蛋白质工程蓬勃发展,研究人员亟需高质量、格式统一的单体信息以支持分子建模与虚拟筛选。该数据库以JSON为源数据,自动生成CSV、TSV及SDF等多种格式,并通过严格的模式验证与自动化测试确保数据完整性与可复现性。自创建以来,该数据库通过版本化发布与Zenodo归档,成为领域内可信赖的数据基础设施,推动了计算生物学研究的可重复性与协作效率。
当前挑战
该数据库在构建与应用中面临多重挑战。领域层面,蛋白质设计依赖精确的分子表征,单体数据的不一致或缺失可能导致模型预测偏差,因此需确保数据的化学准确性与格式兼容性。构建过程中,从源JSON到多格式输出的转换需处理嵌套结构、布尔值及空值等复杂情况,同时维持列序稳定;SDF生成依赖RDKit的2D结构计算,需锁定其版本以保证可复现性。此外,数据更新需通过严格的验证流程,包括模式校验、跨格式一致性检查及自动化测试,以维护多仓库间的同步与发布质量。
常用场景
经典使用场景
该数据集作为蛋白质设计领域的核心资源,主要应用于计算化学与结构生物学中的单体分子库构建。研究者常将其作为权威的分子结构信息来源,通过标准化格式(如CSV、TSV、SDF)读取单体数据,用于分子对接、虚拟筛选及从头设计蛋白质配体等经典研究流程。其机器可读的JSON源文件与可复现的转换工具链,保证了数据在不同计算环境下的无缝集成与高效利用。
解决学术问题
该数据集解决了学术界在蛋白质单体数据整合与标准化方面的关键难题。长期以来,单体数据分散于多种数据库,格式不一,难以直接用于大规模计算分析。此数据集通过提供经过验证的统一JSON架构及多格式输出,消除了数据清洗与格式转换的障碍,显著提升了研究的可重复性和数据可比性。其释放流程与版本控制机制,进一步保障了数据的长期可追溯性,为后续研究奠定了坚实基础。
实际应用
在实际应用中,该数据集被广泛用于药物发现和生物技术领域。研究机构和企业可借助其标准化的单体库,快速搭建虚拟筛选平台,评估候选药物分子与蛋白质靶点的结合能力。同时,其SDF格式的二维结构生成功能,支持了分子可视化与结构分析工具的直接使用,加速了先导化合物优化和蛋白质工程设计的流程。该数据集已成为连接实验研究与计算模拟的重要桥梁。
数据集最近研究
最新研究方向
在计算化学与药物设计的前沿领域,单体数据库作为分子构建模块的权威数据源,正日益成为推动自动化分子生成与虚拟筛选研究的关键基础设施。该数据库通过严格的模式验证与多格式输出(CSV、TSV、SDF),确保了数据的机器可读性与互操作性,其与Zenodo的集成及版本化发布机制,彰显了开放科学与可重复性研究的最新趋势。当前,围绕该数据库的研究重心聚焦于如何利用其高精度的小分子结构信息,结合深度学习模型,加速新型药物候选物的发现,以及通过标准化流程实现跨平台的数据共享与复用,从而支撑起从靶点识别到先导物优化的全链条计算工作流。
以上内容由遇见数据集搜集并总结生成



