PINDER
收藏资源简介:
PINDER是一个用于训练和评估蛋白质-蛋白质对接算法的数据集和资源。它是之前最先进数据集的约500倍大,并且是第一个包含配对预测和apo结构的集合,用于训练灵活对接方法。
PINDER is a dataset and resource for training and evaluating protein-protein docking algorithms. It is approximately 500 times larger than prior state-of-the-art datasets, and it is the first collection that includes paired predictions and apo structures for training flexible docking methods.
PINDER: The Protein INteraction Dataset and Evaluation Resource
数据集概述
pinder,全称为protein interaction dataset and evaluation resource,是一个用于训练和评估蛋白质-蛋白质对接算法的数据集和资源。该数据集比以往最先进的数据集大~500倍,并且是第一个包含配对预测和apo结构的用于训练柔性对接方法的数据集。
数据集大小和存储
数据集大小约为700GB,托管在Google Cloud Storage上,可通过gs://pinder桶访问。
数据集内容
数据集包含以下内容:
pdbs/:包含单体和真实二聚体PDB结构mappings/:包含holo和apo单体的PDB<->uniprot映射信息,以及原始PDB装配信息index.parquet:包含pinder中每个二聚体的主索引metadata.parquet:包含索引中每个条目的附加元数据详细信息
数据集版本
当前数据集的版本为2024-02,详细变更日志可在data changelog中查看。
数据集下载
推荐通过提供的Python API进行交互式下载,默认下载路径为~/.local/share/pinder/<release version>。也可以手动下载,但需要安装gsutil工具。
数据集更新
对于索引或元数据的非破坏性变更,可以使用pinder_update_index命令进行本地同步。对于结构文件的变更,可以使用pinder_sync_data命令进行同步。
数据集使用
数据集用于训练和评估蛋白质-蛋白质对接算法,包含多个基准测试集和验证集。具体包括:
- Gold standard benchmark sets:包含多个高质量的基准测试集
- Validation holdout set:验证集
- Training set:训练集,包含大量训练示例
评估工具
提供了一个完整的评估工具,包含高效的Python或Rust实现的评估指标,如DockQ。评估工具可以通过pinder.eval方法或CLI脚本使用。
提交方法
推荐使用pinder_create_submission CLI脚本创建提交,以便将方法提交到排行榜。




