PepPCDB
收藏数据链接:
官方服务:
资源简介:
PepPCDB是一个本地部署项目,用于浏览和下载一个经过整理的PDB衍生的肽-蛋白质复合物图谱。该门户通过FastAPI后端和同源静态前端链接肽链、目标蛋白质、界面记录、功能注释和亲和力值。
PepPCDB is a locally deployed project for browsing and downloading a curated PDB-derived peptide-protein complex atlas. This portal connects peptide chains, target proteins, interface records, functional annotations and affinity values via a FastAPI backend and a homologous static frontend.
创建时间:
2026-05-27
原始信息汇总
数据集概述:PepPCDB
PepPCDB 是一个经过整理的、源自 PDB 的肽-蛋白质复合物图谱的本地部署项目,旨在提供浏览和下载功能。该项目通过 FastAPI 后端和同源静态前端,将肽链、目标蛋白质、界面记录、功能注释和亲和力值关联起来。
核心功能与用途
- 数据浏览与搜索: 用户可通过前端界面浏览和搜索肽-蛋白质复合物数据。
- 数据下载: 提供公开的快速下载 API,支持下载多种格式的数据文件。
- AlphaFold 3 输入生成: 提供便利工具,用于生成 AlphaFold 3 (AF3) 的 JSON 输入文件,用户可在浏览页面或通过命令行使用。
- 使用统计: 自动记录轻量级的聚合使用统计信息,包括首页访问和下载API的使用次数。
数据集内容与结构
- 核心数据资源:
data/filtered_peppi/: 结构数据集。data/peppcdb.sqlite3: SQLite 索引数据库。data/records/target_cards.jsonl: 目标蛋白质卡片信息。data/records/pep_annotations_patched.jsonl: 肽注释信息(包含亲和力数据)。
- 注释与功能: 注释数据包含功能注释和亲和力值。特别地,
pep_annotations_patched.jsonl文件在保留正式肽注释模式的同时,增加了has_affinity和标准化的affinity_text字段。 - 更新机制: 提供了
sync_release_data.sh等脚本用于更新数据集和注释记录。结构数据集的刷新可以独立于功能或亲和力注释的更新进行。
公开下载 API
用户可通过以下端点下载特定条目({entry_key})的数据文件:
GET /peppcdb/api/download/{entry_key}.zip: 条目 ZIP 包,包含源文件和生成的函数 JSON。GET /peppcdb/api/download/{entry_key}/{pdb_id}.cif: mmCIF 坐标文件。GET /peppcdb/api/download/{entry_key}/{pdb_id}_annotations.json: 肽链注释。GET /peppcdb/api/download/{entry_key}/{pdb_id}_interface.jsonl: 成对界面记录。GET /peppcdb/api/download/{entry_key}/{pdb_id}_function.json: 生成的函数、亲和力和目标卡片 JSON。GET /peppcdb/api/download/{entry_key}/function.json: 兼容性别名。 速率限制: 默认每个客户端 IP 每小时最多 100 个请求。
技术实现
- 后端: 基于 FastAPI 框架构建。
- 数据库: 使用 SQLite 作为索引数据库。
- 启动方式: 通过
./run.sh脚本启动,该脚本会自动创建虚拟环境、安装依赖并启动服务。 - ** AlphaFold 3 集成**: 支持从
filtered_peppi数据集读取完整的聚合物链记录,处理非标准残基,并为 AF3 输入生成bondedAtomPairs(跳过普通的肽骨架 C-N 键,保留环状/连接键和相关的 CCD 配体或聚糖实体)。相关配置生成工作流程源自配套项目afrun。
版本信息
- 当前文档/运行时版本: v0.8.3。
- 版本历史起始于 v0.1.0。
使用统计
- 存储: 轻量级聚合使用统计数据存储在
data/usage_stats.sqlite3。 - 计数方式: 按天统计唯一 IP 哈希值(首页访问和下载 API 使用)。
- 隐私: 不存储原始 IP 地址。
- 查看: 可通过
GET /peppcdb/api/usage-stats端点查看。
搜集汇总
数据集介绍

构建方式
PepPCDB是一个精心策划的来源于PDB的肽-蛋白质复合物图谱本地化部署项目。该数据集通过整合肽链、靶标蛋白、界面记录、功能注释以及亲和力值等多元信息构建而成。其构建流程依托FastAPI后端与同源静态前端,实现了数据的高效组织与呈现。数据资产包括结构数据集、靶标卡片、肽注释文件等,均通过脚本同步更新,确保与上游源数据保持一致。通过构建SQLite索引和支持多种数据格式的下载接口,PepPCDB为用户提供了全面且结构化的肽-蛋白质相互作用信息资源。
特点
该数据集最显著的特点在于其综合性与交互性。它不仅是PDB中肽-蛋白质复合物的静态收集,更通过精心构建的界面记录和功能注释,将肽链与靶标蛋白的互作细节以结构化方式呈现。数据集支持基于条目的深入浏览,包含结构浏览、本地3D查看以及AlphaFold 3输入生成等高级功能。同时,PepPCDB设计了轻量级的使用统计机制,能匿名记录访问与下载频次,为资源的使用情况提供宏观概览。此外,其可扩展的架构允许功能与亲和力注释随着新的数据发布而逐步完善,展现了持续迭代的潜力。
使用方法
PepPCDB的使用方法灵活多样,既可本地部署又可远程调用。用户可通过`./run.sh`脚本快速启动应用,在本地环境浏览和搜索数据。对于程序化访问,数据集提供了稳定的公共快速下载API,支持通过HTTP GET请求获取条目压缩包、mmCIF坐标文件、注释JSON及界面记录等资源,并设有基于IP的速率限制。高级用户还能利用附带的脚本生成AlphaFold 3所需的JSON输入文件,以适应特定的计算预测工作流。数据集的路径和数据库可通过环境变量灵活配置,便于集成到不同的运行环境中。
背景与挑战
背景概述
PepPCDB是由研究者Zhai Silong等人于近年构建的一个专注于肽-蛋白质复合物的本地化部署数据库项目。该数据集的核心研究问题在于系统性地整合来自PDB(蛋白质数据库)的肽链、目标蛋白、界面记录、功能注释及亲和力数据,通过FastAPI后端与同源静态前端提供浏览与下载服务。PepPCDB的出现填补了肽-蛋白复合物结构化数据集中管理与便捷获取的空白,为计算生物学、药物设计及蛋白质相互作用研究领域提供了一个重要的数据基础设施,其影响力体现在对AlphaFold 3输入生成、功能注释扩充及高通量数据下载等下游工作的支撑上。
当前挑战
PepPCDB面临的挑战包括:领域问题层面,肽-蛋白复合物界面预测与功能注释的精度不足是核心难题,现有数据集中非标准残基的编码映射(如CCD到单字母序列的转换)及亲和力值的标准化仍存在不完善之处。构建过程中,数据源的规模庞大且持续更新,需通过rsync同步与定期脚本刷新维护数据一致性;同时,本地化部署环境依赖版本控制(如Python虚拟环境与SQLite索引),且上游数据集的手动功能与亲和力注释覆盖率有限,导致未标注条目需依赖结构浏览与下载功能的临时支撑。此外,预计算MSA文件的体积庞大,使得直接预测工作流仍处于内部测试阶段,公开API的速率限制(每IP每小时100次)也约束了高并发场景下的访问效率。
常用场景
经典使用场景
在蛋白质-肽相互作用研究领域,PepPCDB作为一个精心整理的PDB衍生肽-蛋白复合物图谱数据库,其经典使用场景聚焦于系统性地探索与解析肽链与靶标蛋白之间的结合模式。研究者能够借助该数据库的本地部署界面,高效检索特定复合物的三维结构信息、界面残基互作细节以及功能注释。通过内置的AlphaFold 3输入文件生成工具,用户可便捷地将实验结构数据转化为预测模型输入,从而在计算层面验证或扩展对肽-蛋白识别机制的理解。这一功能尤其适用于开展大规模构象分析与结合亲和力预测研究,为深入揭示分子识别规律提供了坚实的数据基础。
衍生相关工作
PepPCDB的诞生衍生了多项具有影响力的代表性工作,显著促进了肽-蛋白互作研究的方法学发展。其附属项目afrun通过整合AlphaFold 3预测流程,构建了从数据库结构解析到多序列比对富集的全链路计算框架,使得用户能够直接基于PepPCDB条目生成高置信度的复合物结构预测。数据库采用的统一注释模式与亲和力归一化方案,已被后续研究采纳为构建更广泛互作网络的标准模板。此外,其开放的本地化部署架构与精细化的使用统计机制,为后续开发面向特定疾病靶标(如MHC-肽复合物或GPCR配体)的专门化数据库树立了可复用的技术范式,持续激发着结构信息学领域的创新活力。
数据集最近研究
最新研究方向
PepPCDB聚焦于肽-蛋白质复合物结构数据库的本地化部署与功能拓展,当前前沿方向主要围绕两大核心:其一是集成AlphaFold 3(AF3)输入生成工具,实现从实验结构到深度学习预测的无缝衔接,支持自定义配对、链选择及键合原子对配置,为肽类药物设计与蛋白互作机制研究提供计算驱动的新范式;其二是构建轻量化、开放访问的快速下载API与使用统计系统,通过标准化mmCIF坐标、界面记录与功能注释的批量导出,推动可重复计算与大规模数据挖掘。这些进展紧密关联着AI辅助蛋白质设计、多肽靶向治疗等热点领域,不仅降低了计算结构生物学的研究门槛,还为整合实验与预测数据的知识图谱构建奠定了基础设施,对加速精准医学中的肽类先导化合物发现具有里程碑意义。
以上内容由遇见数据集搜集并总结生成



