遇见数据集

LiteFold/PDB-CCD

收藏
Hugging Face2026-05-27 更新2026-06-21 收录
官方服务:

资源简介:

PDB-CCD是蛋白质数据库(Protein Data Bank)使用的化学组分词典,用于描述大分子结构中的残基、修饰残基、配体、溶剂和其他化学组分。

PDB-CCD is the Chemical Component Dictionary used by the Protein Data Bank to describe residues, modified residues, ligands, solvents, and other chemical components in macromolecular structures.

提供机构:
LiteFold
搜集汇总
数据集介绍
LiteFold/PDB-CCD 数据集图片
构建方式
PDB-CCD(Protein Data Bank Chemical Component Dictionary)数据集源自蛋白质数据库官方维护的化学组件字典,系统收录了所有在生物大分子结构中出现的残基、修饰残基、配体、溶剂及其他化学实体。数据集以Parquet格式存储,并按照确定性哈希算法对组件标识符进行分割:即对component_id进行SHA256哈希并取模10,将余数为0的样本划入测试集,其余归入训练集,从而确保了拆分的一致性与可复现性。最终数据集包含超过50,000个化学实体,其中训练集45,045条,测试集5,009条。
特点
该数据集涵盖了丰富的化学与结构信息,每一个组件均包含完整的化学式、分子量、形式电荷、原子坐标、化学键连接性以及多种化学描述符(如SMILES、Canonical SMILES、InChI与InChIKey)。此外,还提供了组件类型(如NON-POLYMER、L-PEPTIDE LINKING等)、发布状态、审计历史、父级组件编号、单字母与三字母代码和同义名称等元数据。特别值得注意的是,数据集内包含613个经过蛋白质化学修饰(PCM)注释的残基,为结构生物学和计算化学研究提供了极其详实且可溯源的基础数据。
使用方法
用户可通过Hugging Face Datasets库便捷加载该数据集,推荐使用Python环境并执行`pip install datasets`完成依赖安装。加载时可直接调用`load_dataset("LiteFold/PDB-CCD")`获取全部数据,亦可指定`split="train"`或`split="test"`以读取特定子集。对于大规模分析场景,支持流式读取(streaming=True),无需下载完整表格即可逐批处理数据。此外,数据集提供丰富的过滤功能,例如可按发布状态、组件类型、InChIKey存在性及修改日期等条件筛选所需化学实体,极大便利了后续的计算分析与模型构建工作。
背景与挑战
背景概述
PDB-CCD(Protein Data Bank Chemical Component Dictionary)是由John D. Westbrook、Chuming Shao等研究人员于2015年创建的结构生物学与化学交叉领域核心数据集,源自Rutgers大学与欧洲生物信息学研究所等机构的合作。该数据集系统收录了蛋白质数据库(PDB)中所有小分子化学组分的完整描述,涵盖标准残基、修饰残基、配体、溶剂及其他辅因子,共计超过5万种组分。通过提供统一的原子、键、描述符及标识符信息,PDB-CCD为解析大分子三维结构中的化学细节奠定了数据基础,极大地推动了结构生物学、药物设计及计算化学领域的发展,成为相关研究不可或缺的参照标准。
当前挑战
该数据集面临的核心挑战在于化学组分的多样性与动态更新带来的复杂管理问题。从领域角度看,PDB中集成的非标准残基、配体及修饰基团种类繁多,其准确的化学建模与一致性描述对结构解析和生物功能推断至关重要。在构建过程中,数据整合面临格式兼容性挑战,需从mmCIF等异构源中提取并归一化原子坐标、键序、立体化学及电荷信息;同时,需在版本迭代中妥善处理过时组分的废弃与替换逻辑,确保数据集的可追溯性与长期可用性。此外,描述符(如SMILES、InChI)的自动生成与人工校验之间的平衡,也是维护数据质量的技术难点。
常用场景
经典使用场景
在结构生物学与化学信息学交叉领域,PDB-CCD数据集作为蛋白质数据库(PDB)的核心化学组分百科全书,为研究者提供了超5万种化学组分的系统性描述。其经典使用场景涵盖对残基、修饰残基、配体、溶剂及小分子的三维结构建模与化学属性标注,通过原子坐标、键序、形式电荷、立体化学构型及规范SMILES、InChI等分子描述符的集成,支持从单分子解析到复杂生物大分子体系的结构功能关联分析。
衍生相关工作
围绕PDB-CCD衍生的经典工作涵盖了多个技术方向:基于图神经网络的配体活性预测模型如GraphDTA与3D-GCN,常以该数据集的原子键拓扑与空间坐标作为分子图构建基准;面向蛋白质-配体复合物的几何深度学习框架如EquiDock与DiffDock,依赖其组分描述符进行环境感知的构象生成;同时,该数据集催生了多项关于化学组分分类与演化规律的研究,包括非聚合物配体类型分布分析及修饰残基的序列偏好性推断。
数据集最近研究
最新研究方向
PDB-CCD作为蛋白质数据库(PDB)的化学组件词典,细化了生物大分子结构中残基、配体及溶剂等化学成分的标准化描述。在当前结构生物学与计算化学交叉融合的前沿,该数据集被广泛用于基于深度学习的配体-蛋白质相互作用预测、从头药物设计以及小分子生成模型等热点研究方向。其全面收录的SMILES、InChIKey及键级与立体化学信息,为构建高保真化学图谱提供了关键支撑,显著推动了虚拟筛选和逆向分子设计的发展。此外,通过整合PCM蛋白质修饰注释与时间戳字段,PDB-CCD在翻译后修饰的动态解析和新颖配体的时序研究中亦展现出独特价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务