遇见数据集

plinder-cistrans-209

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

PLINDER cis/trans 构象异构体基准数据集(209 个系统)是一个从 PLINDER 数据集中精心筛选出的子集,专门用于评估结构预测方法在预测蛋白质-配体复合物时,是否能够正确保持配体中双键的 E/Z(顺式/反式)立体化学构型。该数据集包含 209 个经过筛选的蛋白质-配体系统,每个系统都提供了进行结构预测和结果评估所需的完整数据:蛋白质的多序列比对文件 (MSA,ColabFold/MMseqs2 生成,以 xz 格式压缩)、配体的 SMILES 字符串表示以及来自晶体结构的参考配体结构 (SDF 格式)。数据集的筛选标准严格,从原始的 484 个具有顺反异构能力配体的系统中,剔除了 275 个无法可靠评分的系统,仅保留那些含有至少一个非环状(受约束)且其 E/Z 构型仅由重原子坐标即可判定(氢原子可判定)的双键,并且不包含任何受约束但不可判定双键(如存在互变异构)的配体。该数据集最初作为 Restraint-Guided Inference (RGI) 方法中 `cistrans` 评分项的评估集而构建,但其设计是通用的,适用于任何能够输出配体三维坐标的预测方法。数据集的一个已知局限性是排除了大环化合物(如大环内酯)中的双键,这是由于底层约束引擎的限制,而非数据集的筛选偏好。数据以标准格式组织,包含索引文件 (`index.csv`)、压缩的 MSA 文件和 SDF 文件,便于直接用于计算评估。数据集基于 CC-BY-4.0 许可证发布,数据来源于 PLINDER、RCSB PDB、UniProt/UniRef100 和 MGnify 蛋白质数据库。

The PLINDER cis/trans conformational isomer benchmark dataset (209 systems) is a carefully curated subset of the PLINDER dataset, specifically designed to evaluate whether structure prediction methods can correctly maintain the E/Z (cis/trans) stereochemical configuration of double bonds in ligands when predicting protein-ligand complexes. This dataset contains 209 filtered protein-ligand systems, each providing complete data required for structure prediction and evaluation: protein multiple sequence alignment files (MSA, generated by ColabFold/MMseqs2, compressed in xz format), SMILES string representations of the ligand, and reference ligand structures from crystal structures (SDF format). The screening criteria are strict: from the original 484 systems with ligands capable of cis/trans isomerism, 275 systems that cannot be reliably scored were removed, retaining only those ligands that contain at least one non-cyclic (constrained) double bond whose E/Z configuration can be determined solely from heavy atom coordinates (hydrogen atoms can be determined), and do not contain any constrained but indeterminable double bonds (e.g., due to tautomerism). This dataset was originally constructed as an evaluation set for the `cistrans` scoring term in the Restraint-Guided Inference (RGI) method, but its design is general and applicable to any prediction method that can output three-dimensional coordinates of ligands. A known limitation of the dataset is the exclusion of double bonds in macrocyclic compounds (e.g., macrolides), due to limitations of the underlying constraint engine rather than dataset screening preferences. Data is organized in standard formats, including an index file (index.csv), compressed MSA files, and SDF files, facilitating direct use in computational evaluation. The dataset is released under the CC-BY-4.0 license, with data sourced from PLINDER, RCSB PDB, UniProt/UniRef100, and MGnify protein databases.

创建时间:
2026-07-17
原始信息汇总

PLINDER 顺/反构象基准数据集(209 个系统)

数据集概述

本数据集是 PLINDER 的一个经过精心筛选的子集,包含 209 个系统,专门用于评估结构预测模型是否能正确保留配体双键的 E/Z(顺/反)构型。每个系统提供蛋白质 MSA、配体 SMILES 和晶体配体 SDF 文件,可用于折叠和评分。

筛选标准

从 PLINDER 的 484 个原始系统中,剔除了 275 个无法评分的系统,只保留双键同时满足以下两个条件的系统:

  • 受约束(非环状、非芳香族)
  • 氢可判定(仅由重原子坐标即可确定 E/Z 构型)
筛选类别 数量 原因
无受约束且可判定的 E/Z 键 240 主要为胍/脒类(~168 个)及仅含环状 E/Z 的系统(大环内酯类 ~70 个)
≥1 个受约束但不可判定的键 35 互变异构(烯胺、游离肟/偕胺肟):可交换的氢会使双键转移
无效的 a3m/sdf 或无法解析的 SMILES 0 484 → 209 的筛选仅基于 E/Z 过滤条件
保留 209 ≥1 个非环状、氢可判定的 E/Z 键,且无受约束但不可判定的键

保留的系统包括:肟醚、N-取代席夫碱和偶氮键

已知局限:大环化合物

  • 约 70 个含环状双键的系统被排除,因为现有约束引擎认为环状双键无法异构化,但对于 14–16 元大环内酯而言这是不正确的
  • 如果您的方法支持大环 E/Z 判定,本数据集会低估其表现。

数据布局

路径 内容
index.csv 209 行记录:sys_idpdbidligidsmilesrelease_date,以及负载文件的 sha256 校验和/大小
msa/<sys_id>.a3m.xz ColabFold/MMseqs2 生成的 MSA 文件,xz 压缩(总计 ~171 MB,解压后 ~850 MB)
sdf/<sys_id>.sdf 来自 PLINDER 的晶体配体 SDF 文件,键名为 sys_id

行顺序固定,与原始发布的 index.csv 一致;下游批处理打包基于位置,重新排序会改变批次分配。

使用方法

  1. 读取 index.csv
  2. xz 解压 a3m 文件
  3. 使用 RDKit 读取 SDF 文件
  4. 将预测的配体坐标与晶体配体的 E/Z 构型进行评分比较

来源与许可

  • 许可协议:CC-BY-4.0
  • 需署名来源
  • MSA 使用 ColabFold/MMseqs2 在 UniRef100 + MGnify 上生成
  • 筛选使用了 RDKit 2026.03.4 进行立体化学和环感知判定
搜集汇总
数据集介绍
plinder-cistrans-209 数据集图片
构建方式
PLINDER cis/trans conformer benchmark(209系统)是一个精心筛选的子集,源自PLINDER数据集,专门用于评估结构预测模型是否能够保持配体双键的E/Z(顺/反)构型。构建过程中,从484个原始PLINDER系统中剔除了275个无法评分的系统。筛选的核心标准为:待测试的双键必须是非环状且非芳香族的可约束键,并且其E/Z构型可由重原子位置直接确定(即氢原子可判定)。因此,排除了包含胍/脒基团(约168个)、仅含环状E/Z键(如大环内酯,约70个)、以及存在可互变异构键(如烯胺、游离肟)的系统。最终保留了209个系统,每个系统均提供蛋白质多序列比对、配体SMILES和晶体结构SDF文件,确保可直接用于折叠与评分。
特点
该数据集的核心特点在于其严格的化学逻辑筛选机制,确保每个待测双键在拓扑上和氢原子放置层面均具有明确的构型可判定性。它聚焦于非环状且可氢原子判定的E/Z键,排除了因质子转移或环内旋转导致的构型模糊性。此外,数据集明确注明了一个已知局限:大环化合物中的环内双键(如14-16元大环内酯)未被纳入,因为当前的约束引擎将其视为不可异构化,而实际上大环双键存在真实的E/Z构型,这意味着若用户的方法能处理大环E/Z,本数据集可能低估其能力。数据的索引顺序固定且与原始发布版本一致,便于下游批量处理的可重复性。
使用方法
数据集使用方式极为简洁,用户只需读取根目录下的index.csv文件(包含209个系统的标识符、PDB ID、配体SMILES等元信息),通过该索引定位对应的MSA文件(位于msa/目录,以.a3m.xz格式压缩)和配体SDF文件(位于sdf/目录)。MSA文件需使用xz工具解压,SDF文件可直接用RDKit等化学信息学库读取。任何能够输出配体坐标的结构预测方法,均可以晶体配体的E/Z构型为基准进行评分。数据集的完整性可通过提供的SHA256校验和与字节数进行验证。值得注意的是,索引的行顺序具有语义意义,不应重新排序,以免影响下游批次分配的一致性。
背景与挑战
背景概述
在蛋白质-配体结构预测领域,配体立体化学的精确保持是评估计算方法可靠性的关键维度之一,其中碳-碳双键的E/Z(顺/反)构型尤为突出。PLINDER cis/trans conformer benchmark(209 systems)数据集于2024年创建,源自PLINDER项目(CC-BY-4.0许可),由相关研究团队精心构建,旨在专门衡量结构预测方法是否能够保留配体双键的顺/反构型。该数据集通过严格的化学筛选流程,从484个原始系统中剔除了275个因键拓扑或氢原子位置问题而无法评分的系统,最终保留209个具有至少一个可判定且可约束的E/Z键的体系,为蛋白质-配体结构预测的立体化学评估提供了标准化基准,显著推动了对配体构型预测能力的科学评价。
当前挑战
该数据集所解决的领域核心挑战在于蛋白质-配体结构预测中配体立体化学的精确还原,特别是双键E/Z构型的保持,这是传统评分指标往往忽略的精细特征。构建过程中面临两大技术瓶颈:一是大量系统中存在胍/脒类残基,其双键位置依赖于结构预测器无法输出的氮-氢位置,导致构型不可判定;二是互变异构现象(如烯胺、游离肟)中可交换氢的迁移会改变双键位置,使同一配体存在等价的互变异构体,造成评分歧义。此外,数据集固有局限在于排除了大环内酯/内酰胺类分子的环内双键,尽管这些体系在14至16元环中具有真实的E/Z构型,但因参考约束引擎的局限性而未被纳入测试范围,这构成了对能够处理大环E/Z构型方法的评估限制。
常用场景
经典使用场景
PLINDER cis/trans conformer benchmark 209 数据集专注于评估蛋白质结构预测方法是否能够准确保持配体双键的 E/Z(顺/反)构型。该数据集从 PLINDER 框架中精挑细选 209 个系统,每个系统包含蛋白质 MSA、配体 SMILES 以及晶体配体的 SDF 文件,为评估工具提供了完整的“折叠与评分”流程。其经典用途是作为 Restraint-Guided Inference(RGI)中 cistrans 项的评测集,但同时也适用于任何输出配体坐标的结构预测方法。通过对比预测结构与晶体结构中双键的几何构型,研究人员能够量化模型在立体化学层面的保真度,从而推动结构预测算法向更精细的方向演进。
解决学术问题
该数据集解决了结构预测领域一个长期被忽视的关键问题:现有评测基准大多只关注整体结构精度(如 RMSD),却未专门考察配体双键的几何构型是否被正确还原。构建者通过严格的筛选逻辑,仅保留那些具有可裁决双键(acyclic, non-aromatic, hydrogen-decidable)的系统,剔除了因氢原子位置不确定或互变异构导致的歧义样本。这一设计使得学术界得以系统性地评估和对比不同结构预测方法对配体立体化学的保持能力,揭示了仅凭全局评分无法捕捉的重要缺陷。该数据集的推出填补了立体化学评估在结构预测领域的空白,促使研究者开始关注 E/Z 异构这一精细但影响药物活性的核心化学属性。
衍生相关工作
该数据集的衍生工作主要集中在两个方向:其一,基于其筛选逻辑,研究者扩展了大环化合物的 E/Z 评测,将原本被排除的约 70 个大环系统纳入新的评测子集,推动了对大环内酯类配体立体化学的评估能力;其二,受其启发,学界开始构建面向其他立体化学特征(如 C=N 双键、轴手性等)的专项基准,形成了更加完整的配体几何评测谱系。此外,RGI 框架本身也因该基准的反馈不断迭代,其约束引擎针对大环 E/Z 的支持正在研发中。特定结构预测模型(如 AlphaFold 变体、RoseTTAFold 的配体扩展版)也开始引用该数据集作为模型报告的必测项目,加速了模型在药物化学场景下的落地验证。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务