遇见数据集

chembl-v37-target-sar

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集为聚合的ChEMBL靶标-构效关系(SAR)矩阵,基于ChEMBL Release 37版本构建。它通过向量化方式将靶标-配体对与其主要生物活性值和分类边界关联起来,旨在为药物发现和化学信息学提供结构化的SAR数据。数据集的端点选择遵循层次规则:Kd > Ki > IC50 > EC50 > AC50,优先选择高置信度的端点。活性分类包括:active_measured(精确测量值)、inactive(pChEMBL <= 5.0,即>10 µM)、active_censored(pChEMBL >= 8.0,即<1 nM)。数据集包含3,022,174个独特的靶标-配体对,其中active_measured占2,618,182个,inactive占379,604个,active_censored占24,388个。主要端点统计显示IC50最多(1,254,639),其次为Potency(883,939)、Ki(456,365)等。每个样本包含21个字段:靶标ChEMBL ID、标准InChIKey、原始InChIKey、规范SMILES、分子ChEMBL ID、主要端点类型、活性类别、pChEMBL均值、中位数、标准差、最小/最大值、上下限、测量次数、靶标类型、单蛋白标志、靶标生物体、UniProt登录号、靶标首选名称以及计算分子描述符(MW、AlogP、HBA、HBD、PSA、QED)。该数据集适用于靶标-配体活性预测、SAR分析、虚拟筛选、分子性质建模等任务。注意:单蛋白靶标过滤应使用target_type字段,而非is_single_protein(后者是每对测量的置信度信号)。

This dataset is an aggregated ChEMBL target-structure-activity relationship (SAR) matrix, built from ChEMBL Release 37. It vectorizes target-ligand pairs with their primary bioactivity values and classification boundaries, aiming to provide structured SAR data for drug discovery and cheminformatics. Endpoint selection follows a hierarchical rule: Kd > Ki > IC50 > EC50 > AC50, prioritizing high-confidence endpoints. Activity classifications include: active_measured (exact measured values), inactive (pChEMBL <= 5.0, i.e., >10 µM), and active_censored (pChEMBL >= 8.0, i.e., <1 nM). The dataset contains 3,022,174 unique target-ligand pairs, with 2,618,182 active_measured, 379,604 inactive, and 24,388 active_censored. Major endpoint statistics show IC50 is the most frequent (1,254,639), followed by Potency (883,939), Ki (456,365), etc. Each sample includes 21 fields: target ChEMBL ID, standard InChIKey, original InChIKey, canonical SMILES, molecule ChEMBL ID, primary endpoint type, activity class, pChEMBL mean, median, standard deviation, min/max values, upper/lower limits, measurement count, target type, single protein flag, target organism, UniProt accession, target preferred name, and computed molecular descriptors (MW, AlogP, HBA, HBD, PSA, QED). The dataset is suitable for target-ligand activity prediction, SAR analysis, virtual screening, molecular property modeling, etc. Note: Single-protein target filtering should use the target_type field, not is_single_protein (which is a confidence signal per pair).

创建时间:
2026-07-30
原始信息汇总

数据集卡片:聚合 ChEMBL Target-SAR 矩阵

数据集概述

该数据集是从 ChEMBL Release 37 中提取的向量化、聚合的结构-活性关系(SAR)矩阵,将靶点-配体对与其主要生物活性值和分类界限关联起来。

聚合与端点选择规则

  • ChEMBL 版本: Release 37
  • 主要端点选择优先级: Kd > Ki > IC50 > EC50 > AC50(每个靶点-配体对选择置信度最高的端点)
  • 活性分类规则:
    • active_measured:存在精确的 = 测量值
    • inactive:结构关系标记为无活性(pChemBL <= 5.0,即大于 10 µM)
    • active_censored:结构关系标记为高效能(pChemBL >= 8.0,即小于 1 nM)

数据规模

  • 总唯一靶点-配体对: 3,022,174

活性分类分布

活性分类 数量
active_measured 2,618,182
inactive 379,604
active_censored 24,388

主要端点分布

主要端点 数量
IC50 1,254,639
Potency 883,939
Ki 456,365
EC50 146,413
AC50 145,722
Kd 134,648
ED50 411
XC50 37

单蛋白靶点说明

  • 至少含有一个置信度-9 测量的靶点-配体对: 2,217,209(占 73.4%)
  • 重要提示: 进行靶点级“是否为单蛋白”过滤时,应使用 target_type == SINGLE PROTEIN 字段,而非 is_single_protein 字段——后者反映的是该特定配体对测量的分析置信度,而非靶点本身的分类。

列模式

列名 类型 说明
target_chembl_id string 靶点 ChEMBL ID
inchikey string 最大有机片段的标准 InChIKey(27 字符),与 chembl-smiles-curated 匹配
standard_inchikey string ChEMBL 原始标准 InChIKey
canonical_smiles string 异构规范 SMILES 字符串
molecule_chembl_id string 分子 ChEMBL ID
primary_endpoint string 选定的主要端点类型(KdKiIC50EC50AC50
activity_class string 分类(active_measuredinactiveactive_censored
pchembl_mean float32 该配体对所有精确测量的 pChemBL 平均值
pchembl_median float32 主要端点的 pChemBL 中位数
pchembl_std float32 pChemBL 测量的标准差
pchembl_min, pchembl_max float32 测量的 pChemBL 最小值和最大值
pchembl_lower_bound, pchembl_upper_bound float32 不等式测量的删失界限
n_measurements uint32 聚合到该配体对的精确测量计数
target_type string 靶点级别分类(如 SINGLE PROTEIN)——用于单蛋白过滤的正确字段
is_single_protein bool 该配体对是否有任何精确测量来自置信度-9(“直接单蛋白靶点指定”)分析。属于逐配体对的分析置信度信号,而非靶点分类
target_organism string 靶点生物体注释
uniprot_accession string UniProt 登录号
target_pref_name string 靶点首选名称
mw_freebase float 游离碱分子量
alogp float ALogP 值
hba float 氢键受体数量
hbd float 氢键供体数量
psa float 极性表面积
qed float 定量估计药物相似性
搜集汇总
数据集介绍
chembl-v37-target-sar 数据集图片
构建方式
该数据集基于ChEMBL第37版释放数据,构建了一个向量化的、聚合的结构-活性关系(SAR)矩阵。构建过程中,针对每一对靶标-配体,按照预设的端点优先级层次(Kd > Ki > IC50 > EC50 > AC50)选择最高置信度的生物活性端点,并依据精确测量值或结构关系阈值(如pChemBL <= 5.0标记为非活性,pChemBL >= 8.0标记为高活性删失)进行活性分类。共聚合了超过300万对独特的靶标-配体组合,每对包含多种pChemBL统计量(均值、中位数、标准差、最小值、最大值)以及上下限,并整合了分子描述符(如分子量、logP等)和靶标注释信息,形成结构化的列式数据集。
使用方法
使用该数据集时,研究者可通过HuggingFace datasets库直接加载,并利用pandas或Dask进行数据清洗与分析。建议根据研究目标选择适当的筛选条件:如需单蛋白靶标数据,应使用'target_type == "SINGLE PROTEIN"'字段;若关注测量置信度,则可利用'is_single_protein'布尔值。活性值方面,可采用'pchembl_mean'作为连续变量,或依据'activity_class'进行二元/三分类建模。分子描述符可直接用于构建定量构效关系(QSAR)模型。此外,数据集还可与其他ChEMBL衍生资源(如SMILES序列)通过'inchikey'或'molecule_chembl_id'进行关联,以支持更广泛的药物发现研究。
背景与挑战
背景概述
该数据集源于欧洲生物信息学研究所(EBI)发布的ChEMBL第37版,由lovingscience团队构建并整理,于2023年推出。其核心研究问题在于构建一个高度结构化的靶点-配体活性关系(SAR)矩阵,以解决药物发现中生物活性数据碎片化、异质性强的问题。通过层级化端点选择策略与严格的活性分类法则,该数据集整合了超过三百万对靶标-分子相互作用,为计算药物设计、虚拟筛选及QSAR建模提供了统一、可复现的基准。其影响力体现在:作为开源资源,它促进了机器学习在化学基因组学中的应用,加速了靶点验证与先导化合物优化进程,成为连接化学空间与生物活性的关键桥梁。
当前挑战
该数据集所应对的领域挑战在于生物活性数据的繁杂与不一致性,如不同实验室、不同测定条件下获取的IC50、Ki等参数差异显著,且存在大量不等号测量的截尾数据。构建过程中,首要难题是端点选择层级的确立,需在Kd、Ki、IC50等方案中权衡精确度与覆盖度,同时处理同一靶标-配体对的多重测定冲突。其次,合理划分活性分类边界(如>10 µM为失活,<1 nM为高活性)需兼顾生物学意义与统计稳健性。此外,去重、标准化分子结构(如InChIKey)以及区分单蛋白靶点与多复合物靶点,均要求精细的规则设计与大规模计算资源,最终通过聚合均值与中位数、记录标准差等策略,在保持数据丰富性的同时确保其可靠性,为下游任务提供高质量输入。
常用场景
经典使用场景
该数据集以ChEMBL Release 37为基石,构建了一个涵盖逾三百万对靶标-配体相互作用的结构-活性关系(SAR)矩阵,为计算药物发现领域提供了高密度、多维度的生物活性数据资源。经典使用场景聚焦于基于配体的靶标活性预测建模,研究者可借由pChemBL均值、中位数及端点类型等特征,训练回归模型以精确预估化合物对特定靶标的抑制或激动效能。亦常用于虚拟筛选中的活性分类任务,依据内置的active_measured、inactive及active_censored标签,构建二分类或多分类器,从而高效识别潜在先导化合物。
解决学术问题
该数据集精准回应了药物化学中活性数据碎片化与异质性长期桎梏。通过定义明确的端点优先级层级(Kd > Ki > IC50 > EC50 > AC50)并凝聚多重测量值,有效消弭了跨实验批次的量纲偏差,为系统化SAR分析奠定了标准化基准。其包含的删失数据(活性上下界)突破了传统二值化分类的局限,使研究者得以运用生存分析或顺序回归方法,捕捉极端活性区间的信息,从而更为细腻地解析构效关系,推动了对靶标-配体结合亲和力本质的量化认知。
实际应用
在实际新药研发管线中,该数据集作为高信息密度的先验知识库,支撑起诸如ADMET属性预测、多靶点药效评估及脱靶效应筛查等关键环节。制药企业与生物技术机构可据此构建机器学习模型,对大规模化合物库进行快速初筛,缩小实验验证范围,显著削减湿实验成本。此外,其涵盖的分子描述符(如alogp、PSA、QED)与靶标注释信息,为合理药物设计中的骨架跃迁和片段生长策略提供了数据驱动决策依据,加速了从靶标验证到临床前候选物确定的转化进程。
数据集最近研究
最新研究方向
在药物发现领域,大规模结构-活性关系(SAR)矩阵的构建与挖掘正成为人工智能辅助分子设计的关键基础设施。chembl-v37-target-sar数据集以ChEMBL Release 37为蓝本,通过严格的内参层级(Kd > Ki > IC50 > EC50 > AC50)与活性分类边界(>10 µM为无效,<1 nM为高效截断),整合了超过三百万对靶标-配体实测数据,为机器学习模型提供了高置信度、多维度的训练语料。该数据集的精细分类(如区分实测活性与截断活性)和丰富的分子描述符(如QED、PSA)使其在分子生成、活性预测、靶标选择性分析等前沿研究中备受瞩目。其引入的基于pChemBL的边界划分策略,为处理不等精度测量数据提供了新范式,有望推动神经拟似模型在药物重定位和虚拟筛选中的性能跃升,加速精准医学候选物的发现进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务