遇见数据集

chembl-target-sar

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集是基于ChEMBL Release 37构建的向量化、聚合的结构-活性关系(SAR)矩阵,旨在将目标-配体对与其主要生物活性值和分类边界关联起来。数据集中包含3,022,174对独特的靶标-配体对,其中活性测量值(active_measured)有2,618,182条,非活性(inactive)有379,604条,截尾高活性(active_censored)有24,388条。主要端点选择层次为:Kd > Ki > IC50 > EC50 > AC50,每个对选取最高置信度的端点。活性分类规则:active_measured为精确测量值;inactive表示结构关系大于10 µM(pChemBL <= 5.0);active_censored表示结构关系小于1 nM(pChemBL >= 8.0)。数据集包含丰富的字段:目标ChEMBL ID、标准化InChIKey、标准InChIKey、规范SMILES、分子ChEMBL ID、主要端点类型、活性分类、pChemBL统计量(均值、中位数、标准差、最小值、最大值、上下截尾边界)、测量次数、目标类型、单蛋白标志、目标注释(生物体、UniProt登录号、首选名称)以及计算分子描述符(分子量、logP、氢键供体/受体数量、极性表面积、QED)。该数据集适用于药物发现中的SAR分析、活性预测模型训练、目标-配体关系挖掘等任务。

This dataset is a vectorized and aggregated structure-activity relationship (SAR) matrix built from ChEMBL Release 37, designed to associate target-ligand pairs with their primary bioactivity values and classification boundaries. It contains 3,022,174 unique target-ligand pairs, including 2,618,182 active_measured, 379,604 inactive, and 24,388 active_censored entries. The primary endpoint selection hierarchy is Kd > Ki > IC50 > EC50 > AC50, with the highest confidence endpoint chosen for each pair. Activity classification rules: active_measured indicates precise measured values; inactive indicates structural relationships >10 µM (pChemBL <= 5.0); active_censored indicates structural relationships <1 nM (pChemBL >= 8.0). The dataset includes rich fields: target ChEMBL ID, standardized InChIKey, standard InChIKey, canonical SMILES, molecule ChEMBL ID, primary endpoint type, activity classification, pChemBL statistics (mean, median, standard deviation, min, max, upper/lower censoring boundaries), measurement count, target type, single protein flag, target annotations (organism, UniProt accession, preferred name), and computed molecular descriptors (molecular weight, logP, H-bond donors/acceptors, polar surface area, QED). This dataset is suitable for SAR analysis in drug discovery, activity prediction model training, and target-ligand relationship mining.

创建时间:
2026-07-30
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Aggregated ChEMBL Target-SAR Matrix
  • 数据集版本:基于 ChEMBL Release 37
  • 规模:包含 3,022,174 个独特的靶点-配体对

数据来源与构建规则

  • 来源:ChEMBL 数据库第 37 版
  • 主端点选择层级Kd > Ki > IC50 > EC50 > AC50,每个靶点-配体对选择置信度最高的端点

活性分类统计

活性类别 数量
active_measured(精确测量) 2,618,182
inactive(> 10 µM,pChemBL ≤ 5.0) 379,604
active_censored(< 1 nM,pChemBL ≥ 8.0) 24,388

主要端点分布

主要端点 数量
IC50 1,254,639
Potency 883,939
Ki 456,365
EC50 146,413
AC50 145,722
Kd 134,648
ED50 411
XC50 37

单蛋白靶点

  • 具有至少一个置信度-9(confidence-9)测量的配对:2,217,209(占 73.4%)
  • 筛选单蛋白靶点应使用 target_type == SINGLE PROTEIN 字段,而非 is_single_protein(后者表示配对层面的检测置信度)

列结构说明

  • 标识字段target_chembl_idmolecule_chembl_idinchikeystandard_inchikeycanonical_smiles
  • 活性字段primary_endpointactivity_class
  • pChemBL 统计字段pchembl_meanpchembl_medianpchembl_stdpchembl_minpchembl_maxpchembl_lower_boundpchembl_upper_bound
  • 检测数量n_measurements(uint32)
  • 靶点注释字段target_typeis_single_proteintarget_organismuniprot_accessiontarget_pref_name
  • 分子描述符字段mw_freebasealogphbahbdpsaqed
搜集汇总
数据集介绍
chembl-target-sar 数据集图片
构建方式
该数据集基于ChEMBL第37版释放数据,通过严格的端点选择层级(Kd > Ki > IC50 > EC50 > AC50)对靶标-配体对进行聚合,构建了向量化的结构-活性关系(SAR)矩阵。每一对靶标-配体均选取置信度最高的主端点,并依据pChemBL值划分活性类别:精确测量值归为active_measured,pChemBL大于10 µM(≤5.0)归为inactive,小于1 nM(≥8.0)归为active_censored。聚合过程计算了pChemBL的均值、中位数、标准差及范围,并记录了测量次数和分子描述符,最终形成包含3,022,174个独特靶标-配体对的数据集。
特点
数据集囊括了超过300万对靶标-配体相互作用,其中73.4%的配对具有高置信度(confidence-9)的测量数据,确保了生物活性数据的可靠性。活性类别分布均衡,包括2,618,182个精确活性测量、379,604个非活性标注及24,388个高活性截尾数据。主端点类型丰富,以IC50和Potency为主,覆盖多种药理学终点。此外,数据集提供了靶标类型、UniProt accession和分子描述符等丰富注释,便于多维度分析。
使用方法
使用时,研究者可直接加载HuggingFace上的数据集,利用列如target_chembl_id、inchikey和molecule_chembl_id进行靶标或配体筛选,通过activity_class和pchembl_mean等字段进行活性分类和定量分析。建议根据target_type字段筛选单一蛋白靶标,以获得更准确的靶标-配体关系。适用于SAR建模、虚拟筛选、活性预测等任务,可结合分子描述符进行QSAR研究,或基于pchembl分布进行数据挖掘和机器学习模型训练。
背景与挑战
背景概述
化学基因组学领域长期受困于生物活性数据分散、异质及量纲不一等瓶颈,如何整合海量靶点-配体相互作用数据以构建高质量的结构-活性关系(SAR)矩阵,成为计算药物设计的关键前提。该数据集由lovingscience团队基于ChEMBL Release 37(2023年发布)构建,核心研究问题在于通过统一的端点层级(Kd、Ki、IC50等)和活性分类标准,将逾302万对靶点-配体对聚合为标准化SAR矩阵,为机器学习模型提供直接可用的训练语料。其影响力体现在:一方面以73.4%的置信度-9单蛋白测量对强化了靶点选择性分析的基础;另一方面通过pChemBL值及分子描述符的完备字段,支持从活性预测到ADMET建模的多场景应用,已成为药物发现领域对接公共数据库与深度学习的桥梁性资源。
当前挑战
该数据集所解决的领域问题在于生物活性数据的‘端到端可用性’:原始ChEMBL数据中测量类型混杂、活性值量纲不一,且存在‘>10 µM’或‘<1 nM’的区间删失数据,直接建模易引入偏差,数据集的活性分类体系(active_measured、inactive、active_censored)有效缓解了此问题。构建过程中面临的挑战包括:端点选择需平衡测量精度与数量,采用Kd>Ki>IC50>EC50>AC50的优先级规则确保了高置信度端点的优先,但可能导致部分低优先级端点信息丢失;删失数据的边界值(pChemBL>=8.0或<=5.0)设定需审慎,以免误分;此外,聚合过程中多测量值的统计量(均值、中位数、标准差)计算需处理离群值,且靶点注释字段(如is_single_protein)的语义歧义要求严格区分测量级置信度与靶点类型,这些数据治理细节共同构成了构建高质量SAR矩阵的核心挑战。
常用场景
经典使用场景
在计算药物发现与化学信息学领域,构效关系(SAR)分析是连接分子结构与生物活性的核心桥梁。该数据集以ChEMBL第37版为数据源,构建了一个包含逾三百万靶点-配体对的矢量化SAR矩阵,为经典机器学习模型(如随机森林、支持向量机)和现代图神经网络提供了大规模、标准化的训练与测试基准。研究者可直接利用其提供的pChemBL均值与活性分类标签,开展基于靶点的活性预测、分子性质回归等任务,从而快速验证算法在药物化学数据上的泛化能力。
实际应用
在实际的药物研发管线中,该数据集可用于虚拟筛选的初筛阶段,快速识别具有潜在活性的先导化合物。制药企业和科研机构可基于其分子描述符与活性信息,构建高精度的预测模型,用于评估化合物库的成药性、预测脱靶效应以及优化先导化合物的活性。其大规模覆盖特性亦支撑了基于配体的靶点预测与药物重定位研究,为加速新药研发进程提供了数据驱动的决策支持。
衍生相关工作
该数据集的构建模式与内容直接启发了多项经典后续工作。例如,基于其精确的活性边界定义,研究者发展了专门处理删失数据的生存分析模型,以及利用靶点-配体矩阵进行多任务深度学习的框架。此外,其统一的数据聚合规则被后续的数据集(如联合其他生物活性数据库)所采纳,推动了标准化基准数据集(如MoleculeNet中的某些任务)的完善,并催生了一系列关于活性悬崖预测、分子表征学习的前沿研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务