chembl-v37-target-sar
收藏资源简介:
该数据集为聚合的ChEMBL靶标-构效关系(SAR)矩阵,基于ChEMBL Release 37版本构建。它通过向量化方式将靶标-配体对与其主要生物活性值和分类边界关联起来,旨在为药物发现和化学信息学提供结构化的SAR数据。数据集的端点选择遵循层次规则:Kd > Ki > IC50 > EC50 > AC50,优先选择高置信度的端点。活性分类包括:active_measured(精确测量值)、inactive(pChEMBL <= 5.0,即>10 µM)、active_censored(pChEMBL >= 8.0,即<1 nM)。数据集包含3,022,174个独特的靶标-配体对,其中active_measured占2,618,182个,inactive占379,604个,active_censored占24,388个。主要端点统计显示IC50最多(1,254,639),其次为Potency(883,939)、Ki(456,365)等。每个样本包含21个字段:靶标ChEMBL ID、标准InChIKey、原始InChIKey、规范SMILES、分子ChEMBL ID、主要端点类型、活性类别、pChEMBL均值、中位数、标准差、最小/最大值、上下限、测量次数、靶标类型、单蛋白标志、靶标生物体、UniProt登录号、靶标首选名称以及计算分子描述符(MW、AlogP、HBA、HBD、PSA、QED)。该数据集适用于靶标-配体活性预测、SAR分析、虚拟筛选、分子性质建模等任务。注意:单蛋白靶标过滤应使用target_type字段,而非is_single_protein(后者是每对测量的置信度信号)。
This dataset is an aggregated ChEMBL target-structure-activity relationship (SAR) matrix, built from ChEMBL Release 37. It vectorizes target-ligand pairs with their primary bioactivity values and classification boundaries, aiming to provide structured SAR data for drug discovery and cheminformatics. Endpoint selection follows a hierarchical rule: Kd > Ki > IC50 > EC50 > AC50, prioritizing high-confidence endpoints. Activity classifications include: active_measured (exact measured values), inactive (pChEMBL <= 5.0, i.e., >10 µM), and active_censored (pChEMBL >= 8.0, i.e., <1 nM). The dataset contains 3,022,174 unique target-ligand pairs, with 2,618,182 active_measured, 379,604 inactive, and 24,388 active_censored. Major endpoint statistics show IC50 is the most frequent (1,254,639), followed by Potency (883,939), Ki (456,365), etc. Each sample includes 21 fields: target ChEMBL ID, standard InChIKey, original InChIKey, canonical SMILES, molecule ChEMBL ID, primary endpoint type, activity class, pChEMBL mean, median, standard deviation, min/max values, upper/lower limits, measurement count, target type, single protein flag, target organism, UniProt accession, target preferred name, and computed molecular descriptors (MW, AlogP, HBA, HBD, PSA, QED). The dataset is suitable for target-ligand activity prediction, SAR analysis, virtual screening, molecular property modeling, etc. Note: Single-protein target filtering should use the target_type field, not is_single_protein (which is a confidence signal per pair).
数据集卡片:聚合 ChEMBL Target-SAR 矩阵
数据集概述
该数据集是从 ChEMBL Release 37 中提取的向量化、聚合的结构-活性关系(SAR)矩阵,将靶点-配体对与其主要生物活性值和分类界限关联起来。
聚合与端点选择规则
- ChEMBL 版本: Release 37
- 主要端点选择优先级:
Kd>Ki>IC50>EC50>AC50(每个靶点-配体对选择置信度最高的端点) - 活性分类规则:
active_measured:存在精确的=测量值inactive:结构关系标记为无活性(pChemBL <= 5.0,即大于 10 µM)active_censored:结构关系标记为高效能(pChemBL >= 8.0,即小于 1 nM)
数据规模
- 总唯一靶点-配体对: 3,022,174
活性分类分布
| 活性分类 | 数量 |
|---|---|
| active_measured | 2,618,182 |
| inactive | 379,604 |
| active_censored | 24,388 |
主要端点分布
| 主要端点 | 数量 |
|---|---|
| IC50 | 1,254,639 |
| Potency | 883,939 |
| Ki | 456,365 |
| EC50 | 146,413 |
| AC50 | 145,722 |
| Kd | 134,648 |
| ED50 | 411 |
| XC50 | 37 |
单蛋白靶点说明
- 至少含有一个置信度-9 测量的靶点-配体对: 2,217,209(占 73.4%)
- 重要提示: 进行靶点级“是否为单蛋白”过滤时,应使用
target_type == SINGLE PROTEIN字段,而非is_single_protein字段——后者反映的是该特定配体对测量的分析置信度,而非靶点本身的分类。
列模式
| 列名 | 类型 | 说明 |
|---|---|---|
target_chembl_id |
string | 靶点 ChEMBL ID |
inchikey |
string | 最大有机片段的标准 InChIKey(27 字符),与 chembl-smiles-curated 匹配 |
standard_inchikey |
string | ChEMBL 原始标准 InChIKey |
canonical_smiles |
string | 异构规范 SMILES 字符串 |
molecule_chembl_id |
string | 分子 ChEMBL ID |
primary_endpoint |
string | 选定的主要端点类型(Kd、Ki、IC50、EC50、AC50) |
activity_class |
string | 分类(active_measured、inactive、active_censored) |
pchembl_mean |
float32 | 该配体对所有精确测量的 pChemBL 平均值 |
pchembl_median |
float32 | 主要端点的 pChemBL 中位数 |
pchembl_std |
float32 | pChemBL 测量的标准差 |
pchembl_min, pchembl_max |
float32 | 测量的 pChemBL 最小值和最大值 |
pchembl_lower_bound, pchembl_upper_bound |
float32 | 不等式测量的删失界限 |
n_measurements |
uint32 | 聚合到该配体对的精确测量计数 |
target_type |
string | 靶点级别分类(如 SINGLE PROTEIN)——用于单蛋白过滤的正确字段 |
is_single_protein |
bool | 该配体对是否有任何精确测量来自置信度-9(“直接单蛋白靶点指定”)分析。属于逐配体对的分析置信度信号,而非靶点分类 |
target_organism |
string | 靶点生物体注释 |
uniprot_accession |
string | UniProt 登录号 |
target_pref_name |
string | 靶点首选名称 |
mw_freebase |
float | 游离碱分子量 |
alogp |
float | ALogP 值 |
hba |
float | 氢键受体数量 |
hbd |
float | 氢键供体数量 |
psa |
float | 极性表面积 |
qed |
float | 定量估计药物相似性 |




