遇见数据集

bbbnuke-screening-1B

收藏
Hugging Face2026-05-23 更新2026-05-24 收录
官方服务:

资源简介:

BBB-Nuke是一个专注于血脑屏障(BBB)通透性预测的大规模化学信息学数据集,旨在通过高通量计算筛选评估小分子化合物穿越血脑屏障的潜力,为中枢神经系统(CNS)药物发现提供关键数据支持。数据集包含超过10.2亿个(1,023,158,502)独特的小分子化合物,每个化合物都经过一套标准化的计算管道(BBB-Nuke v0.12.0)处理,包括SMILES字符串的标准化与规范化、关键理化性质(分子量、LogP、TPSA等)计算、pKa值预测、CNS-MPO评分计算、对8种关键人类外排转运蛋白(如MDR1、ABCG2、MRP1)亲和力的随机森林分类器预测,并最终结合所有特征通过高性能分类器和启发式规则生成BBB通透概率分数(P_BBB)和综合总分。数据来源多样,包括Enamine REAL库、ZINC、ChEMBL、PubChem和特定CPU筛选结果。数据集以表格形式组织,包含化合物ID、SMILES、来源、理化性质、预测pKa、CNS-MPO分数、转运蛋白评分、BBB通透概率、启发式规则标记和总分等字段,适用于基于机器学习的分子性质预测、虚拟筛选、药物化学中的类药性优化,特别是针对CNS靶点的先导化合物发现与优化任务。

BBB-Nuke is a large-scale cheminformatics dataset focused on blood-brain barrier (BBB) permeability prediction. It aims to evaluate the blood-brain barrier crossing potential of small molecule compounds via high-throughput computational screening, providing critical data support for Central Nervous System (CNS) drug discovery. The dataset contains over 1.023 billion (1,023,158,502) unique small molecular compounds, each processed through a standardized computational pipeline (BBB-Nuke v0.12.0). The pipeline includes standardization and normalization of SMILES strings, calculation of key physicochemical properties such as molecular weight, LogP, and TPSA, prediction of pKa values, calculation of CNS-MPO scores, and prediction of binding affinities towards 8 critical human efflux transporters including MDR1, ABCG2, and MRP1 using random forest classifiers. Finally, all features are integrated to generate the BBB permeability probability score (P_BBB) and comprehensive total score via high-performance classifiers and heuristic rules. The dataset is sourced from diverse resources including the Enamine REAL library, ZINC, ChEMBL, PubChem, and specific CPU screening results. Organized in tabular format, the dataset includes fields such as compound ID, SMILES, source, physicochemical properties, predicted pKa, CNS-MPO score, transporter score, BBB permeability probability, heuristic rule label, and total score. It is applicable to machine learning-based molecular property prediction, virtual screening, drug-like property optimization in medicinal chemistry, especially for lead compound discovery and optimization tasks targeting CNS drug targets.

创建时间:
2026-05-22
原始信息汇总

数据集名称

BBB-Nuke: 1B Compound BBB Permeability Screen(BBB-Nuke:10亿化合物血脑屏障通透性筛选数据集)

核心任务

  • 任务类型:表格分类
  • 主要目标:使用 BBB-Nuke 流程(v0.12.0)对 10.23 亿个小分子进行血脑屏障(BBB)通透性评分。

数据集规模

  • 总样本数:1,023,158,502 个化合物(训练集)
  • 数据集大小:140,000,000,000 字节
  • 规模分类:1B < n < 10B

数据来源

数据来源 化合物数量
Enamine REAL ~1.99亿
已有数据库(ZINC/ChEMBL) ~6.66亿
PubChem ~0.59亿
CPU Screen(ZINC) ~0.99亿
总计 1,023,158,502

筛选流程

每个化合物依次经过以下步骤:

  1. 标准化:使用 RDKit 对 SMILES 进行规范化。
  2. 理化性质计算:包括分子量(MW)、LogP、拓扑极性表面积(TPSA)、氢键供体(HBD)、氢键受体(HBA)、Fsp3、重原子数。
  3. pKa 预测:使用 MolGpKa(批处理GCN推理)计算代表性 pKa。
  4. CNS-MPO 评分:基于6个参数的多参数优化评分。
  5. 外排转运蛋白预测:针对8种外排蛋白(使用 S1 指纹随机森林分类器)。
  6. 分类器 + 启发式规则:最终输出 P_BBB 概率评分(5折交叉验证 AUROC 0.933)。

关键字段

字段名 类型 描述
compound_id 字符串 化合物标识符
smiles_input 字符串 输入 SMILES
smiles_standardized 字符串 标准化后的 SMILES
source 字符串 数据来源(enamine_real, existing, pubchem 等)
p_bbb 浮点数 BBB 通透性概率(0-1)
cns_mpo_score 浮点数 CNS 多参数优化评分
mw 浮点数 分子量
logp 浮点数 脂水分配系数
tpsa 浮点数 拓扑极性表面积
hbd 浮点数 氢键供体数量
hba 浮点数 氢键受体数量
heavy_atoms 浮点数 重原子数
fsp3 浮点数 饱和碳比例
pka_representative 浮点数 代表性 pKa 值
efflux_*(共8个) 浮点数 8种外排转运蛋白的亲和力分数
score_total 浮点数 复合启发式评分
passed_mpo_filter 布尔值 是否通过 MPO 筛选
heuristic_reason 字符串 启发式规则理由
heuristic_veto 字符串 启发式规则否决信息

计算资源

  • 9.24亿化合物:Azure ML,8× NVIDIA A100 80GB GPU(Standard_ND96amsr_A100_v4)
  • 0.99亿化合物:Azure ML,64核 CPU(Standard_E64ds_v4),仅进行批处理 pKa + S1 外排预测(不使用 PSICHIC)

许可协议

CC BY-NC 4.0(知识共享 署名-非商业性使用 4.0 国际许可协议)

相关标签

  • chemistry(化学)
  • drug-discovery(药物发现)
  • blood-brain-barrier(血脑屏障)
  • bbb
  • cns(中枢神经系统)
  • molecular-properties(分子性质)
  • screening(筛选)
搜集汇总
数据集介绍
bbbnuke-screening-1B 数据集图片
构建方式
该数据集基于BBB-Nuke管线(v0.12.0版本)构建,对超过10亿个小分子进行血脑屏障通透性系统筛查。构建流程始于SMILES规范化处理,随后依次计算理化性质参数(分子量、LogP、TPSA等)、利用MolGpKa模型预测代表性pKa值、执行CNS-MPO多参数优化评分,并基于S1指纹随机森林分类器评估8种外排转运蛋白的亲和力。最终通过五折交叉验证(AUROC达0.933)的分类器与启发式规则相结合,生成综合通透性概率分数。数据源涵盖Enamine REAL、ZINC/ChEMBL、PubChem及CPU筛选结果,经合并去重后形成统一数据集。
使用方法
数据集以表格分类任务形式呈现,支持直接加载为数据框进行后续分析。用户可根据化合物ID或SMILES字段索引目标分子,利用p_bbb列筛选潜在血脑屏障渗透性候选物。对于药物筛选场景,可结合cns_mpo_score与efflux外排预测值构建多参数优化策略,例如设定p_bbb阈值并联合mpo评分进行排序。此外,mw、logp等理化属性可作为机器学习模型的输入特征,用于开发新的通透性预测算法。推荐使用Python的pandas或Dask库处理超大规模数据,按source或provenance列划分训练与验证子集。
背景与挑战
背景概述
血脑屏障(BBB)作为中枢神经系统(CNS)药物开发的核心障碍,其通透性预测长期受限于化合物库规模与计算资源的不足。2024年,由ATTN-Lab团队开发的BBB-Nuke数据集,依托Enamine REAL、ZINC、ChEMBL及PubChem等公开数据库,整合了超过10亿个小分子的理化性质与转运蛋白亲和力数据,构建了迄今规模最大的BBB通透性筛选资源。该研究通过多参数优化(CNS-MPO评分)与基于图神经网络的pKa预测及随机森林分类器,实现了对化合物穿透血脑屏障概率的高通量评估(AUROC 0.933)。此数据集的发布,为CNS药物早期筛选、机器学习模型预训练以及药物化学中的结构-活性关系研究提供了前所未有的数据基座,显著推动了计算药物发现领域的范式革新。
当前挑战
该数据集首先致力于解决CNS药物研发中大规模虚拟筛选的领域性难题:传统实验方法通量低、成本高,难以覆盖化学空间的多样性,而现有机器学习模型常因训练数据规模不足而泛化能力有限。BBB-Nuke通过1B级数据规模,有效提升了跨分子骨架的预测鲁棒性。然而,构建过程中面临多重挑战:需统一数十亿级分子从不同来源(如Enamine、PubChem)的SMILES表示标准并去除冗余;对每分子执行RDKit标准化与8种外排转运蛋白(如P-gp)的构效关系推断,涉及高维特征计算与分布式处理资源的协调;此外,基于异质数据源整合的启发式评分规则需要在不牺牲计算效率的前提下,平衡分子量、脂溶性、拓扑极性表面积等冲突的药化属性,最终通过五折交叉验证确保模型预测的统计可靠性。
常用场景
经典使用场景
该数据集最经典的应用场景在于中枢神经系统(CNS)药物研发中的血脑屏障通透性高通量筛选。研究人员可基于其提供的超过十亿种小分子的理化性质参数、外排转运蛋白亲和力评分及综合概率得分,构建预测模型以加速候选药物的早期筛选。该数据集涵盖了Enamine REAL、ZINC、ChEMBL及PubChem等主流化合物库,为药物化学家提供了前所未有的分子多样性。
解决学术问题
该数据集系统性地解决了血脑屏障通透性预测中数据稀疏且评价指标不统一的核心瓶颈。通过整合8种外排转运蛋白的机器学习预测结果与CNS-MPO多参数优化框架,为中枢神经系统药物设计提供了具有统计显著性的决策依据。其价值在于将传统依赖单一理化规则的筛选模式升级为多维度概率评估体系,显著提升了候选分子穿越血脑屏障潜力的预测精度。
实际应用
在实际应用中,制药企业可利用该数据集对内部化合物库进行虚拟筛选,优先推进具有较高血脑屏障通透概率的分子进入后续药效学实验。神经退行性疾病、脑部肿瘤及精神类疾病的药物发现流程均可从中受益,通过计算筛选大幅降低湿实验成本。此外,其衍生的外排转运蛋白评分还能辅助预测药物在脑内的滞留时间与潜在耐药性。
数据集最近研究
最新研究方向
在药物发现的前沿领域,血脑屏障渗透性评估是中枢神经系统药物开发的核心瓶颈,而bbbnuke-screening-1B数据集的问世,以超十亿级小分子筛选规模开辟了全新范式。该数据集利用BBB-Nuke流水线整合标准化、理化性质计算、pKa预测及CNS-MPO评分,并创新性地纳入八种外排转运蛋白活性预测,结合机器学习分类器实现血脑屏障渗透概率的高精度评估(AUROC达0.933),这一突破性资源可有效加速CNS候选药物的高通量虚拟筛选,尤其为解决阿尔茨海默病、脑肿瘤等中枢神经系统疾病的药物递送困境提供数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务