遇见数据集

VIDraft/pxr-challenge-method

收藏
Hugging Face2026-06-10 更新2026-06-14 收录
官方服务:

资源简介:

这是一个用于孕烷X受体(PXR)激动剂活性预测的数据集,专注于计算药物发现中的分子性质预测任务。数据集包含总计7,039个分子,来源于OpenADMET PXR盲测挑战赛,具体包括:官方挑战训练数据(4,139个分子)、官方反筛选数据(2,647个分子)以及公开的第1阶段模拟集(253个分子)。数据以SMILES字符串形式提供,pEC50值作为目标变量,用于预测PXR活性。该数据集用于训练和评估XGBoost集成模型,以支持ADMET(吸收、分布、代谢、排泄和毒性)属性评估。

This is a dataset for Pregnane X Receptor (PXR) agonist activity prediction, focusing on molecular property prediction in computational drug discovery. It contains a total of 7,039 molecules sourced from the OpenADMET PXR Blind Challenge, including: official challenge training data (4,139 molecules), official counter-assay data (2,647 molecules), and the publicly released Phase 1 analog set (253 molecules). The data is provided in SMILES strings with pEC50 values as target variables for PXR activity prediction. This dataset is used for training and evaluating XGBoost ensemble models to support ADMET (Absorption, Distribution, Metabolism, Excretion, and Toxicity) property assessment.

提供机构:
VIDraft
搜集汇总
数据集介绍
VIDraft/pxr-challenge-method 数据集图片
构建方式
本数据集是OpenADMET PXR活性预测挑战赛的参赛方案报告,由VIDraft团队提交。构建方式上,整合了官方提供的4,139个训练分子、2,647个反筛数据以及公开发布的253个Phase 1类似物,共计7,039个分子作为训练集。利用RDKit计算了ECFP4、ECFP6、FCFP4三种摩根指纹及MACCS结构键指纹,拼接后得到6,311维二元特征向量。基于XGBoost算法训练了50个不同随机种子的集成模型,超参数包括最大深度9、学习率0.01、子采样率0.85等,最终预测为50个模型输出的均值并裁剪至[1.0, 9.0]区间。
特点
该数据集方法的核心特点在于精巧的校准与集成策略。由于原始XGBoost预测存在偏向训练集均值的系统性偏差,引入了等渗回归校准技术,利用Phase 1的真实标签对预测值进行非参数校正。进一步采用模型混合方法,将校准后的XGBoost预测与基于指纹的基线预测进行加权融合,权重通过交叉验证优化。这一组合显著提升了预测精度,在Phase 1留出集上实现了RAE=0.444、Spearman相关系数ρ=0.944的优异性能,且将Phase 1纳入训练后RAE较未纳入时降低了22%。
使用方法
本数据集及配套方法适用于药物发现领域中孕烷X受体激动活性的预测任务。使用者可将目标分子的SMILES表示为RDKit计算的四类分子指纹,输入训练好的XGBoost集成模型获得原始预测值。随后需利用提供的等渗回归校准模型对预测进行校正,并与指纹基线预测按优化权重混合,最终得到pEC50活性估计值。代码实现基于Python 3.12环境,依赖XGBoost 2.x、RDKit 2026.03及scikit-learn等库,特征提取与模型训练可在NVIDIA H200 GPU上高效完成。
背景与挑战
背景概述
PXR(孕烷X受体)激动活性预测是药物发现与ADMET评估中的关键环节,直接影响候选化合物的代谢稳定性与毒性风险。由OpenADMET发起的PXR盲测挑战赛旨在推动分子性质预测方法的进步,该数据集由VIDraft团队于2026年提交,核心研究问题在于利用分子指纹与集成学习框架精准预测pEC50值。研究团队整合了官方训练数据、反筛数据及公开的Phase 1模拟集,构建了包含7,039个分子的训练集,通过XGBoost集成与等渗回归校准策略,在Phase 1留出集上达到了0.944的斯皮尔曼相关系数,显著提升了预测的准确性与可靠性,对药物早期筛选中的ADMET预测领域产生了积极影响。
当前挑战
该数据集所解决的领域问题在于提升PXR激动活性预测的精度,特别是克服传统方法对活性分布系统性偏差的敏感性。构建过程中面临的核心挑战包括:1)不同数据源(官方训练集、反筛数据、Phase 1模拟集)之间的标签分布差异,训练集平均pEC50约3.89而Phase 1均值约4.66,导致模型存在明显偏差;2)分子特征表征的优化,单一指纹类型难以捕捉全面的分子语义信息,需融合ECFP4、ECFP6、FCFP4及MACCS等共6,311维特征;3)集成模型校准策略的设计,原始XGBoost预测需通过等渗回归与模型混合进行系统性纠偏;4)计算资源的平衡,在50个随机种子下训练2,000轮需GPU加速,且特征工程与训练时间需控制在可接受范围内。
常用场景
经典使用场景
在药物研发领域,预测小分子化合物对孕烷X受体(PXR)的激动活性是评估候选药物安全性及潜在药物-药物相互作用的关键环节。该数据集专为PXR活性预测任务设计,经典使用场景涵盖基于分子指纹的回归建模与集成学习方法的开发。研究者可依托所提供的七千余个化合物样本,利用ECFP、FCFP和MACCS等分子描述符,构建XGBoost集成模型以预测pEC50值。该过程不仅涉及特征工程与超参数调优,还融合了保序回归校准与模型集成策略,从而提升预测精度与泛化能力,成为计算毒理学与ADMET属性预测领域的基准测试平台。
实际应用
在实际产业环境中,该数据集可嵌入人工智能驱动的药物发现平台,用于先导化合物的早期毒性筛选与候选分子排序。制药企业可利用该数据集训练的模型,在虚拟筛选中快速排除潜在的PXR激动剂,降低临床试验阶段因核受体激活导致的药物失败风险。此外,该数据集所展示的集成学习与校准流水线可直接应用于其他ADMET终点预测,如CYP酶抑制或hERG毒性评估,从而加速药物研发全流程的决策效率,减少对动物实验的依赖,并降低研发成本。
衍生相关工作
该数据集的构建与分析方法衍生出一系列后续探索性工作。其一,研究团队基于该挑战开发了PharmaOS自主药物发现平台,将分子生成、结构预测与ADMET评估集成为端到端流水线。其二,该数据集启发了基于三维分子表示(如Uni-Mol)与图神经网络的PXR活性预测研究,旨在超越二维指纹的表示极限。其三,保序回归校准策略被推广至其他ADMET挑战任务,形成模型后处理的标准流程。此外,该工作中XGBoost与多指纹融合的架构亦被应用于其他分子性质预测竞赛中,成为对比基准方法的重要参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务