遇见数据集

File 1 — Training Dataset (PubChem + ChEMBL) for Dr Lungker

收藏
Figshare2025-12-02 更新2026-04-28 收录
官方服务:

资源简介:

Article Title: DrLungker: A Deep Ensemble Learning Framework for Predicting Anti-Lung Cancer Compound Activity and Validating Multitarget Potency through WaterMap, DFT, MD Simulations, and MM-GBSA AnalysisPublished in: Advanced Theory and SimulationsManuscript DOI: https://doi.org/10.1002/adts.202501550More Information: GitHub RepositoryDescriptionThis dataset (DrLungker_Dataset.csv) contains the fully curated molecular data used to train the DrLungker deep ensemble learning framework for predicting anti-lung cancer compound activity.Sources: PubChem and ChEMBL lung cancer bioassaysProcessing: Structure standardization, duplicate removal, descriptor generation using AlvaDesc and QikProp, and rigorous quality filteringContents: 26,396 unique compounds, each encoded with 5,883 molecular descriptorsUsage: Training the hybrid ResNet–FNN–LSTM ensemble using Averaging, Majority Voting, and Stacking techniquesThis dataset ensures full reproducibility of the DrLungker model and can be used for benchmarking, validation, and downstream computational drug-discovery applications.

论文标题:DrLungker:一种通过WaterMap、密度泛函理论(DFT)、分子动力学(MD)模拟以及分子力学-广义玻恩表面积(MM-GBSA)分析,用于预测抗肺癌化合物活性并验证多靶点效力的深度集成学习框架 发表期刊:Advanced Theory and Simulations 稿件DOI:https://doi.org/10.1002/adts.202501550 更多信息:GitHub代码仓库 数据集说明 本数据集(DrLungker_Dataset.csv)包含经过全面整理的分子数据,用于训练DrLungker深度集成学习框架以预测抗肺癌化合物活性。 数据来源:PubChem与ChEMBL数据库中的肺癌生物测定实验数据 数据处理流程:包括分子结构标准化、去重、使用AlvaDesc与QikProp生成分子描述符,以及严格的质量过滤步骤 数据集内容:包含26396个独特化合物,每个化合物均由5883个分子描述符进行编码 使用场景:可用于训练结合平均法、多数投票法与堆叠法的混合残差神经网络(ResNet)–前馈神经网络(FNN)–长短期记忆网络(LSTM)集成模型 本数据集可确保DrLungker模型的完全可复现性,同时可用于基准测试、模型验证以及下游计算药物发现相关应用。

创建时间:
2025-12-02
二维码
社区交流群
二维码
科研交流群
商业服务