PepADMET-Dataset
收藏资源简介:
PepADMET 是一个全面、经过精心清洗与统一的多肽 ADMET(吸收、分布、代谢、排泄和毒性)数据集集合,专为机器学习和深度学习建模设计。本项目将来自多个公开数据库的异构数据整合为干净、标准化的 CSV 文件,可直接用于预测多肽的溶血性 (Hemolysis)、半衰期 (Half-life) 和 膜渗透性 (Permeability: Caco-2, PAMPA, MDCK, RRCK)。
PepADMET is a comprehensive, meticulously curated and unified collection of peptide ADMET (Absorption, Distribution, Metabolism, Excretion, and Toxicity) datasets, specifically designed for machine learning and deep learning modeling. This project integrates heterogeneous data from multiple public databases into clean, standardized CSV files that can be directly used to predict peptide hemolysis, half-life, and membrane permeability (Caco-2, PAMPA, MDCK, RRCK).
PepADMET-Dataset 数据集概述
数据集简介
PepADMET-Dataset 是一个全面、经过精心清洗与统一的多肽 ADMET(吸收、分布、代谢、排泄和毒性)数据集集合,专为机器学习和深度学习建模设计。该数据集整合了来自多个公开数据库的异构数据,用于预测多肽的溶血性、半衰期和膜渗透性。
核心特色
- 多源数据整合:整合了 HemoPI, APD, peptide-dashboard, PEPlife, THPdb, B3Pdb, CycPeptMPDB 和 PepLand 等多个数据库的数据。
- 严格标准化:统一了单位(如半衰期全部转换为秒),规范了多肽序列,并统一了二分类标签。
- 冲突解决机制:针对同一多肽序列在不同数据库中记录不一致的情况,采用了重叠检测和冲突解决策略。
- 即插即用:最终数据集已被深度清洗,可直接作为特征工程或深度学习模型的输入。
数据集概览
| 预测性质 | 任务类型 | 数据量 | 预测指标 | 数据来源 |
|---|---|---|---|---|
| 溶血性 (Hemolysis) | 二分类 | 8,825 | 0 (非溶血), 1 (溶血) |
HemoPI, APD, peptide-dashboard |
| 半衰期 (Half-life) | 回归 | 2,849 | 数值 (秒) | PEPlife, THPdb, B3Pdb |
| Caco-2 渗透性 | 回归 | 1,006 | LogPapp 数值 | CycPeptMPDB, PepLand |
| PAMPA 渗透性 | 回归 | 7,283 | LogPapp 数值 | CycPeptMPDB, PepLand |
目录结构
整理/:核心目录,存放所有最终清洗好的数据集。hemolysis_unified/hemolysis_unified.csv(溶血数据集)half_life_unified/half_life_final_minimal.csv(核心半衰期数据集)caco2_out/caco2_unified.csv(Caco-2 模型口服吸收)permeability_out/permeability_unified.csv(PAMPA/MDCK 等渗透数据)
process*.py:数据清洗、合并与冲突解决的 Python 源码。*.md:数据集详细清单、处理流程回顾等说明文档。




