smiles-molecules-chembl
收藏资源简介:
ChEMBL是一个人工整理的具有药物类似特性的生物活性分子数据库,它整合了化学、生物活性和基因组数据,以促进基因组信息转化为有效的新药物。该数据集包含1,941,405个分子,分为训练集、验证集和测试集,用于基于分布学习和目标导向的分子生成任务,即生成具有期望属性的新分子。
ChEMBL is a manually curated database of bioactive molecules with drug-like properties. It integrates chemical, bioactivity and genomic data to facilitate the translation of genomic information into effective new drugs. This dataset contains 1,941,405 molecules, which are split into training, validation and test sets, and is used for distribution learning and goal-directed molecular generation tasks, i.e., generating new molecules with desired properties.
ChEMBL Molecule Generation Dataset
数据集描述
ChEMBL 是一个人工 curated 的生物活性分子数据库,具有药物样特性。它汇集了化学、生物活性和基因组数据,以促进基因组信息转化为有效的新药物。
任务描述
适用于基于分布学习和目标导向的分子生成任务。即生成具有某些预定义属性的新分子。
数据集统计
- 总共包含 1,941,405 个分子
- 训练集:1,358,980 个分子
- 验证集:194,123 个分子
- 测试集:388,302 个分子
数据集由 Therapeutics Data Commons 进行随机分割,并移除了缺失值。
参考文献
- Mendez, David, et al. “ChEMBL: towards direct deposition of bioassay data.” Nucleic acids research 47.D1 (2019): D930-D940.
- Davies, Mark, et al. “ChEMBL web services: streamlining access to drug discovery data and utilities.” Nucleic acids research 43.W1 (2015): W612-W620.




