SeqScreen
收藏资源简介:
SeqScreen基准测试数据集是一个用于基于序列的虚拟筛选任务的数据集,旨在支持计算药物发现研究。该数据集专门设计用于解决蛋白质-分子结合的不对称性和一对多性质问题,为训练和评估对比学习模型提供数据支持。数据集包含两个子集:ChEMBL和LIT-PCBA。ChEMBL子集基于ChEMBL 36数据库构建,包含1,492个蛋白质、394,190个分子和583,960个正样本对用于训练;334个蛋白质、101,586个分子和147,676个正样本对用于验证;326个蛋白质、105,048个分子和130,281个正样本对用于测试,数据按蛋白质序列相似性进行分割。LIT-PCBA子集包含1,452个蛋白质、375,120个分子和548,294个正样本对用于训练;326个蛋白质、97,213个分子和143,088个正样本对用于验证;15个蛋白质、404,586个分子和2,776,973个样本对(包含正负样本)用于测试,其中训练和验证集使用过滤后的ChEMBL数据,测试集直接采用LIT-PCBA原始数据集。该数据集适用于蛋白质-分子相互作用预测、虚拟筛选和药物发现等任务,采用CC-BY-NC-ND 4.0许可证,仅限非商业学术研究使用。
数据集概述
SeqScreen 是一个基于序列的虚拟筛选基准数据集,旨在通过双编码器对比架构(受CLIP启发)识别与目标蛋白结合的候选分子。该数据集支持计算药物发现中的序列型方法评估,在无需3D结构信息的情况下,在LIT-PCBA数据集上实现了最高相对提升39%的富集因子(EF at 0.5)。
数据集构成
ChEMBL(基于ChEMBL 36生成,按蛋白质序列相似性划分)
- 训练集:1,492种蛋白质,394,190个分子,583,960个正配对
- 验证集:334种蛋白质,101,586个分子,147,676个正配对
- 测试集:326种蛋白质,105,048个分子,130,281个正配对
LIT-PCBA(训练/验证集来自ChEMBL过滤版本,测试集为LIT-PCBA)
- 训练集:1,452种蛋白质,375,120个分子,548,294个正配对
- 验证集:326种蛋白质,97,213个分子,143,088个正配对
- 测试集:15种蛋白质,404,586个分子,2,776,973个配对(包含正负样本)
数据集加载方法
加载ChEMBL数据集
python from datasets import load_dataset dataset_dict = load_dataset("SaeedLab/SeqScreen", data_dir="chembl")
加载LIT-PCBA数据集
python from datasets import load_dataset dataset_dict = load_dataset("SaeedLab/SeqScreen", data_dir="lit_pcba")
许可与使用限制
- 许可证:CC-BY-NC-ND 4.0,仅限非商业学术研究用途,需正确归属。
- 禁止行为:商业使用、销售、模型衍生品(包括基于模型输出训练的新模型或数据集)需经事先批准。
- 下载要求:需在Hugging Face注册并同意使用条款,禁止分发或复制模型。
- 合规说明:用户不得尝试重新识别用于模型开发的去标识化数据;商业实体请联系通讯作者。
引用与联系
- 论文状态:审稿中,接收后将更新引用信息。
- 联系方式:Fahad Saeed(fsaeed@fiu.edu)




