遇见数据集

SeqScreen

收藏
Hugging Face2026-05-22 更新2026-05-23 收录
官方服务:

资源简介:

SeqScreen基准测试数据集是一个用于基于序列的虚拟筛选任务的数据集,旨在支持计算药物发现研究。该数据集专门设计用于解决蛋白质-分子结合的不对称性和一对多性质问题,为训练和评估对比学习模型提供数据支持。数据集包含两个子集:ChEMBL和LIT-PCBA。ChEMBL子集基于ChEMBL 36数据库构建,包含1,492个蛋白质、394,190个分子和583,960个正样本对用于训练;334个蛋白质、101,586个分子和147,676个正样本对用于验证;326个蛋白质、105,048个分子和130,281个正样本对用于测试,数据按蛋白质序列相似性进行分割。LIT-PCBA子集包含1,452个蛋白质、375,120个分子和548,294个正样本对用于训练;326个蛋白质、97,213个分子和143,088个正样本对用于验证;15个蛋白质、404,586个分子和2,776,973个样本对(包含正负样本)用于测试,其中训练和验证集使用过滤后的ChEMBL数据,测试集直接采用LIT-PCBA原始数据集。该数据集适用于蛋白质-分子相互作用预测、虚拟筛选和药物发现等任务,采用CC-BY-NC-ND 4.0许可证,仅限非商业学术研究使用。

创建时间:
2026-05-21
原始信息汇总

数据集概述

SeqScreen 是一个基于序列的虚拟筛选基准数据集,旨在通过双编码器对比架构(受CLIP启发)识别与目标蛋白结合的候选分子。该数据集支持计算药物发现中的序列型方法评估,在无需3D结构信息的情况下,在LIT-PCBA数据集上实现了最高相对提升39%的富集因子(EF at 0.5)。

数据集构成

ChEMBL(基于ChEMBL 36生成,按蛋白质序列相似性划分)

  • 训练集:1,492种蛋白质,394,190个分子,583,960个正配对
  • 验证集:334种蛋白质,101,586个分子,147,676个正配对
  • 测试集:326种蛋白质,105,048个分子,130,281个正配对

LIT-PCBA(训练/验证集来自ChEMBL过滤版本,测试集为LIT-PCBA)

  • 训练集:1,452种蛋白质,375,120个分子,548,294个正配对
  • 验证集:326种蛋白质,97,213个分子,143,088个正配对
  • 测试集:15种蛋白质,404,586个分子,2,776,973个配对(包含正负样本)

数据集加载方法

加载ChEMBL数据集

python from datasets import load_dataset dataset_dict = load_dataset("SaeedLab/SeqScreen", data_dir="chembl")

加载LIT-PCBA数据集

python from datasets import load_dataset dataset_dict = load_dataset("SaeedLab/SeqScreen", data_dir="lit_pcba")

许可与使用限制

  • 许可证:CC-BY-NC-ND 4.0,仅限非商业学术研究用途,需正确归属。
  • 禁止行为:商业使用、销售、模型衍生品(包括基于模型输出训练的新模型或数据集)需经事先批准。
  • 下载要求:需在Hugging Face注册并同意使用条款,禁止分发或复制模型。
  • 合规说明:用户不得尝试重新识别用于模型开发的去标识化数据;商业实体请联系通讯作者。

引用与联系

  • 论文状态:审稿中,接收后将更新引用信息。
  • 联系方式:Fahad Saeed(fsaeed@fiu.edu)
搜集汇总
数据集介绍
SeqScreen 数据集图片
构建方式
SeqScreen数据集的构建依托于ChEMBL 36数据库,通过序列相似性对蛋白质进行分割,确保训练、验证与测试集的独立性。训练集包含1,492种蛋白质、394,190个分子及583,960个阳性对,验证集与测试集则分别涵盖数百种蛋白质与数十万分子对。为应对虚拟筛选中的蛋白质中心不对称特性,该数据集创新性地引入了蛋白质中心批次构建策略与不对称多阳性InfoNCE损失函数,从而突破了传统CLIP训练在对称任务上的局限性。此外,LIT-PCBA子集进一步扩展了测试规模,涵盖15种蛋白质与逾40万个分子,用于评估模型在真实场景下的泛化能力。
特点
SeqScreen数据集的核心特色在于其针对虚拟筛选任务的专精设计。相比传统成对处理方法,该数据集通过蛋白质中心批次构建策略,仅需约32分之一的训练轮次与7分之一的推理前向传播次数,即可实现显著性能提升。在LIT-PCBA基准上,SeqScreen超越了所有基于序列的基线方法,在EF at 0.5指标上相对提升高达39%,且无需三维结构信息即可与经典分子对接方法媲美。数据集同时集成8种蛋白质语言模型与3种分子语言模型变体,为多模态表征学习提供了系统性的评估平台。
使用方法
SeqScreen数据集提供了简洁的加载接口,用户可通过Hugging Face的datasets库直接调用。加载ChEMBL子集时,只需执行load_dataset('SaeedLab/SeqScreen', data_dir='chembl');而使用LIT-PCBA子集时,将data_dir参数改为'lit_pcba'即可。数据集已按标准划分为训练、验证与测试子集,便于直接应用于对比学习或虚拟筛选模型的训练与评估。用户需注意,该数据集采用CC-BY-NC-ND 4.0许可协议,仅限于非商业学术研究使用,并需在Hugging Face上注册同意使用条款后方可下载。
背景与挑战
背景概述
SeqScreen数据集由佛罗里达国际大学Saeed实验室于2024年创建,专注于序列基础的虚拟筛选方法,旨在解决药物发现中蛋白质-分子相互作用的预测问题。该数据集源自ChEMBL 36数据库,涵盖1,492种蛋白质和394,190个分子,并通过蛋白质序列相似性进行划分,以支持对比学习架构。SeqScreen引入了一种蛋白质中心的批次构建策略和非对称的多正样例InfoNCE损失函数,以应对虚拟筛选的蛋白质中心特性。在LIT-PCBA测试集上,该方法在EF at 0.5指标上相较最佳序列基方法提升高达39%,展现出与需要三维结构的传统对接方法相媲美的性能,显著推动了计算药物发现领域的发展。
当前挑战
数据集面临的挑战首先在于虚拟筛选的领域特性:蛋白质-分子结合具有不对称性和一对多关系,传统对比学习框架难以捕获这种复杂交互模式。SeqScreen通过蛋白质中心的批次构建和自定义损失函数解决了这一难题,但仍需应对大规模分子库带来的计算瓶颈。构建过程中,数据集的划分依据蛋白质序列相似性以确保评估的公平性,但ChEMBL数据中的实验偏差和噪声干扰了模型泛化能力。此外,LIT-PCBA测试集的正负样本极度不平衡(约2.8百万对中仅少量为正例),对模型的识别精度和鲁棒性提出了严峻考验。
常用场景
经典使用场景
SeqScreen数据集专为虚拟筛选任务而设计,聚焦于蛋白-分子相互作用的序列级预测。该数据集源自ChEMBL 36数据库,精心构建了大规模的正样本对集合,涵盖1492种蛋白质与近40万种分子,并依据蛋白质序列相似性进行划分以确保评估的公平性。其经典使用场景在于训练和评估基于序列的双编码器对比学习框架,通过蛋白质导向的批次构建策略与不对称多正例InfoNCE损失函数,高效学习蛋白-分子的联合表征,从而实现对候选分子与靶标蛋白结合能力的精准预测。
实际应用
在实际应用中,SeqScreen数据集及其训练的模型可广泛服务于早期药物研发流程,尤其是在大规模化合物库的初筛阶段。研究团队能够利用该数据集构建的预训练模型,快速识别与疾病相关蛋白质具有高亲和力的候选分子,从而减少对昂贵且耗时的高通量实验的依赖。该数据集中多样的蛋白类别和庞大的分子覆盖范围,使其尤其适用于靶向新药开发、多靶点药物设计以及现有药物的重定位研究,为加速先导化合物发现与优化进程提供了坚实的数据基础。
衍生相关工作
SeqScreen数据集的发布推动了一系列衍生工作的开展,最为显著的是其对基于序列的对比学习方法的迭代优化。相关研究围绕其核心组件——蛋白导向批次采样与多正例损失函数,进一步探索了更高效的负采样策略和表征对齐机制。此外,该数据集促进了跨模态预训练模型在药物-靶标相互作用预测领域的范式转移,催生了诸如基于大型语言模型微调的序列筛选框架,以及结合生物知识图谱的结构-序列混合方法,形成了一条从数据构建、方法创新到应用验证的完整研究链。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务