遇见数据集

yk0/proteinbase_interactions

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为ProteinBase Interactions,专注于蛋白质结合剂与目标蛋白质之间的相互作用。每一行数据代表一个结合剂-目标对,包含结合剂的ProteinBase标识符、序列、目标蛋白质名称、序列、实验结合强度标签(如无、弱、中、强)、二元分类标签(0表示无结合,1表示有结合)、设计类别元数据(如scFv、小蛋白、肽段)以及是否为抗体衍生设计的标志(如纳米抗体或scFv)。数据集经过过滤,仅保留表达的结合剂,并对非抗体结合剂施加了最大序列相似性阈值(≤50%),而抗体衍生设计则不受此限制。结合亲和力以KD值的最小值表示,若无KD测量则为空。数据集来源于多个ProteinBase集合,适用于蛋白质-蛋白质相互作用分析、结合剂设计和抗体研究。

The dataset named ProteinBase Interactions focuses on interactions between protein binders and target proteins. Each row represents a single binder-target pair, including the ProteinBase binder identifier, binder sequence, target protein name, target sequence, experimental binding-strength labels (None, Weak, Medium, Strong), a binary classification label (0 for None, 1 for Weak, Medium, or Strong), design-class metadata (e.g., scFv, miniprotein, peptide), and an antibody flag indicating if the binder is antibody-derived (Nanobody or scFv). Rows are filtered to retain only expressed binders, with additional similarity filtering applied to non-antibody binders (max similarity ≤50%), while antibody binders are retained regardless. Binding affinity is represented by the minimum KD value, if available. The dataset is constructed from multiple ProteinBase collections and is suitable for protein-protein interaction studies, binder design, and antibody research.

提供机构:
yk0
搜集汇总
数据集介绍
构建方式
ProteinBase Interactions数据集的构建源自多个蛋白质设计竞赛与实验验证项目的整合,涵盖了二十余个来自不同研究团体的原始数据集,如适应性竞争实验、纳米抗体设计挑战及蛋白质进化验证等。每一数据条目代表一个结合子-靶标配对,包含结合子标识符、序列、靶标名称与序列、实验结合强度标签、二分类标签、设计类别元数据及是否为抗体衍生设计的标志。构建过程中实施了严格的筛选标准:仅保留至少包含一个靶标且结合子被标记为已表达的条目。针对非抗体结合子,额外施加序列相似度过滤,仅保留最大数据库相似度不超过50%的条目,而抗体衍生结合子则豁免此限制并被标记为抗体类别。
特点
该数据集的核心特色在于其丰富的标签体系与结构化的元数据设计。结合强度标签分为无、弱、中和强四个等级,并由此衍生出明确的二分类标签,为非结合与结合事件提供了清晰的判别标准。同时,数据集收录了部分配对对应的KD值(解离常数),为定量亲和力分析提供了宝贵资源。设计类别涵盖微蛋白、肽、纳米抗体及单链可变区等多种类型,抗体标志的引入进一步区分了抗体与非抗体结合子,增强了数据集在抗体工程与蛋白质设计研究中的适用性。多源竞赛数据的融合也赋予了数据集高度的多样性与现实挑战性。
使用方法
使用者可通过HuggingFace数据集加载工具直接调用该资源,默认配置下将读取data.csv文件中的训练集数据。数据集以表格形式组织,包含proteinbase_id、binder_name、target、target_sequence、binder_sequence、binding_strength、label、value、max_similarity_to_any_database、design_class及antibody等字段。适用于蛋白质-蛋白质相互作用预测、结合子设计评估、抗体性质分类以及亲和力回归建模等任务。二分类标签可直接用于监督学习中的分类模型训练,结合强度等级可用于多分类或排序学习,而KD值则服务于回归分析。此外,设计类别与抗体标志可用于子集划分或条件约束下的模型评估与泛化能力检验。
背景与挑战
背景概述
蛋白质-蛋白质相互作用是生命科学领域的核心议题,在药物发现、抗体工程及合成生物学中具有举足轻重的地位。精准预测与设计高亲和力结合蛋白,长期以来是计算生物学与实验生物学共同追求的目标。ProteinBase Interactions数据集应运而生,由ProteinBase团队于近年来构建,整合了来自多个蛋白质设计竞赛与验证项目的实验数据,涵盖超过千对结合子-靶标相互作用记录。该数据集的核心研究问题在于,为机器学习驱动的蛋白质结合子设计提供标准化、高质量的基准资源,推动从传统实验筛选向计算引导的理性设计范式转变。其影响力体现在,通过提供统一的实验标签、序列信息和结合亲和力数值,为开发与评估蛋白质相互作用预测模型、抗体设计算法及通用结合子生成方法奠定了关键数据基础,促进了该领域的可复现研究与横向比较。
当前挑战
该数据集所解决的领域挑战在于,蛋白质结合子设计的核心难题——如何从海量的序列空间中高效筛选出具有预期结合活性的分子。传统实验方法通量低、成本高,计算模型又常因缺乏统一、高质量的基准数据而难以评估与优化。构建过程中面临的挑战同样显著:首先,原始数据来源于多个独立竞赛与验证集,存在标注格式、结合强度量纲及实验条件不一的问题,需建立统一且合理的二元分类标准;其次,非抗体结合子与抗体衍生设计在序列多样性、结合模式及数据集偏向上存在本质差异,必须设计差异化的过滤策略,例如仅对非抗体结合子施加序列相似性阈值,以避免数据冗余与过拟合;最后,结合亲和力KD值的稀疏性要求妥善处理缺失值,从而在保留最大信息量的同时维持标签的可靠性。
常用场景
经典使用场景
ProteinBase Interactions数据集的经典使用场景聚焦于蛋白质-蛋白质相互作用的预测与分类任务,特别是在从头设计结合子(binder)的背景下。该数据集汇集了来自多项蛋白质设计竞赛与验证实验的成对结合子-靶标数据,提供了实验测定的结合强度标签(None、Weak、Medium、Strong)及其衍生的二分类标签。研究者常利用该数据集训练机器学习模型,以精准区分功能性结合子与非结合子,并探索序列特征与结合亲和力之间的复杂关联。此外,数据集中包含的抗体衍生结合子(如纳米抗体和单链可变区片段)与人工设计蛋白(如微型蛋白和肽类)的明确分类,使其成为评估跨设计类别泛化能力的理想基准。
实际应用
在实际应用中,ProteinBase Interactions数据集为治疗性抗体和蛋白疗法的早期研发流程提供了关键支撑。药物发现团队可利用该数据集构建筛选模型,快速从海量虚拟文库中识别出对特定靶点(如表皮生长因子受体EGFR或程序性死亡配体1 PD-L1)具有弱至强结合能力的候选分子,从而减少湿实验验证的盲目性和资源消耗。同时,数据集中包含的抗体标志物信息使得针对纳米抗体和scFv片段的亲和力成熟工作得以精细化,推动基于计算设计的下一代免疫治疗制剂开发。此外,该数据集在合成生物学领域也有所贡献,例如辅助设计靶向病毒蛋白(如尼帕病毒)的高亲和力结合子,为新型抗病毒策略提供理论起点。
衍生相关工作
立足于ProteinBase Interactions数据集,衍生出了一系列颇具影响力的经典研究工作。其中,多项基于深度学习的蛋白质设计框架(如BoltzGen和Mosaic)借助该数据集验证了其生成结合子的实际亲和力,推动了从算法验证到实验反馈的闭环优化流程。在比较基因组学领域,BindCraft和ProteinGenerator等工具利用该数据集的序列相似性过滤准则,重新定义了评估去全新设计蛋白的可信度阈值。此外,该数据集还催生了关于结合子设计竞争中人类专家与AI智能体表现对比的探讨,Adaptyv EGFR竞赛的数据子集成为衡量人类直觉与计算模型效率差异的典型范例。这些衍生工作共同夯实了蛋白质计算设计从理论迈向实验验证的方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务