遇见数据集

yk0/litscrape

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

LitScrape 是一个蛋白质结合剂相互作用数据集,从多篇设计论文和补充信息源文件中构建而成。每一行数据代表一个靶标-结合剂对,包含靶标名称和氨基酸序列、结合剂标识符和氨基酸序列、二元相互作用标签(1表示阳性结合,0表示阴性非结合)以及来源论文或源文件信息。此外,如果报告中提供,还会包含以纳摩尔为单位的结合亲和力数据。数据集的构建基于作者指定的标签,而非使用阈值来确定结合与否,并尽可能整合了不同方法测量的亲和力信息。

This is a protein binder interaction dataset built from multiple design papers and supplementary information source files. Each row is a target-binder pair with the target name and target sequence, the binder identifier and binder sequence, a binary interaction label, and the paper/source of origin. Binding affinity in nanomolar units is included when reported.

提供机构:
yk0
搜集汇总
数据集介绍
yk0/litscrape 数据集图片
构建方式
LitScrape数据集源自多篇蛋白质设计领域的前沿论文及其补充材料,系统性地整合了蛋白质结合子相互作用的实验数据。每一条记录均对应一个目标-结合子配对,包含目标名称与序列、结合子标识符与序列、二分类相互作用标签以及来源文献。在构建过程中,我们未自行设定阈值来界定结合与否,而是直接采纳作者在原始研究中指定的标签。对于阳性与阴性样本的序列信息,数据集尽可能从各文献的补充材料中完整收录,同时保留了作者报告的纳米摩尔级结合亲和力数据,尽管不同研究采用了差异化的测量技术。
特点
该数据集的核心特色在于其高度专注的领域定位与可靠的实验来源。它聚焦于蛋白质结合子设计这一关键生物学问题,样本数量介于千余至万条之间,涵盖了来自Overath等人、Latent-X、Dickinson PPI挑战赛、Bindcraft、AlphaProteo、PPIFlow及RFDiffusion等多个独立研究的数据。每条数据均提供完整的氨基酸序列与明确的二分类标签,其中‘1’代表结合、‘0’代表非结合,使得数据集既适合用于监督学习模型的训练,也便于进行跨方法的性能比较与元分析。
使用方法
LitScrape数据集的设计简洁而实用,用户可直接加载包含训练分割的data.csv文件进行使用。其字段结构清晰,source_publication列有助于追溯数据起源,target_sequence与binder_sequence两列提供了完整的序列信息,label列则作为目标变量。对于需要定量分析的研究,binding_affinity_nm字段虽存在缺失,但可结合其他特征进行多任务学习或回归预测。该数据集尤适用于蛋白质-蛋白质相互作用预测、结合子设计与筛选模型的开发与验证,以及计算生物学中的基准测试任务。
背景与挑战
背景概述
蛋白质-蛋白质相互作用(PPI)是生命科学领域的核心研究课题,其精准调控与疾病机制解析及药物设计密切相关。随着深度学习技术的快速发展,基于蛋白质计算设计的逆向折叠与结合剂生成方法取得了显著突破,然而高质量、标准化的实验验证数据集的匮乏仍是制约该领域发展的关键瓶颈。在此背景下,LitScrape数据集于2024年由多机构研究人员联合构建,旨在整合分散于不同论文与补充材料中的蛋白质结合剂互作数据。该数据集包含超过千条目标-结合剂配对信息,每条记录涵盖序列、二元互作标签及结合亲和力(纳摩尔水平),数据来源涵盖Overath等人荟萃分析、AlphaProteo及RFDiffusion等前沿方法。其核心研究问题在于弥合计算预测与实验验证之间的鸿沟,为深度学习模型提供可靠的训练与基准测试资源,从而推动蛋白质设计领域从方法迭代走向可重复性验证,对合成生物学与精准医学工具开发具有重要影响。
当前挑战
LitScrape数据集所面临的挑战首先体现在领域核心问题的复杂性上:蛋白质结合剂设计的根本难题在于从无限序列空间中高效筛选出具备高亲和力与特异性的候选分子,而现有实验方法受限于通量与成本,导致阳性与阴性样本的比例严重失衡,且阴性数据的获取尤为困难。在构建过程中,挑战主要源于数据异质性与来源多样性:各原始文献采用的结合判定标准(如亲和力阈值、测量技术)参差不齐,部分方法仅报告阳性序列,阴性数据需从补充材料中手动提取;此外,不同研究对结合亲和力的测量技术(如表面等离子体共振、荧光偏振等)存在差异,使得统一量化标记成为难题。尽管数据集明确采用作者原始标签以避免主观阈值引入偏差,但未能统一标准化亲和力数值,这为跨论文可比性及模型泛化性能评估带来了隐患。这些挑战共同揭示了当前蛋白质数据整合中标准化与可重复性建设的紧迫性。
常用场景
经典使用场景
在蛋白质工程与计算生物学的交叉领域中,LitScrape数据集作为精心编纂的蛋白质-结合子相互作用资源,主要用于训练和评估基于序列的蛋白质结合预测模型。研究人员依托该数据集中的目标-结合子配对信息、氨基酸序列及二元交互标签,能够开发出判别结合与非结合事件的深度学习或机器学习算法。其经典应用场景涵盖从零样本结合子设计到亲和力排序的广泛任务,尤其适用于验证de novo设计方法在区分阳性与阴性结合候选物上的效能。数据集来源于多篇权威设计论文的补充信息,确保了实验标签的可靠性,为结合子预测研究提供了标准化的基准平台。
衍生相关工作
围绕LitScrape数据集已衍生出一系列开创性工作,主要集中在结合子预测算法的改进与跨方法比较研究。Overath等人利用该数据集中3,766个实验表征的结合子进行了元分析,揭示了不同de novo设计方法(如基于扩散模型与基于能量函数的框架)在预测成功中的共性规律。Dickinson PPI挑战赛则借助此数据集作为评估基准,推动了社区范围内对蛋白质-蛋白质相互作用预测鲁棒性的深入探讨。此外,PPIFlow和Latent-X等模型在开发过程中也参考了LitScrape的标注格式与数据分布,用以验证其生成式架构在生成高可信度且具有结合活性的序列方面的能力。这些衍生工作共同构建了一个以数据为驱动的设计-验证循环,加速了计算蛋白质设计领域的迭代创新。
数据集最近研究
最新研究方向
在蛋白质设计领域,数据集构建正从高通量实验向文献挖掘与整合方向演进。LitScrape数据集聚焦于蛋白质-蛋白质相互作用,通过系统梳理多篇前沿设计论文及其补充材料,汇集了数千对靶标-结合体互作数据,涵盖序列、结合亲和力及二元互作标签。这一资源顺应了从头蛋白质binder设计研究的热潮,尤其是针对AlphaProteo、RFDiffusion等生成式模型所产出的候选分子,研究者迫切需要标准化基准来评估实验成功概率。该数据集的出现,为模型泛化能力验证、负样本平衡策略优化以及亲和力预测提供了跨论文的统一样本,助力揭示de novo设计中的潜在规律。其意义在于弥合理论设计与实验验证之间的鸿沟,推动蛋白质工程从个案观测迈向系统性元分析的新阶段。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务