遇见数据集

CCSB-AI-Interactome

收藏
Hugging Face2026-08-12 更新2026-08-13 收录
官方服务:

资源简介:

CCSB-AI-Interactome是一个标准化的蛋白质-蛋白质相互作用(PPI)基准数据集,来源于Lambourne等人于2026年发表在《Nature Communications》上的研究。该研究通过改进的酵母双杂交(Y2H)实验对酿酒酵母(S. cerevisiae)近乎完整的ORFeome(5,854个经序列验证的ORF,覆盖99.5%)进行筛选,生成了酵母参考相互作用组(YeRI),并将全蛋白质组的AlphaFold/RoseTTAFold预测通过相同的湿实验流程进行验证。数据集的标题发现是,高置信度的AI预测在质量上与实验数据相当,但在全蛋白质组筛选中发现的严格新颖相互作用数量少得多。数据集包含多个split:afrf_y2h_yeast、afrf_y2h_human、yeri、y2h_union_25、valbin_25、prs_rrs_yeast、prs_rrs_human、orthogonal_assays。所有split共享相同的列:UniProt ID、氨基酸序列、物种、ORF名称、常用基因名、标签(1为相互作用,0为非相互作用,-1为不可评分)、来源数据集、证据标志、Y2H结果、正交检测结果、检测分数、AlphaFold置信度指标以及新颖性标记。标签语义因split而异。适用任务:PPI预测模型评估、AI预测与实验验证的一致性检验、相互作用组映射方法的基准测试。注意事项:Y2H阴性并不等于非相互作用;酵母split可能与常见训练语料库存在重叠;某些split包含双向行需去重;极少数行缺少序列。

CCSB-AI-Interactome is a standardized protein-protein interaction (PPI) benchmark dataset derived from a study by Lambourne et al. published in Nature Communications in 2026. The study screened the near-complete ORFeome of Saccharomyces cerevisiae (5,854 sequence-verified ORFs, covering 99.5%) using an improved yeast two-hybrid (Y2H) assay, generating the yeast reference interactome (YeRI), and validated whole-proteome AlphaFold/RoseTTAFold predictions through the same wet-lab pipeline. The key finding is that high-confidence AI predictions are comparable in quality to experimental data, but yield far fewer strictly novel interactions found in whole-proteome screens. The dataset includes multiple splits: afrf_y2h_yeast, afrf_y2h_human, yeri, y2h_union_25, valbin_25, prs_rrs_yeast, prs_rrs_human, and orthogonal_assays. All splits share the same columns: UniProt ID (A, B), amino acid sequences (SeqA, SeqB), species (OrgA, OrgB), ORF names/source IDs (NameA, NameB), common gene names (GeneA, GeneB), labels (1 for interaction, 0 for non-interaction, -1 for unscorable), source dataset, evidence flags, Y2H results, orthogonal assay results, scores, AlphaFold confidence metrics (contact_probability, model_confidence, pDockQ, iPAE, CCC), and novelty markers. Label semantics vary by split. Applicable tasks: PPI prediction model evaluation, consistency check between AI predictions and experimental validation, benchmarking of interactome mapping methods. Notes: Y2H negatives do not equal non-interactions; yeast splits may overlap with common training corpora; some splits contain bidirectional rows requiring deduplication; a few rows lack sequences due to invalid UniProt entries.

提供机构:
Gleghorn Lab
创建时间:
2026-08-12
原始信息汇总

CCSB-AI-Interactome 数据集详情

数据集概述

该数据集是一个经过整合的蛋白质-蛋白质相互作用(PPI)基准测试集,来源于 Lambourne 等人发表于 Nature Communications 的研究论文《Experimental assessment of AI-based interactome mapping》。研究团队利用改进的酵母双杂交(Y2H)实验对酵母 ORFeome(覆盖率达 99.5%)进行了筛选,并利用 AlphaFold/RoseTTAFold 的结构预测结果通过湿实验流程进行验证。核心发现是高置信度的 AI 预测在质量上可匹配实验数据,但能发现的严格新型相互作用显著少于全蛋白质组筛选。

数据集规模与结构

  • 总大小:约 36.6 MB(下载大小约 15 MB)
  • 数据格式:所有分片共享统一的数据模式,共包含 8 个分片
  • 许可证:CC BY 4.0
  • 语言:英文

数据分片(Splits)

分片名称 行数 正样本 负样本 不可评分 物种 说明
afrf_y2h_yeast 597 17 559 21 酵母 AlphaFold/RoseTTAFold 预测对的湿实验 Y2H 判定结果
afrf_y2h_human 4,046 402 2,916 728 人类 Zhang 等人的 AF/RF 人类预测对的 Y2H 判定结果
yeri 1,970 1,970 0 0 酵母 酵母参考相互作用组,附有 AlphaFold 指标和正交实验数据
y2h_union_25 4,556 4,556 0 0 酵母 四个系统性酵母 Y2H 图谱的并集
valbin_25 12,706 12,706 0 0 酵母 经结构、文献和 Y2H 证据验证的酵母二元 PPI
prs_rrs_yeast 306 108 198 0 酵母 scPRS-v2 阳性集与 scRRS-v2 随机参考集,含所有实验读数
prs_rrs_human 729 342 387 0 人类 hsPRS-v2/hsRRS-v2 及其文献和随机对照集
orthogonal_assays 8,846 858 6,484 1,504 酵母 MAPPIT 和 GPCA 实验级别的原始结果,每行对应一个实验配置

数据模式(Schema)

所有分片共享以下字段:

字段名 类型 含义
A, B string UniProt 登录号
SeqA, SeqB string 氨基酸序列
OrgA, OrgB string 物种双名法名称
NameA, NameB string 系统 ORF 名称(酵母)或来源登录号(人类)
GeneA, GeneB string 常用基因名称
labels int8 1 表示相互作用,0 表示非相互作用,-1 表示不可评分
source_dataset string 论文中的来源数据集
evidence string ; 连接的多重证据标志,例如 I3D-exp-24;Lit-BM-24
y2h_v1_result, y2h_v4_result string 原始 Y2H 判定结果,未测试则为空
mappit_result, gpca_result string 正交实验判定结果,未测试则为空
score float32 实验分数或 YeRI 手动生长分数
contact_probability, model_confidence, pDockQ, iPAE, CCC float32 AlphaFold 置信度指标,不可用时为 NaN
novel int8 1 表示发表时严格新颖,0 表示非新颖,-1 表示未知

标签语义说明

不同分片中 labels 字段的含义有所不同:

  1. afrf_y2h_yeastafrf_y2h_humanorthogonal_assays:标签表示实验判定结果,是被评测的对象。
  2. prs_rrs_yeastprs_rrs_human:标签表示参考集成员身份(PRS 阳性、RRS 随机),实验判定结果存放在结果字段中。
  3. yeriy2h_union_25valbin_25:仅包含阳性相互作用列表,所有标签均为 1,需要自行提供负样本。

labels = -1 表示无法评分的行(如自激活子、失败测试、序列确认失败的克隆),这些行被保留以便不丢失任何数据,可使用 ds.filter(lambda x: x["labels"] >= 0) 进行过滤。

核心亮点

afrf_y2h_yeastafrf_y2h_human 是由结构预测方法判定为相互作用的蛋白质对,每对均附有实验验证结果。所有负样本均为结构上的“近似匹配”(near-miss)而非随机配对,这使得它们成为比常规随机负样本基准更具挑战性的判别目标,可用于直接测试仅基于序列的模型是否能够恢复结构虚拟筛选遗漏的信号。

使用注意事项

  1. Y2H 阴性结果并非已验证的非相互作用:该实验仅能回收约 20-30% 的 scPRS-v2 阳性结果,阴性仅表示“在该实验中未检测到”,而非“这些蛋白质不相互作用”。应将其视为 Y2H 可验证性基准,而非真实相互作用基准。
  2. 酵母数据在常见 PPI 训练语料库(如 STRING、BioGRID)中代表性充分:在酵母分片上进行评估时,需要针对模型的训练集进行同源性或聚类级别的泄漏控制。yeri 中的 novel 列标记了 1,446 行发表时严格新颖的数据,这些数据最不可能被记忆。
  3. yeriprrs_rrs_human 包含双向重复行yeri 的 1,970 行对应 1,910 个唯一无序蛋白质对;prr_rrs_human 的 729 行对应 590 个唯一对。如需每个蛋白质对一行,需按排序后的 (NameA, NameB) 键去重。
  4. mappit_resultgpca_result 是蛋白质对级别的整合结果:只要任一测试配置为阳性即判定为阳性,这不能精确复现论文 Figure 2a 中的各实验计数(该图采用无法从公开数据中恢复的额外质控标准)。如需按不同规则重新计算,请使用 orthogonal_assays 分片。
  5. 有 10 行缺少序列数据:四个人类登录号在 UniProt 中已失效(A0A0C4DGZ8O43930Q8WV35 已删除,P01562 已拆分),对应行的 SeqA/SeqB 字段为空。

数据溯源

序列信息来源于 UniProt 参考蛋白质组 UP000002311(酿酒酵母 S288C)和 UP000005640(智人),对于参考蛋白质组之外的条目进行了单独的标识符查询。酵母 ORF 名称与 UniProt 的 ordered locus name 字段进行了匹配。

引用信息

bibtex @article{lambourne2026interactome, title = {Experimental assessment of AI-based interactome mapping}, author = {Lambourne, Luke and Yadav, Anupama and Wang, Yang and others}, journal = {Nature Communications}, volume = {17}, number = {1}, pages = {4894}, year = {2026}, doi = {10.1038/s41467-026-70942-x} }

酵母相互作用图谱可在 Yeast Interactome Portal 上浏览。

搜集汇总
数据集介绍
CCSB-AI-Interactome 数据集图片
构建方式
本数据集源自Lambourne等人发表于《Nature Communications》的研究,旨在系统评估AI预测的蛋白质相互作用(PPI)在湿实验中的可验证性。研究者利用改进的酵母双杂交(Y2H)技术,对近乎完整的酿酒酵母ORFeome(覆盖率99.5%)进行筛选,构建了酵母参考相互作用组(YeRI),并将蛋白质组规模的AlphaFold/RoseTTAFold预测结果同置于该实验流水线中检验。数据集将论文补充材料中的多张表格统一解析为氨基酸序列,并规范化为单一schema,涵盖八个子集,包括AI预测对的Y2H实验判定、酵母参考相互作用组、多源Y2H图谱并集、文献验证的二元PPI等,所有子集共享相同的列结构。
使用方法
用户可通过HuggingFace的datasets库便捷下载与使用该数据集,例如使用load_dataset函数加载特定子集(如afrf_y2h_human),并对标签进行过滤(去除不可评分行)。对于需要构建负样本的场景,可直接利用afrf_y2h_*子集的实验判定作为监督信号。在评估酵母子集时,建议利用novel列(标记严格新颖的相互作用)来降低模型记忆效应的影响。由于部分子集同时包含双方向行,处理时需按排序后的蛋白质对键去重。该数据集还提供了orthogonal_assays子集,允许用户基于原始检测结果自定义质量控制规则,以复现或扩展论文分析。用户应关注不同子集的标签语义差异,以确保实验设计的准确性。
背景与挑战
背景概述
随着蛋白质结构预测技术如AlphaFold与RoseTTAFold的迅猛发展,计算预测的蛋白质-蛋白质相互作用(PPI)图谱规模急剧膨胀,然而其生物学有效性尚缺乏系统性的实验验证。在此背景下,2026年发表于《Nature Communications》的Lambourne等人研究,通过整合酵母双杂交(Y2H)等湿实验手段,对AI预测的相互作用进行了大规模实验评估。该数据集由Gleghorn实验室构建,基于Lambda等人的补充数据,涵盖酵母与人类蛋白质组的多种预测与实验交互数据,包括Y2H、MAPPIT、GPCA等正交验证结果。其核心研究问题在于评估AI预测的相互作用在真实生物环境中的可信度,并揭示其与实验验证结果之间的差异。该数据集的发布为计算生物学领域提供了首个标准化基准,推动了蛋白质相互作用预测模型的验证与优化,对后续AI驱动的互作组学研究具有重要参考价值。
当前挑战
该数据集所面临的挑战既包括领域内的共性问题,也涵盖构建过程中的具体难点。领域挑战方面,AI预测的蛋白质相互作用(如AlphaFold生成的模型)往往缺乏实验验证,而传统Y2H实验又存在较高的假阴性率,导致“非相互作用”标签并不可靠,这为模型评估带来了根本性困难。此外,酵母蛋白质在常见训练数据库(如STRING、BioGRID)中高度覆盖,序列同源泄漏风险严重,使得性能评估极易失真。构建过程中,数据清洗需整合多种来源的序列与注释,并处理UniProt中部分访问号失效(如A0A0C4DGZ8等)导致的序列缺失问题;同时,不同来源的标签语义各异(如assay outcome与reference-set membership),需谨慎区分。更关键的是,AI预测的阳性对在实验中多为结构近似而非随机配对,这构成了远比传统随机负样本更为严苛的分类任务,要求模型具备更高的判别力。
常用场景
经典使用场景
在蛋白质相互作用组学研究中,如何系统评估计算预测模型的生物学真实性一直是困扰领域的核心难题。CCSB-AI-Interactome数据集以近乎全覆盖的酿酒酵母ORFeome和人类蛋白质组为背景,将AlphaFold与RoseTTAFold的结构预测产物置于同源的湿实验酵母双杂交框架下进行裁决。其经典使用方式是将AI预测的相互作用对作为候选,以实验检测结果作为金标准,构建高难度的二分类任务,特别关注结构近似但功能不互作的负样本,从而检验序列或结构模型能否区分真实互作与‘结构陷阱’。
解决学术问题
该数据集直面了AI相互作用组图谱中预测结果的可信度评估问题,以及传统随机负样本带来的基准测试失真。通过提供包含实验判定、正交实验证据和多重AlphaFold置信度指标的标准化数据,它使得研究者能够对预测模型的精确率、召回率及泛化能力进行严格量化,尤其关注那些被结构预测高度评分但未被实验验证的假阳性案例,推动了从‘预测准确性’向‘生物学可验证性’的范式转变,为计算生物学与实验生物学的交叉验证提供了里程碑式的资源。
实际应用
在实际应用层面,该数据集为药物靶点发现和疾病相关通路解析提供了直接支持。例如,针对人类蛋白质组的afrf_y2h_human子集可用于筛选疾病相关蛋白质复合物的候选靶点,减少后续验证实验的盲目性。数据集中同时包含的酵母参考互作组(YeRI)和标准验证集(valbin_25),则常被用于高通量筛序流程的质量控制,以及训练专门的蛋白质相互作用预测工具,提升从序列直接推断互作网络的效率,从而加速功能基因组学和精准医学的研究进程。
数据集最近研究
最新研究方向
该数据集聚焦于系统性评估基于人工智能的结构预测方法(如AlphaFold和RoseTTAFold)在蛋白质相互作用组绘图中的表现,通过大规模酵母双杂交实验对AI预测结果进行实验验证。研究揭示,高置信度的AI预测虽在质量上与实验数据相当,但在全蛋白质组筛选中发现的严格新型互作数量较少,强调了实验验证的必要性。数据集整合了多种来源的蛋白质互作信息,并提供了详细的实验与预测指标,为开发更精准的互作预测模型、理解蛋白质互作网络进化及疾病机制提供了宝贵资源,推动AI与实验生物学深度融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务