CCSB-AI-Interactome
收藏资源简介:
CCSB-AI-Interactome是一个标准化的蛋白质-蛋白质相互作用(PPI)基准数据集,来源于Lambourne等人于2026年发表在《Nature Communications》上的研究。该研究通过改进的酵母双杂交(Y2H)实验对酿酒酵母(S. cerevisiae)近乎完整的ORFeome(5,854个经序列验证的ORF,覆盖99.5%)进行筛选,生成了酵母参考相互作用组(YeRI),并将全蛋白质组的AlphaFold/RoseTTAFold预测通过相同的湿实验流程进行验证。数据集的标题发现是,高置信度的AI预测在质量上与实验数据相当,但在全蛋白质组筛选中发现的严格新颖相互作用数量少得多。数据集包含多个split:afrf_y2h_yeast、afrf_y2h_human、yeri、y2h_union_25、valbin_25、prs_rrs_yeast、prs_rrs_human、orthogonal_assays。所有split共享相同的列:UniProt ID、氨基酸序列、物种、ORF名称、常用基因名、标签(1为相互作用,0为非相互作用,-1为不可评分)、来源数据集、证据标志、Y2H结果、正交检测结果、检测分数、AlphaFold置信度指标以及新颖性标记。标签语义因split而异。适用任务:PPI预测模型评估、AI预测与实验验证的一致性检验、相互作用组映射方法的基准测试。注意事项:Y2H阴性并不等于非相互作用;酵母split可能与常见训练语料库存在重叠;某些split包含双向行需去重;极少数行缺少序列。
CCSB-AI-Interactome is a standardized protein-protein interaction (PPI) benchmark dataset derived from a study by Lambourne et al. published in Nature Communications in 2026. The study screened the near-complete ORFeome of Saccharomyces cerevisiae (5,854 sequence-verified ORFs, covering 99.5%) using an improved yeast two-hybrid (Y2H) assay, generating the yeast reference interactome (YeRI), and validated whole-proteome AlphaFold/RoseTTAFold predictions through the same wet-lab pipeline. The key finding is that high-confidence AI predictions are comparable in quality to experimental data, but yield far fewer strictly novel interactions found in whole-proteome screens. The dataset includes multiple splits: afrf_y2h_yeast, afrf_y2h_human, yeri, y2h_union_25, valbin_25, prs_rrs_yeast, prs_rrs_human, and orthogonal_assays. All splits share the same columns: UniProt ID (A, B), amino acid sequences (SeqA, SeqB), species (OrgA, OrgB), ORF names/source IDs (NameA, NameB), common gene names (GeneA, GeneB), labels (1 for interaction, 0 for non-interaction, -1 for unscorable), source dataset, evidence flags, Y2H results, orthogonal assay results, scores, AlphaFold confidence metrics (contact_probability, model_confidence, pDockQ, iPAE, CCC), and novelty markers. Label semantics vary by split. Applicable tasks: PPI prediction model evaluation, consistency check between AI predictions and experimental validation, benchmarking of interactome mapping methods. Notes: Y2H negatives do not equal non-interactions; yeast splits may overlap with common training corpora; some splits contain bidirectional rows requiring deduplication; a few rows lack sequences due to invalid UniProt entries.
CCSB-AI-Interactome 数据集详情
数据集概述
该数据集是一个经过整合的蛋白质-蛋白质相互作用(PPI)基准测试集,来源于 Lambourne 等人发表于 Nature Communications 的研究论文《Experimental assessment of AI-based interactome mapping》。研究团队利用改进的酵母双杂交(Y2H)实验对酵母 ORFeome(覆盖率达 99.5%)进行了筛选,并利用 AlphaFold/RoseTTAFold 的结构预测结果通过湿实验流程进行验证。核心发现是高置信度的 AI 预测在质量上可匹配实验数据,但能发现的严格新型相互作用显著少于全蛋白质组筛选。
数据集规模与结构
- 总大小:约 36.6 MB(下载大小约 15 MB)
- 数据格式:所有分片共享统一的数据模式,共包含 8 个分片
- 许可证:CC BY 4.0
- 语言:英文
数据分片(Splits)
| 分片名称 | 行数 | 正样本 | 负样本 | 不可评分 | 物种 | 说明 |
|---|---|---|---|---|---|---|
afrf_y2h_yeast |
597 | 17 | 559 | 21 | 酵母 | AlphaFold/RoseTTAFold 预测对的湿实验 Y2H 判定结果 |
afrf_y2h_human |
4,046 | 402 | 2,916 | 728 | 人类 | Zhang 等人的 AF/RF 人类预测对的 Y2H 判定结果 |
yeri |
1,970 | 1,970 | 0 | 0 | 酵母 | 酵母参考相互作用组,附有 AlphaFold 指标和正交实验数据 |
y2h_union_25 |
4,556 | 4,556 | 0 | 0 | 酵母 | 四个系统性酵母 Y2H 图谱的并集 |
valbin_25 |
12,706 | 12,706 | 0 | 0 | 酵母 | 经结构、文献和 Y2H 证据验证的酵母二元 PPI |
prs_rrs_yeast |
306 | 108 | 198 | 0 | 酵母 | scPRS-v2 阳性集与 scRRS-v2 随机参考集,含所有实验读数 |
prs_rrs_human |
729 | 342 | 387 | 0 | 人类 | hsPRS-v2/hsRRS-v2 及其文献和随机对照集 |
orthogonal_assays |
8,846 | 858 | 6,484 | 1,504 | 酵母 | MAPPIT 和 GPCA 实验级别的原始结果,每行对应一个实验配置 |
数据模式(Schema)
所有分片共享以下字段:
| 字段名 | 类型 | 含义 |
|---|---|---|
A, B |
string | UniProt 登录号 |
SeqA, SeqB |
string | 氨基酸序列 |
OrgA, OrgB |
string | 物种双名法名称 |
NameA, NameB |
string | 系统 ORF 名称(酵母)或来源登录号(人类) |
GeneA, GeneB |
string | 常用基因名称 |
labels |
int8 | 1 表示相互作用,0 表示非相互作用,-1 表示不可评分 |
source_dataset |
string | 论文中的来源数据集 |
evidence |
string | 用 ; 连接的多重证据标志,例如 I3D-exp-24;Lit-BM-24 |
y2h_v1_result, y2h_v4_result |
string | 原始 Y2H 判定结果,未测试则为空 |
mappit_result, gpca_result |
string | 正交实验判定结果,未测试则为空 |
score |
float32 | 实验分数或 YeRI 手动生长分数 |
contact_probability, model_confidence, pDockQ, iPAE, CCC |
float32 | AlphaFold 置信度指标,不可用时为 NaN |
novel |
int8 | 1 表示发表时严格新颖,0 表示非新颖,-1 表示未知 |
标签语义说明
不同分片中 labels 字段的含义有所不同:
afrf_y2h_yeast、afrf_y2h_human、orthogonal_assays:标签表示实验判定结果,是被评测的对象。prs_rrs_yeast、prs_rrs_human:标签表示参考集成员身份(PRS 阳性、RRS 随机),实验判定结果存放在结果字段中。yeri、y2h_union_25、valbin_25:仅包含阳性相互作用列表,所有标签均为1,需要自行提供负样本。
labels = -1 表示无法评分的行(如自激活子、失败测试、序列确认失败的克隆),这些行被保留以便不丢失任何数据,可使用 ds.filter(lambda x: x["labels"] >= 0) 进行过滤。
核心亮点
afrf_y2h_yeast 和 afrf_y2h_human 是由结构预测方法判定为相互作用的蛋白质对,每对均附有实验验证结果。所有负样本均为结构上的“近似匹配”(near-miss)而非随机配对,这使得它们成为比常规随机负样本基准更具挑战性的判别目标,可用于直接测试仅基于序列的模型是否能够恢复结构虚拟筛选遗漏的信号。
使用注意事项
- Y2H 阴性结果并非已验证的非相互作用:该实验仅能回收约 20-30% 的 scPRS-v2 阳性结果,阴性仅表示“在该实验中未检测到”,而非“这些蛋白质不相互作用”。应将其视为 Y2H 可验证性基准,而非真实相互作用基准。
- 酵母数据在常见 PPI 训练语料库(如 STRING、BioGRID)中代表性充分:在酵母分片上进行评估时,需要针对模型的训练集进行同源性或聚类级别的泄漏控制。
yeri中的novel列标记了 1,446 行发表时严格新颖的数据,这些数据最不可能被记忆。 yeri和prrs_rrs_human包含双向重复行:yeri的 1,970 行对应 1,910 个唯一无序蛋白质对;prr_rrs_human的 729 行对应 590 个唯一对。如需每个蛋白质对一行,需按排序后的(NameA, NameB)键去重。mappit_result和gpca_result是蛋白质对级别的整合结果:只要任一测试配置为阳性即判定为阳性,这不能精确复现论文 Figure 2a 中的各实验计数(该图采用无法从公开数据中恢复的额外质控标准)。如需按不同规则重新计算,请使用orthogonal_assays分片。- 有 10 行缺少序列数据:四个人类登录号在 UniProt 中已失效(
A0A0C4DGZ8、O43930、Q8WV35已删除,P01562已拆分),对应行的SeqA/SeqB字段为空。
数据溯源
序列信息来源于 UniProt 参考蛋白质组 UP000002311(酿酒酵母 S288C)和 UP000005640(智人),对于参考蛋白质组之外的条目进行了单独的标识符查询。酵母 ORF 名称与 UniProt 的 ordered locus name 字段进行了匹配。
引用信息
bibtex @article{lambourne2026interactome, title = {Experimental assessment of AI-based interactome mapping}, author = {Lambourne, Luke and Yadav, Anupama and Wang, Yang and others}, journal = {Nature Communications}, volume = {17}, number = {1}, pages = {4894}, year = {2026}, doi = {10.1038/s41467-026-70942-x} }
酵母相互作用图谱可在 Yeast Interactome Portal 上浏览。




