遇见数据集

LiteFold/STRING

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

STRING是一个蛋白质关联网络数据库,整合了实验、计算、文本挖掘和人工整理的证据,用于功能性和物理性蛋白质相互作用。

STRING is a protein association network database that integrates experimental, computational, text-mined, and curated evidence for functional and physical protein interactions.

提供机构:
LiteFold
搜集汇总
数据集介绍
LiteFold/STRING 数据集图片
构建方式
STRING v12.0 数据集源自全球知名的蛋白质关联网络数据库 STRING,通过整合实验验证、计算预测、文本挖掘及人工注释等多维度证据,系统性地构建了蛋白质之间的功能与物理相互作用图谱。原始数据涵盖蛋白质链接、蛋白信息、别名、序列及物种信息五大类型,经过统一的 CRC32 哈希算法进行确定性划分,以 98:1:1 的比例分配至训练集、验证集与测试集,确保数据划分的可复现性。所有数据均以高效的 Parquet 格式存储,支持流式加载与本地预处理。
特点
该数据集具备高度结构化与多模态特征,提供五种配置子集以满足不同研究需求:protein_links 包含详尽的蛋白质相互作用边及综合评分;protein_info 记录蛋白质标识符、名称、长度与注释;protein_aliases 汇集外部来源的别名与标识;protein_sequences 存储氨基酸序列;species 则囊括物种的分类学信息与命名。每个子集均通过唯一键确保实体的可追踪性,且采用确定性哈希完成数据切分,支持大规模图分析与生物信息学建模。
使用方法
用户可通过 Hugging Face Datasets 库便捷调用,支持流式模式处理庞大的相互作用数据:from datasets import load_dataset,指定配置名如 protein_links 并选择 split 即可迭代获取样本。对于较小的元数据表,可常规加载至内存。同时,用户亦可下载本地 Parquet 文件后直接加载,或利用提供的脚本进行自定义预处理,如过滤低置信度边(设置 --link-min-combined-score)、调整工作进程数与分块大小,以适应计算资源限制。数据集的发布遵守 CC-BY 4.0 许可,引用需标注上游 STRING 数据库文献。
背景与挑战
背景概述
蛋白质相互作用网络是解析细胞功能机制与疾病分子基础的核心工具,其复杂性要求整合多源异构数据以构建高覆盖度的关联图谱。STRING数据库自2000年由苏黎世大学、欧洲分子生物学实验室及哥本哈根大学等机构的研究人员联合创建,历经二十余年迭代至v12.0版本,已成为蛋白质关联网络领域的权威资源。该版本基于实验验证、计算预测、文本挖掘及数据库整合四种证据通道,系统收录了超过5000种生物的蛋白质-蛋白质相互作用数据,并赋予每个关联以综合置信评分(combined_score)。STRING v12.0的发布显著推动了功能富集分析、通路预测及跨物种比较基因组学的发展,尤其在揭示非模式生物的蛋白网络方面贡献卓著,为系统生物学研究提供了不可或缺的数据基础设施。
当前挑战
该数据集的核心挑战在于解决蛋白质相互作用证据异质性与噪声融合的领域难题。不同来源的相互作用数据具有迥异的可靠性尺度(如高通量实验的假阳性与文本挖掘的语境歧义),亟需设计鲁棒的评分校准机制以避免偏差累积。构建过程中,从原始文本、FASTA序列及物种元数据等非结构化或半结构化文件向标准化Parquet格式的转化面临显著困难,尤其是将冗余的蛋白别名映射至唯一标识符,并确保跨配置(如protein_links与protein_sequences)的实体一致性。此外,数据量庞大(涵盖数十亿条目)导致内存管理与分布式处理效率的平衡成为技术瓶颈,需通过分块哈希分区与流式加载策略缓解资源压力,同时保持切分结果的确定性可复现性。
常用场景
经典使用场景
在蛋白质组学与系统生物学研究中,STRING数据集被广泛用于构建蛋白质-蛋白质相互作用(PPI)网络。研究者通过加载protein_links配置中的边信息,结合protein_info提供的蛋白质元数据,能够绘制出涵盖多种生物体的全局互作图谱。该数据集整合了实验验证、计算预测以及文本挖掘等多源证据,为网络生物学分析提供了高质量的基准网络。其典型的应用包括拓扑特征分析、模块检测以及关键蛋白质的识别,为理解细胞内的信号传导与代谢调控奠定了数据基础。
解决学术问题
STRING数据集有效解决了大规模PPI网络中数据碎片化与证据不一致的难题。通过将分散在不同数据库和文献中的相互作用证据统一标准化为combined_score,它为研究者提供了一个可量化的置信度指标,从而能够从噪声中筛选出高可信度的互作关系。这一特性极大地推动了功能富集分析、蛋白质复合物预测以及疾病相关基因的优先级排序等研究。其深远意义在于促进了跨物种的进化保守性分析,为探索致病机制和药物靶点发现提供了系统性的视角。
衍生相关工作
STRING数据集催生了一系列经典的衍生研究工作。在方法学方面,基于其PPI网络的结构特性,研究者开发了如node2vec和GraphSAGE等图表示学习模型,用于预测未知的蛋白质互作关系。在工具开发层面,诸如Cytoscape中的STRING App允许用户直接在可视化界面中查询网络,极大地提升了数据的可访问性。此外,该数据集也是许多深度学习框架的基准测试集,用于评估链路预测算法的性能。这些衍生工作不仅深化了对蛋白质互作网络的理解,也推动了计算生物学方法论的持续创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务