遇见数据集

LiteFold/GO

收藏
Hugging Face2026-05-27 更新2026-06-21 收录
官方服务:

资源简介:

Gene Ontology(基因本体)是一个结构化知识库和受控词汇表,用于描述不同生物体中基因产物的功能、生物过程和细胞组分。该数据集包含一个易于查看的Parquet表格,源自该存储库中的Gene Ontology OBO文件。每一行对应go.obo文件中的一个[Term]节段,重复的OBO字段存储为列表列。原始源文件(如go.obo和go-basic.obo)保存在存储库中。in_go_basic列标记一个术语是否也出现在go-basic.obo中。来自go.obo的关系typedef元数据以metadata/typedefs.parquet形式提供。

The Gene Ontology is a structured knowledgebase and controlled vocabulary for describing gene product functions, biological processes, and cellular components across organisms. This dataset contains a viewer-friendly Parquet table derived from the Gene Ontology OBO files in this repository. Each row is one [Term] stanza from go.obo, with repeated OBO fields stored as list columns. The original source files are preserved in the repository: go.obo and go-basic.obo. in_go_basic marks whether a term is also present in go-basic.obo. Relationship typedef metadata from go.obo is available as metadata/typedefs.parquet.

提供机构:
LiteFold
搜集汇总
数据集介绍
LiteFold/GO 数据集图片
构建方式
基因本体论(Gene Ontology, GO)作为描述基因产物功能、生物过程及细胞组分的结构化知识库与受控词汇表,在生命科学领域具有基石地位。本数据集基于GO官方OBO文件构建,将每个[Term]节解析为Parquet表格中的一行,重复的OBO字段以列表列形式存储。数据源自`go.obo`与`go-basic.obo`,并通过`in_go_basic`标志标记术语在基础文件中的存在情况。数据集按确定性的哈希函数`sha256(go_id) % 10`划分:桶0为测试集,桶1至9为训练集,确保了划分的可重复性。此外,关系类型元数据独立存储于`metadata/typedefs.parquet`文件中,便于专业查询。
特点
该数据集涵盖48,291个GO术语,对应至2026年3月25日发布的GO版本,其中活跃术语38,560个,废弃术语9,731个。术语按命名空间分布:生物过程30,857个,分子功能12,839个,细胞组分4,595个。列设计丰富,包含`go_id`、`name`、`namespace`、`definition`、`synonyms`、`is_a_ids`、`relationship_edges`等31个字段,完整保留了OBO中的层级关系、交叉引用、同义词及注释信息。`parent_ids`字段整合了直接父类和关系目标ID,`split_bucket`字段提供了确定性划分索引,极大便利了下游机器学习任务的复现与验证。
使用方法
用户可通过Hugging Face Datasets库便捷加载数据:使用`load_dataset("LiteFold/GO")`一键获取训练与测试集;亦可通过`split`参数分别加载`train`或`test`分片。借助流式模式(`streaming=True`),可在不下载完整文件的前提下逐行读取数据,适合内存受限场景。列过滤操作直观,例如通过`ds.filter(lambda row: row["namespace"] == "biological_process" and not row["is_obsolete"])`快速筛选活跃的生物过程术语。关系类型元数据可通过`huggingface_hub`下载`metadata/typedefs.parquet`并利用Pandas解析,满足高级本体分析需求。
背景与挑战
背景概述
基因本体论(Gene Ontology, GO)是生物信息学领域最具影响力的结构化知识库之一,自1998年由Gene Ontology Consortium创立以来,经过二十余年的持续演化,已发展为描述基因产物功能、生物过程及细胞组分的全球标准化词汇体系。该数据集由LiteFold团队基于2026年3月25日发布的GO OBO文件构建,以Parquet格式提供48,291个术语的易用视图,涵盖生物过程、分子功能和细胞组分三大命名空间。其核心研究问题在于为跨物种的基因功能注释提供统一、可计算的语义框架,从而推动功能基因组学、系统生物学及精准医学的进展。作为生命科学基础数据资产,GO已被广泛应用于基因富集分析、蛋白质相互作用网络解析及疾病机制研究,是连接分子数据与生物学知识的桥梁。
当前挑战
该数据集面临的核心挑战包括:领域问题层面,GO需应对生物过程描述的复杂性与动态性,如基因产物多功能性导致的注释歧义、跨物种功能演化关系映射难题,以及低通量实验验证带来的标签噪声;构建过程层面,本体版本更迭(如2026年版本包含9,731个废弃术语)要求数据维护策略具备可追溯性,而OBO文件非结构化字段(如交叉引用、同义词范围)的解析需兼顾完备性与一致性。此外,大规模结构化数据的存储与高效检索、训练/测试集按SHA256哈希确定性切分带来的分布偏移风险,以及术语关系图中隐式层次与逻辑公理的编码,均构成技术挑战。
常用场景
经典使用场景
在生物信息学与计算生物学领域,基因本体论(Gene Ontology, GO)数据集是功能基因组学研究的基石。其经典应用场景在于为基因及其产物的功能注释提供标准化的语义框架。研究者通过该数据集,能够将海量基因与三个核心本体域——生物学过程、分子功能及细胞组分——进行精准关联,从而系统性地解析基因功能网络。这一过程不仅支撑了差异表达基因的功能富集分析,还广泛应用于跨物种基因功能比较与进化研究,为揭示生命活动的分子机制奠定了数据基础。
解决学术问题
该数据集有效解决了基因组时代面临的核心学术困境:如何统一描述并推理不同物种与实验条件下的基因功能信息。通过提供结构化、层级化的受控词汇表,GO数据集使研究者能够超越序列相似性的局限,在功能层面进行深度数据分析。它系统性地消解了术语歧义与数据异构性问题,推动了功能富集分析、基因集功能相似性度量及本体推理算法的成熟。这一标准化工具极大地促进了复杂疾病机制解析、基因调控网络重构以及系统生物学模型的构建,成为连接基因型与表型的关键桥梁。
衍生相关工作
基于GO数据集,学术界衍生了一系列具有深远影响的经典工作。其中,功能富集分析工具如DAVID、clusterProfiler和GSEA,均以GO术语为核心进行统计学评估,已成为转录组数据解读的标配方法。此外,GO语义相似性度量方法(如Resnik、Lin与Jiang-Conrath算法)的提出,推动了蛋白质功能预测网络与基因功能聚类分析的进步。近期,结合深度学习的模型如DeepGO与GOAtools,利用该数据集进行自动化功能预测,显著提升了未知蛋白的功能注释准确率。这些工作共同构筑了以GO为轴心的计算功能基因组学体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务