遇见数据集

theislab/Embpy_Data

收藏
Hugging Face2026-06-01 更新2026-06-14 收录
官方服务:

资源简介:

该数据集包含由embpy打包的静态基因和蛋白质嵌入。嵌入值存储在Zarr数组中,而行标识符、来源、物种元数据以及类似AnnData的.uns元数据则存储在辅助元数据文件中。数据集涵盖多种嵌入类型,如CRISPR基因效应矩阵、Gene2Vec共表达嵌入、GenePT GPT-3.5文本嵌入等,主要针对人类物种(NCBI分类ID 9606),使用Ensembl ID作为默认基因标识符。它适用于生物学和基因组学研究,用于基因和蛋白质的表示学习。

This dataset contains static gene and protein embeddings packaged by embpy. The embedding values are stored in Zarr arrays, while row identifiers, provenance, species metadata, and AnnData-like .uns metadata are stored in auxiliary metadata files. The dataset includes multiple embedding types, such as CRISPR gene effect matrices, Gene2Vec co-expression embeddings, GenePT GPT-3.5 text embeddings, among others. It is primarily targeted at the human species (NCBI taxonomic ID 9606), with Ensembl IDs as the default gene identifiers. This dataset is suitable for biological and genomics research, and is employed for representation learning of genes and proteins.

提供机构:
theislab
搜集汇总
数据集介绍
theislab/Embpy_Data 数据集图片
构建方式
Embpy_Data数据集是专为生物学与基因组学领域设计的静态基因与蛋白质嵌入集合,由theislab团队基于embpy框架打包构建。该数据集的核心存储架构采用Zarr数组格式保存嵌入矩阵,同时通过侧车元数据文件记录行标识符、来源信息、物种元数据以及类似AnnData的.uns元数据。所有嵌入数据均按照统一的静态嵌入包模式(embpy.static_embedding_package.v1)组织,在构建过程中对来源集合进行了选择性筛选,仅保留明确指定物种或分类学ID的嵌入,从而确保数据的针对性与一致性。
特点
该数据集包含11个高质量的嵌入表示,覆盖基因与蛋白质两个层面,总计索引实体超过20万个。嵌入来源多样,涵盖CRISPR基因效应(DepMap)、共表达网络(Gene2Vec)、文本语义(GenePT、WikiCrow)、蛋白质相互作用(STRING)等多种生物学特征,维度从128至4096不等。所有嵌入均以人类(物种ID 9606)为对象,采用Ensembl ID作为默认基因标识符,并提供符号标识符的兼容查询。数据集还支持对缺失标识符的灵活处理策略,包括丢弃或填充NaN,以适应不同分析场景。
使用方法
用户可通过embpy库的HFHandler接口直接从HuggingFace下载所需嵌入,例如使用hf.download_embedding('crispr_gene_effect')获取矩阵与标识符列表。对于本地已下载或快照的数据包,可利用load_static_embedding_package函数加载,并通过store.get方法按实体ID或基因符号检索特定嵌入向量。在查询缺失标识符时,默认会引发异常,用户可根据需求设置missing参数为'drop'或'nan'以容忍部分缺失结果。此外,数据集提供本地验证脚本,确保打包数据的完整性后即可用于下游分析。
背景与挑战
背景概述
Embpy_Data数据集由Theislab团队于2026年创建,专注于整合人类(智人,NCBI分类号9606)的静态基因与蛋白质嵌入表示。该数据集涵盖了11种不同的嵌入模型,包括基于CRISPR基因效应、Gene2Vec共表达、GenePT文本嵌入、STRING蛋白质相互作用等功能性嵌入,总计索引超过20万个生物学实体。其核心研究问题在于为计算生物学提供统一、标准化的基因与蛋白质特征表示,以支持下游分析如基因功能预测、疾病机制解析及药物靶点发现。通过采用Zarr阵列存储嵌入值并附加详细的元数据,Embpy_Data推动了生物信息学中嵌入学习的可重复性和可访问性,对单细胞基因组学、系统生物学以及机器学习在基因组学中的应用产生了深远影响。
当前挑战
Embpy_Data数据集面临的挑战主要集中在多源异构嵌入的整合与生物学解释的复杂性上。所解决的领域问题是生物信息学中缺乏统一、可比的基因与蛋白质特征表示,不同嵌入来源如CRISPR效应、文本嵌入和蛋白质相互作用网络,其维度和语义差异显著,传统方法难以有效融合。构建过程中遇到的挑战包括:处理超过2000个文件的大规模数据筛选与验证,确保缺失标识符的合理处理策略(如丢弃或填充),以及维护物种特异性元数据的一致性和兼容性。此外,还需应对从多个上游资源获取嵌入时涉及的许可与归属问题,保障数据使用的合规性与可溯源性。
常用场景
经典使用场景
Embpy_Data数据集作为静态基因与蛋白质嵌入向量的标准化仓库,在计算生物学领域中扮演着基石角色。其最为经典的使用场景是作为大规模基因功能预测与蛋白质相互作用分析的输入特征表示。研究者可将DepMap CRISPR基因效应、Gene2Vec共表达嵌入或STRING蛋白质相互作用嵌入等多元表示,直接用于下游监督学习或无监督聚类任务中。通过该数据集提供的标准化索引与元数据,用户能够高效地将嵌入向量与基因或蛋白质标识符对齐,从而加速从基因组学到系统生物学跨学科研究的进程。
衍生相关工作
Embpy_Data的发布催生了若干围绕嵌入质量评估与迁移学习的后续研究。一方面,该数据集为检验不同嵌入在跨物种基因功能预测中的泛化能力提供了基准测试平台,推动了如Zero-shot基因注释等方法的创新。另一方面,基于该数据集的嵌入集成策略,研究者相继提出了多视图融合框架,用以整合CRISPR筛选与蛋白质互作嵌入信息来提升基因功能模块发现的鲁棒性。此外,该数据集的标准化打包格式已被多个开源工具采纳,促进了生物嵌入表示生态系统的健康发展。
数据集最近研究
最新研究方向
当前,Embpy_Data数据集在基因组学和蛋白质组学领域的前沿研究聚焦于将多种静态基因与蛋白质嵌入特征(如CRISPR基因效应矩阵、Gene2Vec共表达嵌入、GenePT文本嵌入及STRING功能相互作用图谱)整合为统一架构,以支持大规模、多模态的生物信息学分析。该数据集的发布与单细胞组学、精准医学及人工智能驱动的药物发现热点紧密相连,例如通过DepMap数据揭示癌症依赖基因,利用GenePT模型实现基因功能的自然语言表征,以及借助STRING网络推断蛋白质相互作用。其意义在于为研究人员提供标准化、可复用的嵌入资源,降低跨平台整合成本,推动基因功能预测、疾病机制解析及生物标志物发现的效率跃升,同时也为大规模生成式模型在生物学中的应用奠定了数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务