遇见数据集

HumanProteinAtlas

收藏
Hugging Face2026-05-22 更新2026-05-23 收录
官方服务:

资源简介:

Human Protein Atlas Gene Annotations数据集是从Human Protein Atlas JSONL源数据转换而来的基因级Parquet表格,专为提升数据可读性和使用便利性而设计。该数据集以基因为核心单元,每行对应一个基因/蛋白质条目,总计包含20,162个基因记录,其中训练集18,138行,测试集2,024行,通过Ensembl ID的确定性哈希进行划分。数据集的核心特征包括25个关键字段,涵盖基因标识(如ensembl_id、gene、uniprot)、基因组位置(chromosome、position)、多源证据水平(evidence、hpa_evidence、uniprot_evidence、nextprot_evidence)、功能注释(protein_classes、biological_processes、molecular_functions)、亚细胞定位(subcellular_main_locations、subcellular_additional_locations)、分泌组信息(secretome_locations、secretome_functions)、RNA表达特征(rna_tissue_specificity、rna_tissue_distribution)以及癌症预后关联(prognostic_cancer_count、prognostic_cancers等)。此外,数据集还提供两个独立的元数据表:癌症预后元数据(442,504行)和RNA表达测量数据(149,150行),可通过特定接口加载。该数据集适用于生物信息学、蛋白质组学、基因功能注释、亚细胞定位预测、癌症生物标志物发现等研究任务,为研究人员提供了结构化的基因级注释信息。

创建时间:
2026-05-11
原始信息汇总

数据集概述:Human Protein Atlas Gene Annotations

  • 数据集名称: Human Protein Atlas Gene Annotations
  • 许可证: 其他(other)
  • 领域: 生物学、蛋白质、人类、基因表达、亚细胞定位
  • 数据格式: Parquet

数据集规模与划分

划分 行数
训练集 (train) 18,138
测试集 (test) 2,024
总计 20,162
  • 划分方法: 基于 Ensembl ID 的确定性哈希(sha256(ensembl_id) % 10),哈希值 0 为测试集,1-9 为训练集。

数据集统计

字段
基因行数 20,162
癌症预后元数据行数 442,504
RNA 表达测量行数 149,150

主要列说明

列名 说明
ensembl_id Ensembl 基因 ID
gene 基因符号
gene_description 基因/蛋白质描述
uniprot UniProt 登录号(如可用)
chromosome 染色体
position 基因组位置字符串
evidence 主要 HPA 证据水平
hpa_evidence HPA 特有证据水平
uniprot_evidence UniProt 证据水平
nextprot_evidence neXtProt 证据水平
antibodies HPA 抗体 ID
gene_synonyms 基因同义词
protein_classes 蛋白质类别标签
biological_processes 生物过程注释
molecular_functions 分子功能注释
disease_involvement 疾病关联标签
subcellular_main_locations 主要亚细胞定位
subcellular_additional_locations 额外亚细胞定位
secretome_locations 分泌组定位注释
secretome_functions 分泌组功能注释
rna_tissue_specificity RNA 组织特异性类别
rna_tissue_distribution RNA 组织分布类别
prognostic_cancer_count 基因在该癌症中具有预后意义的癌症数量
validated_prognostic_cancer_count 已验证的预后癌症条目数量
potential_prognostic_cancer_count 潜在的预后癌症条目数量
prognostic_cancers 具有预后条目的癌症名称
split_bucket 基于 sha256(ensembl_id) % 10 的确定性划分桶

访问与使用方式

  • 加载数据集: 使用 datasets 库,通过 load_dataset("LiteFold/HumanProteinAtlas") 加载所有划分,或指定 split 参数加载特定划分。
  • 过滤示例: 可对数据行进行过滤,例如筛选具有蛋白质水平证据的基因(evidence == "Evidence at protein level")。
  • 元数据表加载: 可通过 huggingface_hub 库直接下载癌症预后元数据(metadata/cancer_prognostics.parquet)和 RNA 表达测量元数据(metadata/rna_expression_measurements.parquet)。

数据准备

  • 用于创建 Parquet 文件的标准化脚本位于 scripts/prepare_hpa_dataset.py
搜集汇总
数据集介绍
HumanProteinAtlas 数据集图片
构建方式
HumanProteinAtlas数据集源自人类蛋白质图谱(Human Protein Atlas)项目,通过对原始JSONL格式的基因注释数据进行规范化处理而构建。处理脚本将每一条基因/蛋白质条目转换为易于读取的Parquet表格格式,并依据Ensembl ID的SHA256哈希值对数据集进行确定性划分,其中哈希值末位为0的归入测试集,其余1至9的归入训练集,最终形成包含20,162条基因记录、442,504行癌症预后元数据以及149,150行RNA表达测量值的结构化资源。
使用方法
用户可通过HuggingFace的datasets库便捷加载完整数据集或指定划分,例如使用load_dataset('LiteFold/HumanProteinAtlas')获取训练与测试集。支持基于证据等级等条件的筛选操作,如通过filter方法提取蛋白质水平证据的基因。此外,可利用huggingface_hub库直接下载元数据Parquet文件,结合Pandas进行深度分析,从而灵活整合基因注释、癌症预后及RNA表达信息。
背景与挑战
背景概述
人类蛋白质图谱(Human Protein Atlas, HPA)项目自2003年启动以来,由瑞典皇家理工学院等机构主导,旨在系统性地绘制人体蛋白质在细胞、组织和器官中的空间分布图谱。该数据集基于HPA的基因注释信息,整合了亚细胞定位、RNA表达、癌症预后等多维度数据,为蛋白质组学与精准医学研究提供了关键资源。通过将HPA原始JSONL数据转换为高效Parquet格式,并引入基于Ensembl ID的确定性数据划分策略,该数据集显著提升了大规模基因表达分析的可复现性与计算效率。其对基因注释的标准化处理,使得研究人员能够灵活筛选蛋白水平证据充分的条目,并关联癌症预后与RNA表达元数据,从而推动疾病机制探索与生物标志物发现。
当前挑战
该数据集面临的核心挑战在于处理蛋白质组学数据的复杂异质性与生物噪声。首先,亚细胞定位注释依赖免疫组化实验,抗体特异性和组织差异常导致多标签冲突,亟需跨数据库证据整合与共识算法优化。其次,构建过程中需应对20,162个基因条目与442,504条癌症预后元数据的关系映射,Ensembl ID的哈希划分虽保证训练-测试集分离的确定性,但无法规避罕见基因类别不平衡问题。此外,HPA证据等级(如蛋白水平证据与转录组证据)的差异性要求模型具备不确定性感知能力,而元数据表的独立存储格式又增加了多模态特征融合的复杂度,对高效检索与批次校正提出更高要求。
常用场景
经典使用场景
HumanProteinAtlas数据集为蛋白质组学与基因组学的交叉研究提供了高维度的基因注释资源。在经典的生物信息学任务中,研究者常借助该数据集开展全基因组范围内的蛋白质亚细胞定位预测,通过整合基因表达、蛋白质证据等级与亚细胞位置标签,训练深度学习模型以推断未知蛋白的功能居所。此外,该数据集中包含的RNA组织特异性与组织分布类别,使得基因表达模式的跨组织对比分析成为可能,为理解组织特异性调控机制奠定了基础。
解决学术问题
该数据集显著推动了蛋白质证据层级与疾病关联性的量化解析,解决了长期以来蛋白质组学研究中面临的注释不全与异质性问题。通过提供标准化的证据分级体系(如HPA证据、UniProt证据、neXtProt证据),研究者得以系统评估蛋白质存在的可靠性,并在此基础上挖掘疾病预后基因。附带的442,504条癌症预后元数据与149,150条RNA表达测量记录,使得基因表达与癌症生存的关联分析得以大规模开展,为精准医学中的生物标志物发现提供了数据驱动的方法论支持。
实际应用
在实际应用层面,HumanProteinAtlas数据集已成为药物靶点发现与验证的重要参考资源。制药企业及研究机构利用其包含的分泌组定位与功能注释,筛选具备细胞外或膜定位特征的潜在治疗靶标,从而加速抗体药物与CAR-T疗法的研发进程。同时,该数据集整合的抗体标识符与基因描述信息,为免疫组化实验的抗体选择与验证提供了系统化的导航工具,降低了实验重复性与资源浪费。
数据集最近研究
最新研究方向
在人类蛋白质组学研究领域,HumanProteinAtlas数据集正被广泛用于亚细胞定位预测与癌症预后标志物挖掘的前沿探索。当前,单细胞蛋白质组学与空间转录组学的交叉融合成为热点,该数据集凭借其涵盖20,162个基因的精细注释,特别是包含442,504条癌症预后元数据与149,150条RNA表达测量数据,为深度学习模型提供了丰富的训练语料。研究者借助其多模态特征(如证据等级、亚细胞定位、癌症关联性),致力于开发能够精准推断蛋白质动态分布与疾病分子机制的新型算法,从而推动精准医学与个性化诊疗策略的革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务