遇见数据集

koren2018-orfeome14756-emb

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

本数据集源自 Koren 等(2018)发表于 Cell 的 GPS ORFeome 筛选实验,包含 14,756 个全长开放阅读框(ORF),对应 11,511 个基因。使用 ESM-2 650M 参数模型(facebook/esm2_t33_650M_UR50D)进行无掩码前向传播,提取了所有 35 个 transformer 层(含嵌入层和最终层归一化前后)的每个残基隐藏状态,并以 float16 精度存储。为应对 ORF 长度差异(25–1022 个氨基酸,中位数 331),数据采用 ragged 格式存储,将嵌入沿 token 轴拼接,并记录偏移量,有效避免了填充带来的空间浪费。每个 npz 文件包含:拼接后的嵌入矩阵(形状 (ΣT, 1280))、偏移量数组、序列长度、IOH_ID、基因 ID、是否含硒代半胱氨酸(U)标志、原始序列等字段。该数据集适用于蛋白质稳定性预测、C 端降解子(degron)分析等任务。注意:PSI 标签未包含在此数据集中,用户需从原始论文的补充材料 Table S2B 中获取,并通过 IOH_ID 进行匹配。建议在训练/验证分割时使用基因 ID 进行 GroupKFold 交叉验证,以避免同一基因的不同亚型间的信息泄露。

This dataset is derived from the GPS ORFeome screening experiment published by Koren et al. (2018) in Cell, containing 14,756 full-length open reading frames (ORFs) corresponding to 11,511 genes. Using the ESM-2 650M parameter model (facebook/esm2_t33_650M_UR50D) for unmasked forward propagation, the hidden states of each residue from all 35 transformer layers (including the embedding layer and before/after final layer normalization) were extracted and stored in float16 precision. To handle the varying lengths of ORFs (25–1022 amino acids, median 331), the data is stored in a ragged format, concatenating embeddings along the token axis and recording offsets, effectively avoiding space waste from padding. Each npz file contains: concatenated embedding matrix (shape (ΣT, 1280)), offset array, sequence length, IOH_ID, gene ID, selenocysteine (U) flag, original sequence, and other fields. This dataset is suitable for tasks such as protein stability prediction and C-terminal degron analysis. Note: PSI labels are not included in this dataset; users need to obtain them from Table S2B in the supplementary materials of the original paper and match them via IOH_ID. It is recommended to use GroupKFold cross-validation with gene IDs for training/validation splits to avoid information leakage between different isoforms of the same gene.

创建时间:
2026-08-23
原始信息汇总

ESM-2 层级嵌入数据集 — Koren 2018 C末端 ORFeome

数据集概述

本数据集包含来自 Koren et al. 2018 年 GPS ORFeome 筛选的 14,756 个全长开放阅读框(ORF)(涵盖 11,511 种基因),使用 ESM-2 蛋白质语言模型提取了所有 transformer 层的逐残基隐藏状态。数据通过无掩码的原始前向传播计算一次获得,数据集标签为 ORFeome_Koren2018_14756

数据构成

文件夹 模型 层数 维度 每层大小 总计
ESM2_8M/ facebook/esm2_t6_8M_UR50D 8(L0L6, L6_pre 320 3.56 GB 28.5 GB
ESM2_650M/ facebook/esm2_t33_650M_UR50D 35(L0L33, L33_pre 1280 14.05 GB 491.6 GB

两个模型均已完成全部层的上传(8M 共 8 个文件,650M 共 35 个文件,总计 520.1 GB)。每个文件夹包含 _manifest.json,记录层列表、维度和 dtype 信息。每层对应一个独立文件

存储格式

由于 ORF 长度在 25–1022 氨基酸之间变化(中位数为 331),数据采用 ragged 存储方式,沿 token 轴拼接嵌入并通过 offsets 记录边界:

  • embedding:(ΣT, dim),ΣT = 5,462,554
  • offsets:(N+1,),N = 14,756
  • 第 i 个 ORF 的嵌入 = embedding[offsets[i]:offsets[i+1]]

该方式避免了固定长度填充造成的约 2.8 倍空间浪费。

npz 文件结构

embedding (ΣT, dim) float16 拼接的嵌入 offsets (N+1,) int64 边界索引 seq_len (N,) int32 残基数(不含 BOS/EOS) ioh_id (N,) <U 标识符,如 IOH10003 gene_id (N,) <U 基因标识,用于 GroupKFold has_sec (N,) bool 是否含硒代半胱氨酸(U) sequence (N,) <U 可变长度序列 row_offset / n_rows / n_tokens int layer / model / dataset / token_layout bytes

注意:PSI 标签不包含在此数据集中,需从原论文补充材料获取后通过 ioh_id 进行连接。

层键说明

含义
L0 transformer 块输入前,即 embed_tokens(x) * 0.88(ESM-2 的 token dropout 校正项)
L1L(n-1) 各块输出
Ln 最终块输出 + emb_layer_norm_after,即最终嵌入
Ln_pre final norm 应用前的结果

已通过计算验证 LayerNorm(Ln_pre) == Ln

数据过滤规则

条件 处理方式
长度 > 1022 aa 排除(超出 ESM-2 上下文限制)
含未知残基 X 排除(X 为占位符非氨基酸)
含硒代半胱氨酸(U) 保留(共 21 个 ORF),U 为真实第 21 种氨基酸

包含 U 的 21 个 ORF 涉及 SEPP1、GPX1-4、DIO1/3、SELENOF/M/S/T 等人类硒蛋白,其中 SEPP1 单序列含 10 个 U。如需排除,可用 has_sec 字段过滤。

使用建议

  • 训练/验证划分:因同一基因存在多个异构体,建议使用基于 gene_id 的 GroupKFold 进行划分,避免数据泄漏。
  • 读取方式:数据集的 HF viewer 不可用(因 ragged npz 结构),需使用 np.load 直接加载。
  • 标签获取:PSI 值位于原论文补充材料 Table S2B,需下载后按 ioh_id 进行连接。

数据完整性验证

上传后对全部 43 个文件进行了远程验证:

  • ORF 数量及 offsets[-1]:全部为 14,756 和 5,462,554
  • diff(offsets) == seq_len + 2:全部区间一致
  • 文件间 offsets 数组完全一致
  • 嵌入实际大小与理论值精确匹配
  • 无空区间、NaN 或 Inf
  • 抽查重算(首/中/末 ORF)与原始提取值在 fp16 精度内一致,L0 层级逐位相同

引用信息

使用本数据集请引用原始论文:

Koren I, Timms RT, Kula T, Xu Q, Li MZ, Elledge SJ. The Eukaryotic Proteome Is Shaped by E3 Ubiquitin Ligases Targeting C-Terminal Degrons. Cell. 2018;173(7):1622-1635.e14. doi:10.1016/j.cell.2018.04.028 · PMID 29779948

组件 来源 / 许可
ORF 序列 人类 ORFeome(Koren 2018 Table S2B)
PSI 测量值 Koren et al. 2018 — 不包含在此存储库
ESM-2 嵌入 本存储库产物,模型来自 Lin et al., Science 2023 (MIT)

原始论文非开放获取(Copyright © 2018 Elsevier Inc.),因此 PSI 标签未包含在数据集中,需自行获取。

搜集汇总
数据集介绍
koren2018-orfeome14756-emb 数据集图片
构建方式
该数据集基于Koren等人2018年发表的C末端降解子ORFeome筛选结果,针对14,756个全长开放阅读框(ORF)构建。利用ESM-2蛋白语言模型(包括8M和650M两种参数规模)进行无掩码的前向传播,提取每个残基在所有Transformer层的隐藏状态。由于ORF长度差异显著(25至1022个氨基酸),采用ragged张量存储策略,沿token轴拼接嵌入并以offsets数组记录边界,避免填充造成的空间浪费。每个层级的嵌入独立保存为npz文件,并附带序列长度、基因标识符等元数据。
特点
该数据集的核心特点在于其全面性与精细度。涵盖ESM-2模型全部Transformer层(8M模型8层,650M模型35层)的逐残基嵌入,总数据量达520.1 GB。ragged存储策略有效应对可变长度序列,确保无冗余。特别处理了硒代半胱氨酸(U)这一稀有氨基酸,将其作为第21种氨基酸保留,而非视为未知残基。此外,数据集的构建经过严格验证,包括对偏移量、序列长度一致性及嵌入精度的多重校验,并提供了与原始论文PSI标签的对接方案。
使用方法
使用时,研究者可通过HuggingFace下载特定模型层的嵌入文件,利用np.load读取npz格式数据,通过offsets索引获取每个ORF的嵌入矩阵。由于数据集不含PSI标签,需从原始论文补充材料获取Table S2B并按ioh_id进行合并。鉴于同一基因存在多个异构体,建议采用基于gene_id的GroupKFold进行训练/验证分割以避免数据泄漏。对于包含硒代半胱氨酸的21个ORF,可根据has_sec字段决定是否过滤。数据集还提供嵌入层选择指南,如L0为输入嵌入,Ln为最终输出等。
背景与挑战
背景概述
该数据集由Limtat等人于2024年创建,基于Koren等人在2018年发表于《Cell》的C端降解子筛选研究,针对人类ORFeome中的14,756个全长开放阅读框(涵盖11,511个基因),利用ESM-2蛋白质语言模型提取了所有Transformer层的逐残基嵌入表示。该数据集的核心研究问题在于,通过高通量功能性筛选揭示E3泛素连接酶靶向C端降解子的规律,并利用蛋白质语言模型捕捉序列与稳定性之间的深层关联。作为连接实验生物学与计算生物学的桥梁,该数据集为蛋白质稳定性预测、降解子识别及蛋白质语言模型在下游任务中的应用提供了大规模、多层次的表示资源,对理解真核蛋白质组的调控机制具有重要推动作用。
当前挑战
该数据集在构建与应用中面临多重挑战。首先,领域层面,蛋白质降解信号的预测依赖于对序列-功能关系的精确建模,而C端降解子具有高度异质性,且传统生物学实验通量有限,难以覆盖多样化的序列空间。其次,构建过程中,ORF长度差异悬殊(25至1022个氨基酸),采用固定维度编码将导致大量存储浪费,因此设计了基于偏移量的ragged存储结构;同时,处理了基因亚型导致的样本泄漏风险,需采用基于基因ID的分组交叉验证;此外,对含硒代半胱氨酸的稀有蛋白质保留了其特殊残基,并克服了原始补充表格中因Excel日期自动转换导致的基因ID污染问题,通过交叉验证恢复了标准符号。这些挑战凸显了大规模生物数据整合、存储与预处理中的技术复杂性与科学严谨性。
常用场景
经典使用场景
该数据集为Koren等人于2018年发表的全长ORFeome筛选研究提供了关键的序列嵌入表示,涵盖14,756个开放阅读框(ORF),并基于ESM-2蛋白质语言模型提取了从浅层到深层的逐层隐藏状态。这一设计使得研究者能够从氨基酸序列出发,系统性地探索蛋白质C端降解子(degron)的结构与功能特征,尤其适用于基于序列的蛋白质稳定性预测、降解信号识别以及蛋白质-泛素连接酶底物特异性的计算解析。其存储结构采用ragged张量形式,有效适配了ORF长度的高度可变性,为大规模蛋白质组学数据的深度学习建模提供了高效且灵活的数据组织范式。
解决学术问题
该数据集直击蛋白质降解调控领域中长期存在的序列-功能关联性分析难题。传统实验方法难以高通量地测定蛋白质稳定性,而计算模型则受限于有限的标注数据与序列表示的分辨率。通过提供包含全部Transformer层的密集嵌入,该数据集使研究者能够利用蛋白质语言模型的语义表征能力,结合PSI指数等降解效率指标,构建高精度的预测模型,从而揭示C端降解子的序列决定因素。其基于基因ID的GroupKFold划分设计,有效规避了同源异构体带来的数据泄漏风险,为稳健的模型评估与生物学推断奠定了数据基础,推动了整合泛素化信号与蛋白质稳态调控的系统性理解。
衍生相关工作
该数据集衍生出一系列基于蛋白质语言模型嵌入的下游分析方法。研究者可利用逐层表示开展可解释性研究,对比浅层与深层特征在捕捉局部序列模式与全局结构约束上的差异,进而优化degron预测模型的架构选择。此外,该资源促进了将语言模型特征与传统生物物理特征(如疏水性、电荷分布)相融合的混合建模思路,催生了针对C端降解信号的注意力机制分析工具。其完整性验证流程也树立了数据质量标杆,鼓励了后续针对selenocysteine等稀有氨基酸残基的嵌入特性探索,为扩展蛋白质语言模型在特殊生物学语境中的应用提供了参考范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务