遇见数据集

XaxiPiruli/protea-frozen-v226-2025-05-03

收藏
Hugging Face2026-05-07 更新2026-05-31 收录
官方服务:

资源简介:

PROTEA冻结数据包(v226版本,2025-05-03)是一个用于蛋白质功能预测的参考数据集,专门为LAFA(功能基准评估)提交设计。该数据集包含以下内容:1)参考蛋白质嵌入(来自ProtT5-XL模型的1024维嵌入);2)参考GO注释(5,902,876个GO注释,按规范登录号汇总);3)GO术语元数据(48,251个GO术语的ID、方面、名称等信息);4)PCA状态(用于查询PCA投影的均值和组件);5)Anc2Vec GO术语嵌入字典(2020-10版本);6)三个LightGBM重排序器模型(分别针对MFO、BPO、CCO方面)。数据集基于GOA UniProt v226版本(截止2025-05-03)和GO本体2026-01-23版本构建,参考蛋白质来自UniProt发布版2025_02的574,627个规范登录号。该数据集支持PROTEA方法,即基于KNN的蛋白质功能预测系统,通过LightGBM重排序器增强最近邻检索,用于预测蛋白质的基因本体(GO)功能。

license: MIT许可证 tags: - 蛋白质功能预测 - 蛋白质语言模型 - 基因本体论(Gene Ontology, GO) - LAFA - k近邻(KNN) - 重排序 size_categories: - 100K<n<1M pretty_name: PROTEA冻结捆绑包(v226,2025-05-03) # PROTEA冻结数据捆绑包 — `v226-2025-05-03` 本数据集为[PROTEA](https://github.com/frapercan/PROTEA)为[LAFA(蛋白质功能预测基准平台)](https://functionbench.net/lafa)提交所制作的冻结参考捆绑包,可与`ghcr.io/frapercan/protea/lafa:v0.7.0`推理容器配套使用。 ## 训练截断设置 - **GOA UniProt**版本`v226`,发布日期**2025-05-03**(为严格早于LAFA最早评估时间点2025-09-04的最新GOA发布版本)。 - **基因本体论(GO)**版本`2026-01-23`(为v226的GO术语超集;加载时无注释删减)。 - **参考蛋白质**取自PROTEA的UniProt缓存(共574,627个经典登录号,序列截断截止至UniProt版本`2025_02`)。 ## 捆绑包内容 | 文件 | 大小 | 描述 | |---|---|---| | `manifest.json` | 507 B | 截断版本、日期、源ID、行计数以及重排序器溯源信息 | | `reference_embeddings.parquet` | 1.1 GB | 来自ProtT5-XL的`(登录号, 1024维嵌入)`行数据 | | `reference_annotations.parquet` | 21 MB | 汇总至经典登录号的5,902,876条GO注释 | | `go_term_metadata.parquet` | 1.4 MB | 48,251条GO术语行数据,格式为`(GO术语ID, go_id, 本体域, 名称)` | | `pca_state.npz` | 70 KB | 用于查询PCA投影的均值(1024,) + 主成分矩阵(16, 1024) | | `anc2vec.npz` | 32 MB | Anc2Vec GO术语嵌入字典(2020-10发布) | | `reranker/F.txt` | 994 KB | 用于分子功能本体(Molecular Function Ontology, MFO)的轻量级梯度提升机(LightGBM)分类器(NK-MFO冠军模型) | | `reranker/P.txt` | 778 KB | 用于生物过程本体(Biological Process Ontology, BPO)的轻量级梯度提升机(LightGBM)分类器(NK-BPO冠军模型) | | `reranker/C.txt` | 994 KB | 用于细胞组分本体(Cellular Component Ontology, CCO)的轻量级梯度提升机(LightGBM)分类器(NK-CCO冠军模型) | | `reranker/routing.json` | 929 B | 按本体域的溯源信息与文件名映射 | ## 方法概述 PROTEA是一种基于k近邻(KNN)的蛋白质功能预测系统,通过逐本体域的轻量级梯度提升机(LightGBM)重排序器增强最近邻检索能力。针对每个查询蛋白质,其执行流程如下:(1) 计算单均值池化的ProtT5-XL嵌入;(2) 在该冻结参考库中检索Top-K最相似蛋白质;(3) 从这些近邻转移GO术语投票;(4) 为每个候选术语丰富“v6”特征族(包括Anc2Vec本体嵌入、近邻质心、查询PCA投影、可选分类器投票器);(5) 使用`reranker/<本体域>.txt`中提供的对应本体域专属轻量级梯度提升机分类器为每个候选项打分。 若某本体域无可用分类器,则候选项将回退至基于KNN距离的排序方式。 本版本的分类器为`v19-winners`家族中F1最大值最高的单层级专用模型(NK-MFO的test_fmax=0.453,NK-BPO=0.467,NK-CCO=0.485)。三者共享特征哈希值`feature_schema_sha=0d9b7219433f`。 ## 使用方法 bash # 1. 拉取推理镜像: docker pull ghcr.io/frapercan/protea/lafa:v0.7.0 # 2. 下载本数据集(单次快照版本): huggingface-cli download XaxiPiruli/protea-frozen-v226-2025-05-03 --repo-type dataset --local-dir /path/to/protea-frozen-v226-2025-05-03 # 3. 运行查询批处理(输入FASTA格式文件,输出TSV格式结果): docker run --rm -v /path/to/protea-frozen-v226-2025-05-03:/bundle -v $HOME/.cache/huggingface:/hf-cache -e HF_CACHE=/hf-cache -v $PWD/queries.fasta:/queries.fasta -v $PWD/predictions.tsv:/predictions.tsv ghcr.io/frapercan/protea/lafa:v0.7.0 --query_file /queries.fasta --frozen_data_dir /bundle --output_baseline /predictions.tsv --aspect_separated 输出为3列TSV格式:`<查询登录号> <go_id> <打分>`,其中打分规则为:对于有分类器覆盖的本体域,得分范围为`[0, 1]`,取自重排序器输出;否则得分等于`1 - 余弦距离`。 ## 按截断时间的版本更新 当LAFA将评估窗口扩展至`Mar_2026`之后,PROTEA可发布新的`protea-frozen-v<N>-<YYYY-MM-DD>`版本(针对新截断时间点重新运行GOA加载器与捆绑包导出脚本)。同一推理镜像(`ghcr.io/frapercan/protea/lafa`)可无需修改代码即可兼容新捆绑包;这使得LAFA可以在无需重构推理流程的前提下,测试训练数据新鲜度对模型性能的时效性影响。 ## 可复现性说明 - **推理容器**:`ghcr.io/frapercan/protea/lafa:v0.7.0`。源代码地址:<https://github.com/frapercan/PROTEA/tree/main/apps/lafa_container>。 - **推理库**:[`protea-method`](https://github.com/frapercan/protea-method)。所有KNN、特征增强与重排序打分代码均存放于此;推理容器仅为加载本捆绑包并调用`protea_method.pipeline.predict`的轻量级外壳。 - **捆绑包导出脚本**:[`scripts/export_lafa_bundle.py`](https://github.com/frapercan/PROTEA/blob/main/scripts/export_lafa_bundle.py)。 - **方法卡片**:[`apps/lafa_container/METHOD_CARD.md`](https://github.com/frapercan/PROTEA/blob/main/apps/lafa_container/METHOD_CARD.md)。 ## 溯源信息指针(manifest.json) json { "schema_version": "1", "cutoff_version": "v226", "cutoff_date": "2025-05-03", "embedding_config_id": "c0ae5b69-d6dc-41cf-a711-1739d3d2e170", "annotation_set_id": "5e1a7285-bb85-4816-88ab-2a32f7e96dd5", "ontology_snapshot_id": "35c3ad67-3002-47db-8f71-eeed69d22ad6", "n_refs": 574627, "n_annotations": 5902876, "n_go_terms": 48251, "embedding_dim": 1024, "feature_schema_sha": "0d9b7219433f", "reranker_routing": "per_aspect", "reranker_aspects": ["C", "F", "P"] } ## 作者 - **Francisco Miguel Pérez Canales** — PROTEA架构设计、KNN+v6特征流水线、LAFA推理容器开发。 - **联合博士生导师**:David Orellana-Martín(塞维利亚大学)、Ana M. Rojas(塞维利亚CABD中心)。 联系方式:`frapercan1@gmail.com`(主要联系方式)、`frapercan1@alum.us.es`(学术邮箱)。

提供机构:
XaxiPiruli
二维码
社区交流群
二维码
科研交流群
商业服务