遇见数据集

Synthyra/vector_embeddings

收藏
Hugging Face2026-06-04 更新2026-06-14 收录
官方服务:

资源简介:

该数据集名为Protify向量基准嵌入,是一个预计算的蛋白质嵌入数据集。它存储了多种蛋白质语言模型(如ESM2、ProtBert、ANKH等)和对照组(如Random、OneHot-Protein)的池化蛋白质嵌入,以gzip压缩的PyTorch文件格式(.pth.gz)提供。这些嵌入是序列级别的,采用均值和方差池化方法生成,旨在为Protify向量基准测试提供即用型嵌入,避免重复在本地GPU上计算相同基准序列的嵌入,从而加速下游任务,如经典机器学习、向量搜索、最近邻分析、低样本基准测试和模型比较。数据集包含约30个模型文件,总大小约189.22 GiB,用户可通过Hugging Face Hub下载单个或全部文件。

Precomputed pooled protein embeddings for the Protify vector benchmark. This dataset stores ready-to-use .pth.gz embedding artifacts for a broad panel of protein language models and controls. It is intended for fast downstream benchmarking in Protify without repeatedly embedding the same benchmark sequences on local GPUs, supporting tasks such as classical ML, vector search, nearest-neighbor analysis, low-shot benchmarking, or model comparison. The dataset includes approximately 30 model files with a total size of about 189.22 GiB, available for download via Hugging Face Hub.

提供机构:
Synthyra
搜集汇总
数据集介绍
Synthyra/vector_embeddings 数据集图片
构建方式
在蛋白质语言模型研究中,序列级嵌入向量的高效复用对于低资源场景下的下游基准测试至关重要。Protify Vector Benchmark Embeddings数据集正是为此而生,它预先计算并存储了涵盖多种蛋白质语言模型及对照组的池化嵌入向量。每个嵌入文件均以gzip压缩的PyTorch张量格式保存,遵循'<MODEL>_False_mean_var.pth.gz'的命名规范,其中'False'标识其为序列级而非残基级嵌入,'mean_var'则代表均值与方差池化策略。用户可通过Hugging Face Hub的'hf_hub_download'函数或CLI工具按需下载单个或批量模型文件,避免了在本地GPU上重复嵌入相同序列的计算开销。
特点
该数据集的核心特色在于其广泛的模型覆盖与即用性。收录了从轻量级模型(如ESM2-8,2.39 GiB)至大规模模型(如DPLM-3B,15.60 GiB)的30种不同的嵌入集合,并包含Random、OneHot-Protein等负对照模型,为模型比较提供了完整基线。所有嵌入均采用统一的池化方案生成固定长度的向量表示,直接适用于经典机器学习、向量检索、最近邻分析及少样本基准测试等场景。数据集整体规模约189.22 GiB,但支持按需部分下载,兼顾了存储效率与灵活性。
使用方法
使用时,用户需安装PyTorch及'huggingface_hub'库。推荐通过'hf_hub_download'指定模型文件名进行单文件下载,或利用'hf'CLI的'--include'参数筛选所需嵌入。加载时需以gzip解压后调用'torch.load'将数据读入内存,每个文件返回一个字典,键为序列标识符,值为对应的嵌入张量。鉴于该数据集为人工制品仓库而非表格化数据集,应避免使用'datasets.load_dataset()',而采用Hugging Face Hub原生工具链。下载的嵌入文件可直接接入Protify基准测试工作流,作为模型缓存加速多任务评估过程。
背景与挑战
背景概述
蛋白质语言模型的快速演进为生物序列的功能预测和结构解析带来了革命性机遇,然而广泛部署模型时面临的重计算开销严重制约了高效基准测试的发展。为解决这一瓶颈,Synthyra团队于2024年前后推出了Protify Vector Benchmark Embeddings数据集,该数据集由机构研究者主导构建,核心使命在于为Protify向量基准提供预计算并池化的蛋白质嵌入向量。通过整合AMPLIFY、ANKH、DPLM、ESM2等30种主流蛋白质语言模型及对应的随机或OneHot负对照嵌入,该资源使得下游任务无需在本地GPU上反复执行序列嵌入推理,从根本上加速了经典机器学习、向量检索、近邻分析与少量样本基准测试等研究流程,成为蛋白质表征可重复性评估的重要基础设施。
当前挑战
该数据集应对的领域挑战主要源于蛋白质语言模型快速迭代带来的评估标准化难题:不同模型在序列长度、嵌入维度与计算消耗上差异显著,且缺乏统一的嵌入表示格式支撑公平比对。此外,构建过程中面临存储与分发方面的技术瓶颈——完整嵌入目录体积高达189.22 GiB,要求用户借助huggingface_hub或hf CLI进行选择性下载而非一次性拉取。同时,为确保基准的可信度,项目需精心设计包含AMPLIFY-120至ESM2-35等多尺度模型嵌入的异质集合,并纳入负对照以控制噪声影响,这进一步加大了数据治理与许可合规的复杂性。
常用场景
经典使用场景
在蛋白质语言模型蓬勃发展的今天,向量嵌入已成为连接序列空间与功能表型之间的关键桥梁。Protify Vector Benchmark Embeddings数据集汇集了涵盖ESM2、ANKH、DPLM、ProtT5等三十余种前沿蛋白质语言模型的预计算池化嵌入,为无需反复调用GPU进行特征提取的下游基准测试提供了开箱即用的便捷资源。研究人员可直接加载压缩的PyTorch张量,快速获得固定维度的蛋白质序列向量表示,进而无缝接入经典机器学习分类器、近邻搜索或小样本学习任务。该数据集通过统一的均值—方差池化策略确保了嵌入的格式一致性与可比性,特别适合用于系统评估不同PLM在功能预测、结构归类和同源检测等场景中的表征能力差异。
衍生相关工作
该数据集紧密衔接着Protify向量基准测试框架的演进,其嵌入产物已成为若干经典后续工作的基础材料。基于此数据集,研究者可重复并扩展关于蛋白语言模型表征质量的对比实验,例如验证均值—方差池化相对于注意力池化的鲁棒性,或者通过嵌入空间的可视化揭示不同模型在物理化学属性编码上的偏好。一些衍生工作聚焦于嵌入的迁移学习潜力,通过在该数据集提供的ESM2-3B和DPLM-3B等大模型嵌入上进行线性探测,评估预训练表征在二级结构预测和亚细胞定位任务中的适应能力。此外,随着GLM2-GAIA等新型架构的加入,该数据集持续催生关于模型规模、预训练语料与下游泛化之间关系的新发现,为设计更具普适性的新一代蛋白质语言模型提供了实证参考。
数据集最近研究
最新研究方向
在蛋白质语言模型领域,预计算嵌入向量的高效复用已成为加速下游任务评估的关键瓶颈。该数据集汇集了ESM2、ANKH、DPLM、ProtT5等主流蛋白质语言模型在统一基准上的池化嵌入表征,通过均值-方差聚合策略将可变长度的残基层级特征压缩为固定维度向量,为低样本学习、最近邻搜索及经典机器学习管道提供了即用型计算基础设施。这一资源有效规避了重复嵌入计算带来的显存与时间消耗,尤其有助于在笔记本电脑级算力上完成大规模模型家族的横向对比。伴随AlphaFold3与ESMFold等结构预测工具对序列表征质量要求的持续提升,该数据集有望推动蛋白质工程中嵌入标准化评估的浪潮,强化负控制(如随机向量与OneHot编码)在基准测试中的方法论地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务