遇见数据集

LiteFold/ESMAtlas

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

ESMAtlas是ESM宏基因组图谱的Hugging Face镜像,这是一个大规模预测宏基因组蛋白质结构资源,使用Meta AI的ESMFold蛋白质语言模型生成。上游图谱包含来自MGnify蛋白质序列的超过7亿个预测结构;v2023_02版本对应MGnify 2023_02,并使用esm.pretrained.esmfold_v1()模型。该数据集适用于大规模蛋白质结构检索、基于结构的搜索、置信度过滤子集、表示学习,以及研究宏基因组蛋白质的结构多样性,这些蛋白质通常缺乏实验解析结构的覆盖。数据集以WebDataset tar分片形式存储压缩的PDB文件,按预测TM分数(ptm)和平均预测LDDT(plddt)分箱,方便用户选择性下载高置信度区域。包含的元数据文件支持过滤和查找,包括每个蛋白质的置信度分数、序列长度、片段标志、序列校验和、ESMFold版本、图谱版本和源序列数据库成员信息。

ESMAtlas is a Hugging Face mirror of the ESM Metagenomic Atlas, a large-scale resource of predicted metagenomic protein structures generated with Meta AIs ESMFold protein language model. The upstream Atlas contains more than 700 million predicted structures from MGnify protein sequences; the v2023_02 release corresponds to MGnify 2023_02 and uses esm.pretrained.esmfold_v1(). This dataset is useful for large-scale protein structure retrieval, structure-based search, confidence-filtered subsets, representation learning, and studying the structural diversity of metagenomic proteins that are often poorly covered by experimentally solved structures. The repository stores predicted structures as compressed PDB files inside WebDataset tar shards. Shards are grouped by predicted TM score (ptm) and average predicted LDDT (plddt) bins, so users can selectively download higher-confidence regions of the Atlas rather than the full collection. Metadata files are included separately for filtering and lookup, including per-protein confidence scores, sequence lengths, fragment flags, sequence checksums, ESMFold version, Atlas version, and source sequence database membership.

提供机构:
LiteFold
搜集汇总
数据集介绍
LiteFold/ESMAtlas 数据集图片
构建方式
ESMAtlas是基于Meta AI开发的ESMFold蛋白质语言模型,对MGnify数据库中超过7.7亿条宏基因组蛋白质序列进行大规模结构预测而形成的资源。数据集采用WebDataset格式,将预测结果以压缩的PDB文件形式存储于tar分片中,并根据预测的TM分数(ptm)和平均pLDDT置信度(plddt)进行分箱组织。数据集的v2023_02版本对应MGnify 2023_02发布,使用esmfold_v1模型,并额外提供元数据表格(Parquet和SQLite格式)以支持按置信度、序列长度等指标进行筛选与查找。
使用方法
鉴于数据集极为庞大,推荐采用流式加载方式。通过Hugging Face的datasets库,以streaming=True参数直接读取分片,并按需解压PDB记录。用户也可直接加载外部分离的元数据表格(Parquet格式),利用条件过滤快速获得高置信度结构子集。利用分片命名的命名规则,可精确下载特定置信度区间的数据,例如加载tm_.90_1_plddt_.90_1_*.tar.gz分片以获取极高置信度的结构,从而避免下载整个庞大数据集,显著提升使用效率。
背景与挑战
背景概述
在计算结构生物学的前沿,蛋白质语言模型与宏基因组学的交叉融合催生了前所未有的结构预测资源。ESMAtlas,即ESM宏基因组图谱,由Meta AI团队于2023年依托革命性的ESMFold模型构建而成,旨在将海量宏基因组序列转化为可解析的原子级蛋白质结构。该数据集以MGnify数据库为序列源,囊括了超过7.7亿条预测结构,突破了传统实验方法在覆盖度和通量上的局限。通过将语言模型对序列进化信息的深度理解与大规模折叠任务相结合,ESMAtlas不仅开创了宏基因组蛋白结构多样性的系统编目先河,更成为连接序列空间与结构宇宙的关键桥梁,对蛋白质功能注释、结构检索以及药物靶点发现等领域产生了深远影响。
当前挑战
ESMAtlas所面对的挑战首先在于领域内的根本困境:宏基因组蛋白序列中绝大多数缺乏实验解析的结构模板,序列片段化、功能模糊以及演化保守性低下等问题使得准确预测变得极为困难。此外,构建过程本身亦荆棘丛生——在超过7.7亿条蛋白质序列中执行大规模计算折叠,涉及超长序列(>1280残基)的处理策略、计算资源的高效调度以及预测质量的分级管控。为应对这些挑战,数据集引入了基于ptm和plddt置信度分数的分片设计,允许用户按需筛选高质量子集,但预测结构与真实实验结构之间的误差、片段与孤儿蛋白的异常几何特征,仍构成下游分析中必须审慎处理的难题。
常用场景
经典使用场景
在计算结构生物学领域,ESMAtlas作为迄今规模最大的宏基因组蛋白质结构预测资源,其经典使用场景在于大规模蛋白质结构检索与基于结构的相似性搜索。研究者可以借助该数据集的WebDataset分片格式,依据预测的TM-score(ptm)和平均pLDDT置信度分层筛选,高效获取高置信度子集。通过比对ESMFold预测的原子坐标,能够揭示宏基因组蛋白质中那些实验解析结构难以覆盖的折叠模式,为探索未知蛋白的结构空间提供前所未有的数据基础。
解决学术问题
该数据集解决了宏基因组蛋白质结构覆盖严重不足的学术难题。传统实验方法如X射线晶体学和冷冻电镜难以高通量解析环境样本中绝大多数蛋白质,而ESMAtlas凭借ESMFold语言模型,一次性预测超过7.7亿个蛋白结构,使研究者得以系统性地研究未培养微生物的蛋白质折叠多样性。它填补了从序列到结构映射的鸿沟,支撑起可信度筛选、结构聚类及进化关系推断等下游分析,极大推动了对暗蛋白组(dark proteome)的结构认知。
实际应用
在实际应用中,ESMAtlas为酶工程、药物靶点发现和合成生物学提供了高通量的结构候选池。工业界可利用置信度过滤后的高精度子集,快速锁定具有特定折叠特征的酶类,用于生物催化或代谢工程改造;制药领域则可通过结构比对识别潜在的药物结合位点,加速先导化合物发现。此外,该数据集嵌入的ESM-2表示向量和Foldseek索引文件,使得大规模结构相似性搜索在云环境中得以高效实现,降低了计算资源门槛。
数据集最近研究
最新研究方向
ESMAtlas作为大规模宏基因组蛋白质结构预测资源的代表,其最新研究聚焦于利用ESMFold语言模型生成的逾7亿个预测结构,推动蛋白质结构检索、基于结构的搜索、置信度过滤子集提取以及表征学习等前沿方向。这些预测结构填补了实验解析蛋白质在宏基因组多样性覆盖上的空白,尤其是在低同源性区域和孤儿蛋白中展现出独特价值。结合pLDDT和pTM置信度评分,研究者能够高效筛选高精度子集,从而在结构生物学和药物设计中加速探索进化尺度下的蛋白质空间多样性,对理解微生物群落的分子机制和设计新型生物催化剂具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务