遇见数据集

Awesome-Large-Biology-Models

收藏
github2026-03-30 更新2026-06-04 收录
官方服务:

资源简介:

该仓库是一个关于大型生物学模型的数据集合集,专注于收集、整理和索引与DNA、RNA、蛋白质、单细胞和生物文本等生物学领域相关的多个数据集资源,包括通用数据集和特定领域数据集,以支持大型生物学模型的研究和开发。

This repository is a curated collection of datasets for large biological models. It focuses on collecting, organizing, and indexing multiple dataset resources related to biological fields including DNA, RNA, proteins, single cells, biological text, etc., covering both general-purpose and domain-specific datasets to support the research and development of large biological models.

创建时间:
2023-10-01
原始信息汇总

Awesome Large Biology Models 数据集详情

概述

这是一个专注于生物学领域大模型的资源汇总仓库,涵盖DNA、RNA、蛋白质、单细胞和生物文本等多种生物数据类型的模型与数据集。仓库主要分为“模型与代码”和“数据集”两大部分,旨在为生物学研究人员和开发者提供结构化的资源索引。

模型与代码

DNA 模型

收录了10个DNA序列分析模型,发布时间从2021年至2023年:

模型名称 发表平台/时间 代码/资源
Enformer Nature Methods, 2021-10 代码
DNABERT Bioinformatics, 2021-02 代码
GenSLMs BioRxiv, 2022-10 -
Nucleotide Transformer BioRxiv, 2023-01 代码
DNABERT-2 Arxiv, 2023-06 代码
HyenaDNA Arxiv, 2023-06 代码
DNAGPT Arxiv, 2023-07 代码
EpiGePT BioRxiv, 2023-07 网站
Predicting RNA-seq coverage BioRxiv, 2023-09 -
ChromTransfer NAR Genomics, 2023-03 代码

RNA 模型

收录了7个RNA相关模型,发布时间从2022年至2023年,涵盖RNA结构预测、剪接预测、mRNA设计等任务:

  • RNA-FM (2022-08): 非编码RNA/UTR功能预测,代码
  • SpliceBERT (2023-02): 前体mRNA剪接预测,代码
  • UNI-RNA (2023-07): 通用RNA预训练模型
  • CodonBERT (2023-09): mRNA设计与优化
  • DRfold (2023-09): RNA结构预测,代码
  • An RNA foundation model (2023-09)
  • Design of prime-editing guide RNAs (2023-10)

蛋白质模型

收录了14个蛋白质模型,时间跨度从2022年至2023年,包括序列模型和结构模型:

  • ProtTrans (TPAMI, 2022-10): 序列模型,代码
  • ProtGPT2 (Nature Communications, 2022-07): 蛋白质设计
  • ProGen2 (Arxiv, 2022-06): 序列模型,代码
  • OntoProtein (ICLR, 2022-06): 基因本体嵌入,代码
  • AlphaFold-Multimer (BioRxiv, 2022-03): 蛋白质复合物结构预测,代码
  • xTrimoPGLM (Arxiv, 2022-07): 统一100B参数预训练模型
  • ESM (Science, 2023-03): 进化尺度蛋白质结构预测,代码
  • RFdiffusion (Nature, 2023-07): 蛋白质结构从头设计,代码
  • ESM-variants (Nature Genetics, 2023-08): 疾病变异效应预测,代码
  • AlphaMissense (Science, 2023-09): 错义变异效应预测,代码
  • Latent Diffusion Model (Arxiv, 2023-05)
  • Large language models generate functional protein sequences (Nature Biotechnology, 2023-01)
  • Large language models improve annotation of viral proteins (Preprint, 2023-05)
  • Exploring the Protein Sequence Space (CSH Perspectives, 2023-10)
  • Atom-by-atom protein generation (Arxiv, 2023-08)
  • SaLT&PepPr (Communications Biology, 2023-10)

单细胞模型

收录了4个单细胞分析模型:

  • scGPT (BioRxiv/Arxiv, 2023-04/09): 单细胞多组学基础模型,代码
  • scBERT (Nature Machine Intelligence, 2023-09): 细胞类型注释,代码
  • Revolutionizing Single Cell Analysis (Arxiv, 2023-04)

生物文本模型

收录了4个生物医学文本处理模型:

  • BioBERT (Bioinformatics, 2019-09): 生物医学文本挖掘,代码
  • BioGPT (Briefings in Bioinformatics, 2022-12): 生物医学文本生成与挖掘,代码
  • Large language models in biomedical NLP (Arxiv, 2022-05): 基准测试与基线,代码
  • GeneGPT (Preprint, 2023-05): 增强大语言模型访问生物信息,代码

数据集

通用数据集

6个主要生物数据库,涵盖DNA/RNA/蛋白质多种数据类型:

  • NCBI Database: 链接
  • Ensembl Database: 链接
  • UCSC Database: 链接
  • RCSB PDB Database: 蛋白质结构数据,链接
  • Uniprot Database: 蛋白质序列数据,链接
  • STRING Database: 蛋白质相互作用数据,链接

DNA 数据集

  • Genome Understanding Evaluation (GUE): 序列分类数据集,用于DNABERT-2模型基准测试,链接

RNA 数据集

  • Genotype-Tissue Expression (GTEx): 人类组织基因调控效应数据,链接
  • Master database of All possible RNA sequences (MARS): 所有可能RNA序列数据库,链接

蛋白质数据集

  • MGnify: 微生物组序列数据,链接
  • UniRef: UniProt参考聚类,链接
  • AlphaFoldDB: DeepMind AlphaFold产生的蛋白质结构数据,链接
  • SidechainNet: 全原子蛋白质结构数据集,链接
  • Colabfold DB: 蛋白质序列数据集,链接
  • Big Fantastic Dataset (BFD): 通用蛋白质数据集,链接

单细胞数据集

待补充(TBD)

生物文本数据集

待补充(TBD)

搜集汇总
数据集介绍
Awesome-Large-Biology-Models 数据集图片
构建方式
该数据集通过系统性地梳理和归纳生物学领域中的大规模预训练模型与相关数据集,构建了一个层次分明的知识索引体系。其构建过程首先将模型按生物分子类型划分为DNA、RNA、蛋白质、单细胞及生物文本五大模块,每个模块下收录了具有代表性的研究工作,并详细标注了论文标题、发表期刊、时间、代码链接及功能备注。同时,针对每一类模型,进一步整理了对应的公开数据集,涵盖通用数据库与专用基准测试集,形成了模型与数据相互关联的双层结构。这种组织方式使得研究者能够快速定位特定分子类型下的前沿模型与可用数据资源。
特点
该数据集最显著的特点在于其全面性与结构化。它横跨了从DNA序列建模到蛋白质结构预测、从单细胞分析到生物文本挖掘的多个前沿子领域,收录了包括DNABERT、HyenaDNA、AlphaFold、scGPT等在内的众多里程碑式模型。每个条目不仅提供了论文出处与代码仓库,还通过备注字段区分了模型的功能类型,如序列预测、结构生成或剪接分析。此外,数据集部分整合了NCBI、Ensembl等通用资源以及GUE、MARS等专用基准,形成了模型训练与评估的完整生态。这种精细化的分类与丰富的元信息,为用户提供了高效的知识导航。
使用方法
使用者可依据研究目标,首先在模型表格中按分子类型筛选相关条目,例如关注蛋白质结构预测的开发者可定位至Protein Models板块。随后,通过点击提供的GitHub或论文链接,即可获取模型的完整实现代码与详细文档。对于需要训练数据的任务,可在对应模块的Dataset表格中查找,如DNA任务可选用GUE基准进行模型评估。数据集条目中标注了数据格式与功能说明,便于直接下载或引用。此外,通用数据库如UniProt、PDB等提供了跨领域的背景数据支持,用户可根据Notes列的提示灵活组合使用,实现从模型选择到数据获取的一站式工作流。
背景与挑战
背景概述
随着深度学习技术在生物学领域的迅猛发展,大规模预训练模型已成为解析DNA、RNA、蛋白质及单细胞数据的重要工具。Awesome-Large-Biology-Models数据集由全球多家顶尖研究机构(如DeepMind、Facebook AI Research、清华大学等)于2021年至2023年间共同构建,旨在系统梳理并整合生物学领域的大规模预训练模型及其相关数据集。该数据集的核心研究问题聚焦于如何利用自监督学习和Transformer架构,从海量生物序列中提取具有普适性的特征表示,从而推动基因调控预测、蛋白质结构解析、细胞类型注释等关键任务的突破。自发布以来,该数据集已成为连接计算生物学与人工智能研究的桥梁,为领域内研究者提供了标准化的模型与数据资源,显著加速了生物信息学与机器学习交叉方向的发展。
当前挑战
该数据集所面临的挑战主要体现在两个层面。在领域问题层面,生物学数据的复杂性(如基因序列的非线性交互、蛋白质结构的动态变化)使得现有模型难以同时兼顾精度与泛化能力,尤其在跨物种迁移和多模态数据融合任务中表现欠佳。在构建过程层面,不同来源的数据(如NCBI、UniProt、AlphaFoldDB)存在格式异构、标注粒度不一及质量参差的问题,导致数据整合与标准化工作极为繁重;此外,大规模生物模型的计算开销与存储需求高昂,限制了资源受限研究团队的参与,且部分模型的可复现性因代码或数据未完全开源而受到制约。
常用场景
经典使用场景
Awesome-Large-Biology-Models数据集汇聚了涵盖DNA、RNA、蛋白质、单细胞及生物文本五大生物信息学核心领域的大规模预训练模型与配套数据集,为研究者提供了一个系统化、结构化的资源索引平台。其经典使用场景在于作为领域内模型选择的权威参考手册,帮助科研人员快速定位并复现如DNABERT、HyenaDNA、ESM、AlphaFold等前沿模型,从而高效开展基因组序列表征、蛋白质结构预测及单细胞转录组解析等下游任务。
衍生相关工作
该数据集的衍生工作主要体现为基于其索引模型所催生的二次创新与系统整合。例如,DNABERT-2提出的GUE基准测试被广泛用于评估不同DNA语言模型的泛化能力;RFdiffusion在蛋白结构生成领域的突破直接受益于对AlphaFold等基础模型的深入理解。同时,scBERT与GeneCompass等单细胞模型的涌现,推动了多模态生物数据融合分析范式的形成,进一步拓展了该资源库在跨物种基因调控机制研究中的学术影响力。
数据集最近研究
最新研究方向
随着深度学习在生命科学领域的渗透,大型生物学模型正以前所未有的方式重塑基因组学、蛋白质组学与单细胞分析的研究范式。当前,前沿研究方向聚焦于利用大规模预训练语言模型处理DNA、RNA与蛋白质序列,如DNABERT-2、HyenaDNA及Nucleotide Transformer等模型通过自监督学习捕获长程调控元件与进化约束,显著提升了基因表达预测与变异效应评估的精度。在蛋白质领域,AlphaMissense与ESM系列模型将结构预测与功能注释推向全蛋白质组尺度,而RFdiffusion等生成模型则开创了全新蛋白质设计的可能性。单细胞层面,scGPT与GeneCompass等跨物种基础模型正试图解码细胞异质性与基因调控网络,为精准医学与疾病机制探索提供系统性的计算框架。这些进展不仅加速了生物序列的功能理解,更催生了从序列到表型的端到端预测新范式,对药物发现、合成生物学与个性化治疗具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务