遇见数据集

RosettaCommons/MegaScale

收藏
Hugging Face2024-11-13 更新2024-12-14 收录
官方服务:

资源简介:

MegaScale数据集包含1,841,285个蛋白质折叠稳定性的实验测量数据,使用cDNA显示蛋白水解技术对自然和设计的蛋白质进行分析。数据集分为多个子集,包括高质量的单氨基酸变体和双突变体的折叠稳定性数据,涵盖了331个自然蛋白质和148个设计的蛋白质域。数据集还提供了ΔG和ΔΔG的估计值,用于分析蛋白质折叠的稳定性。

The MegaScale dataset contains 1,841,285 thermodynamic folding stability measurements using cDNA display proteolysis of natural and designed proteins. The main datasets include: - `dataset1`: Contains 1,841,285 stability measurements of all mutations in G0-G11. - `dataset2`: Contains 776,298 high-quality folding stability measurements, covering all single amino acid variants and selected double mutants of 331 natural and 148 de novo designed protein domains of 40-72 amino acids in length. - `dataset3`: Contains 325,132 ΔG measurements, suitable for estimating the ΔΔG of mutations. - `dataset3_single`: Single point mutations in `dataset3`, using the train/val/test splits defined in ThermoMPNN. - `dataset3_single_cv`: Single point mutations in `dataset3`, using cross-validation splits.

提供机构:
RosettaCommons
搜集汇总
数据集介绍
RosettaCommons/MegaScale 数据集图片
构建方式
蛋白质折叠稳定性是结构生物学与蛋白质设计领域的核心议题,其定量测量对于理解生命分子机制及指导人工蛋白创制具有基石意义。RosettaCommons/MegaScale数据集正是基于这一需求,通过cDNA展示蛋白酶解技术,对大量天然与设计蛋白质进行了超大规模的热力学折叠稳定性实验测定。该数据集系统性地涵盖了184万余次稳定性测量,其中77万余次高质量测量(dataset2)聚焦于331个天然与148个全新设计的蛋白结构域,这些结构域长度介于40至72个氨基酸之间,并包含了所有单氨基酸变异及选定的双突变体。通过设定野生型ΔG低于4.75 kcal/mol的阈值,进一步筛选出60万余次突变(dataset3)以用于ΔΔG的精确估算,构建了一个层次分明、质量可控的蛋白质稳定性数据体系。
特点
该数据集最显著的特点在于其无与伦比的规模与系统性,堪称当前蛋白质折叠稳定性研究领域的里程碑式资源。它不仅在数量上实现了百万量级的突破,更在覆盖面上实现了深度与广度的统一:涵盖了从天然蛋白到全新设计蛋白的多种结构域,并详尽记录了单点突变、双点突变乃至三位点残基网络的全部可能组合。数据集中包含的丰富元数据,如多种条件下的log10_K50值、自由能变化ΔG及其置信区间,以及基于机器学习的预测值(dG_ML, ddG_ML),为研究者提供了从原始实验数据到高级分析指标的完整链条。此外,数据集还提供了预定义的训练、验证和测试集划分(dataset3_single及交叉验证版本),极大便利了机器学习模型的开发与公平比较。
使用方法
用户可通过HuggingFace的datasets库便捷地加载与使用该数据集。首先需在命令行中安装datasets库,随后在Python环境中通过load_dataset函数指定数据集路径“RosettaCommons/MegaScale”及所需子集名称(如dataset3_single)进行加载。加载后的数据将以Datasets的Arrow格式呈现,支持高效的列式访问与操作。用户可直接访问特定列,如dataset3_single['train'].data.column('name');亦可将其转换为Pandas DataFrame以进行灵活的数据分析与可视化,或导出为Parquet格式以利持久化存储。对于需要交叉验证的研究,数据集还提供了dataset3_single_cv子集,其中包含了预划分的15个数据分片,可满足五折交叉验证的标准化流程需求。
背景与挑战
背景概述
蛋白质折叠稳定性是计算生物学与蛋白质工程领域的核心议题,其精准度量对于理解生命分子机制及推动人工智能驱动的蛋白质设计至关重要。2023年,由美国西北大学Rocklin实验室主导,联合Kotaro Tsuboyama、Justas Dauparas等多位研究人员,在《自然》期刊上发表了MegaScale数据集。该数据集基于cDNA展示与蛋白酶解技术,系统测量了超过184万条热力学折叠稳定性数据,覆盖331个天然蛋白质域和148个从头设计的蛋白质域,长度介于40至72个氨基酸之间。其核心研究问题在于构建一个大规模、高保真的蛋白质突变稳定性图谱,以弥合实验数据与计算预测之间的鸿沟。该数据集的问世,为AlphaFold等蛋白质结构预测模型以及ThermoMPNN等稳定性预测算法提供了前所未有的训练与验证资源,深刻推动了蛋白质工程与设计领域的发展。
当前挑战
MegaScale数据集所应对的核心挑战在于,蛋白质折叠稳定性研究长期受困于实验通量低、突变覆盖度不足及数据噪声高等瓶颈。传统方法难以在保持高精度的前提下,对数以万计的氨基酸突变进行系统性热力学表征,限制了机器学习模型在蛋白质稳定性预测中的泛化能力。在数据集构建过程中,研究者面临多重技术难题:如何通过cDNA展示技术实现高通量、高重复性的稳定性测量;如何从超过184万条原始测量数据中,筛选出776,298条高质量折叠稳定性记录,并确保突变类型覆盖单点、双重及三重残基网络;如何精确计算突变前后自由能变化(ΔΔG),特别是当野生型ΔG低于4.75 kcal/mol时的数据校准。这些挑战的克服,使MegaScale成为目前规模最大、质量最优的蛋白质折叠稳定性基准数据集之一。
常用场景
经典使用场景
在蛋白质工程与计算生物学领域,MegaScale数据集的核心应用在于为蛋白质折叠稳定性的预测模型提供大规模、高精度的训练与验证基准。该数据集囊括了超过184万次热力学稳定性测量,覆盖331个天然蛋白结构域与148个从头设计的蛋白结构域,系统记录了所有单氨基酸突变及选定双突变体的折叠自由能变化(ΔG与ΔΔG)。研究者可基于此数据训练深度学习模型,如用于预测突变对蛋白质稳定性影响的回归网络,或用于优化蛋白质设计算法的损失函数。其预设的训练/验证/测试划分(如dataset3_single)极大便利了模型性能的标准化评估,成为蛋白质稳定性预测领域不可或缺的黄金标准。
解决学术问题
该数据集直面蛋白质科学中长期存在的核心挑战:如何精准量化氨基酸突变对蛋白质折叠稳定性的影响。传统实验方法通量低且成本高昂,而计算预测常因缺乏大规模实验验证而可靠性不足。MegaScale通过cDNA展示与蛋白酶解技术,首次实现了对数百个蛋白结构域中数万突变位点的并行热力学表征,填补了从单点突变到协同突变效应系统性实验数据的空白。其揭示的突变效应分布规律,为解析蛋白质进化中稳定性约束的分子机制提供了关键证据,并推动了突变效应预测从定性走向定量,显著提升了计算设计蛋白质的热稳定性与功能活性。
衍生相关工作
MegaScale数据集催生了一系列里程碑式的方法学进展。其中,ThermoMPNN(Dieckhaus et al., 2024)直接基于该数据的训练/验证/测试划分,开发了用于预测突变后蛋白质热力学稳定性的图神经网络,在突变效应预测任务上达到了当时最优性能。ProteinGym等综合性基准也将其纳入评估体系,用以检验各类蛋白质语言模型对稳定性扰动的捕捉能力。此外,基于该数据训练的机器学习模型已被整合进蛋白质设计平台ProteinMPNN的后续版本,用于指导序列设计中的稳定性约束。这些衍生工作共同构建了一个从数据驱动到实验验证的完整闭环,极大加速了计算蛋白质设计的迭代周期。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务