遇见数据集

SaProtHub/DMS_RASH_HUMAN

收藏
Hugging Face2024-07-22 更新2024-07-22 收录
官方服务:

资源简介:

该数据集包含了人类RASH蛋白的单点突变及其对应的突变效应评分,这些数据来源于深度突变扫描实验。数据集分为训练集(2479个样本)、验证集(338个样本)和测试集(317个样本)。标签表示基于深度突变扫描实验的每个蛋白质的突变效应评分。

This dataset contains single site mutation of protein RASH_HUMAN and the corresponding mutation effect score from deep mutation scanning experiment. The dataset is split into training (2479 samples), validation (338 samples), and test sets (317 samples). The label means the mutation effect score of each protein based on deep mutation scanning experiment.

提供机构:
SaProtHub
原始信息汇总

数据集概述

基本信息

  • 名称: DMS_RASH_HUMAN
  • 别名: SaProtHub/DMS_RASH_HUMAN
  • 创建者: SaprotHub
  • 关键词: 1K - 10K, csv, Text, Datasets, pandas, Croissant, 🇺🇸 Region: US
  • URL: https://hf-mirror.com/datasets/SaProtHub/DMS_RASH_HUMAN

描述

该数据集包含人类蛋白质RASH_HUMAN的单点突变及其对应的深度突变扫描实验的突变效应分数。

数据集结构

  • 分布:

    • 类型: cr:FileObject

    • 名称: repo

    • 描述: HF Mirror git仓库。

    • 内容URL: https://hf-mirror.com/datasets/SaProtHub/DMS_RASH_HUMAN/tree/refs%2Fconvert%2Fparquet

    • 编码格式: git+https

    • 类型: cr:FileSet

    • 名称: parquet-files-for-config-default

    • 描述: 由HF Mirror转换的基础Parquet文件(参见:https://hf-mirror.com/docs/datasets-server/parquet)。

    • 包含于: repo

    • 编码格式: application/x-parquet

    • 包含: default//.parquet

  • 记录集:

    • 类型: cr:RecordSet

    • 名称: default

    • 描述: SaProtHub/DMS_RASH_HUMAN - default子集

      • 3个分割: train, validation, test
    • 字段:

      • 类型: cr:Field

      • 名称: default/Sequence

      • 描述: HF Mirror parquet文件中的Sequence列。

      • 数据类型: sc:Text

      • 来源: parquet-files-for-config-default

      • 类型: cr:Field

      • 名称: default/label

      • 描述: HF Mirror parquet文件中的label列。

      • 数据类型: sc:Float

      • 来源: parquet-files-for-config-default

      • 类型: cr:Field

      • 名称: default/stage

      • 描述: HF Mirror parquet文件中的stage列。

      • 数据类型: sc:Text

      • 来源: parquet-files-for-config-default

相关信息

  • 分割:

    • train: 2479
    • valid: 338
    • test: 317
  • 标签: 标签表示基于深度突变扫描实验的每个蛋白质的突变效应分数。

相关论文

数据集来自《Deep generative models of genetic variation capture the effects of mutations》。

符合标准

  • 标准: http://mlcommons.org/croissant/1.0
搜集汇总
数据集介绍
SaProtHub/DMS_RASH_HUMAN 数据集图片
构建方式
该数据集聚焦于人类蛋白质RASH_HUMAN的单点突变效应,源自深度突变扫描实验。构建时以氨基酸序列为蛋白质表示格式,系统性地引入单个位点突变,并通过实验测定每个突变体的效应分数。数据依据标准划分为训练集(2479样本)、验证集(338样本)和测试集(317样本),确保了模型评估的可靠性。标签值反映了相对于野生型(设为0)的适应度变化,取值范围从负无穷到正无穷,数值越大表示突变对蛋白质功能的提升越显著。
特点
数据集的核心特点在于其专注于单一蛋白质的全面突变景观,提供了高分辨率的突变效应量化数据。每个样本对应一个特定的单点突变,标签直接来源于实验而非计算预测,保证了生物学真实性。数据划分严格,支持有监督学习中的标准化评估流程。此外,标签采用连续值表示,能够捕捉突变效应的细微差异,适用于回归任务,为蛋白质工程和功能预测研究提供了宝贵资源。
使用方法
使用该数据集时,可将其加载为CSV格式,通过HuggingFace的datasets库直接读取。适用于训练回归模型以预测突变效应分数,输入为蛋白质序列编码(如独热编码或嵌入表示),输出为连续标签值。建议在训练前对标签进行标准化处理以提升模型收敛性。数据集的分割已预定义,可直接用于模型验证和测试,同时可结合相关文献中的深度生成模型方法进行基准测试或特征工程探索。
背景与挑战
背景概述
在蛋白质工程与功能基因组学领域,系统性解析单点突变对蛋白质适应度的影响是理解蛋白质结构与功能关系的核心课题。SaProtHub/DMS_RASH_HUMAN数据集聚焦于人类RAS蛋白(HRAS)的深度突变扫描实验,由相关研究团队基于高通量测序技术构建,发表于2018年的《Nature Methods》。该数据集通过大规模平行突变生成与功能筛选,量化了数千种单点氨基酸替换对RAS蛋白适应度的改变,为揭示致癌突变机制、药物靶点识别及蛋白质设计提供了关键基准资源。其影响力体现在推动深度学习模型对遗传变异效应的预测能力,成为评估计算工具在蛋白质功能预测领域性能的重要标准。
当前挑战
该数据集所解决的领域问题在于精准量化突变对蛋白质功能的非线性影响,传统实验方法难以在突变组合空间内高效获取连续适应度分数。构建过程中面临的核心挑战包括:高通量测序中的误差校正,需区分真实生物学信号与实验噪声;突变效应分数的归一化处理,因实验批次效应导致不同位点间分数可比性不足;以及稀疏突变覆盖度问题,尽管包含逾三千个样本,但相对RAS蛋白全长序列的潜在突变空间仍显不足,限制了模型对罕见突变效应的泛化能力。此外,标签分数从负无穷到正无穷的连续值范围,对回归模型的鲁棒性提出额外要求。
常用场景
经典使用场景
在蛋白质功能预测与突变效应评估领域,RASH_HUMAN单点突变数据集凭借其高通量深度突变扫描实验所得的效应评分,成为验证和训练计算模型预测突变对蛋白质适应度影响的经典基准。研究者常利用该数据集评估基于序列或结构的模型(如深度生成模型)在捕捉遗传变异功能后果方面的能力,通过比较预测分数与实验测得的突变效应分数,来量化模型对蛋白质功能扰动的理解精度。
解决学术问题
该数据集系统性地解决了单点突变对RASH_HUMAN蛋白功能影响定量评估的学术难题,提供了从负无穷到正无穷的连续效应分数,其中野生型对应零值,正值代表适应度提升。它使研究人员能够深入探究突变如何改变蛋白质的分子功能,并推动了从统计学到深度学习等多种方法在预测突变效应上的发展,为理解蛋白质序列-功能关系奠定了数据基础。
衍生相关工作
该数据集源自《Deep generative models of genetic variation capture the effects of mutations》这一经典工作,其开创性地将深度生成模型应用于突变效应预测。随后,该数据集被广泛用于后续研究,如开发基于蛋白质语言模型的突变评分方法、比较不同架构(如Transformer与CNN)在突变预测上的表现,以及作为评估零样本预测和微调策略的基准,推动了蛋白质工程和功能基因组学领域方法论的持续革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务