遇见数据集

datasets

收藏
Hugging Face2026-07-07 更新2026-07-08 收录
官方服务:

资源简介:

该数据集是为UdonPred工具提供的、针对每个目标蛋白质的内在无序(intrinsic-disorder)预测数据集。数据集包含七个不同的配置(atlas、chezod、disprot、pdbflex、plddt、softdis、trizod),每个配置均划分为训练集(train)、验证集(validation)和测试集(test)。数据以JSONL格式(包含id、y、x_0字段)和FASTA格式提供,同时附带了预计算的蛋白质语言模型(per-pLM)嵌入文件,存储于H5格式中,可通过JSONL中的id进行索引。这些数据适用于蛋白质内在无序区域的预测任务,支持机器学习模型的训练和评估。

This dataset is an intrinsic-disorder prediction dataset for individual target proteins, specifically developed for the UdonPred tool. The dataset comprises seven distinct configurations: atlas, chezod, disprot, pdbflex, plddt, softdis, and trizod. Each configuration is partitioned into training, validation, and test subsets. The data are provided in both JSONL and FASTA formats, where JSONL files contain fields including id, y, and x_0. Pre-computed protein language model (per-pLM) embedding files stored in H5 format are also available, and can be indexed using the id field from the JSONL files. This dataset is applicable to the prediction of intrinsic disorder regions in proteins, and supports the training and evaluation of machine learning models.

创建时间:
2026-07-02
原始信息汇总
  • 数据集名称:UdonPred datasets
  • 用途:针对特定蛋白质的内在无序性预测,为UdonPred模型提供数据。
  • 数据格式:包含 train(训练集)、valid(验证集)、test(测试集)三个数据划分,数据以JSONL格式存储,每条记录包含 idyx_0 字段,并附带FASTA格式序列文件。
  • 数据集配置(8个)
    • atlas
      • 训练集:atlas/train.jsonl
      • 验证集:atlas/valid.jsonl
      • 测试集:atlas/test.jsonl
    • chezod
      • 训练集:chezod/train.jsonl
      • 验证集:chezod/valid.jsonl
      • 测试集:chezod/test.jsonl
    • disprot
      • 训练集:disprot/train.jsonl
      • 验证集:disprot/valid.jsonl
      • 测试集:disprot/test.jsonl
    • pdbflex
      • 训练集:pdbflex/train.jsonl
      • 验证集:pdbflex/valid.jsonl
      • 测试集:pdbflex/test.jsonl
    • plddt
      • 训练集:plddt/train.jsonl
      • 验证集:plddt/valid.jsonl
      • 测试集:plddt/test.jsonl
    • softdis
      • 训练集:softdis/train.jsonl
      • 验证集:softdis/valid.jsonl
      • 测试集:softdis/test.jsonl
    • trizod
      • 训练集:trizod/train.jsonl
      • 验证集:trizod/valid.jsonl
      • 测试集:trizod/test.jsonl
    • trizod2
      • 训练集:trizod2/train.jsonl
      • 验证集:trizod2/valid.jsonl
      • 测试集:trizod2/test.jsonl
  • 额外资源:每个目标蛋白质目录下包含预计算的蛋白质语言模型(pLM)嵌入,路径为 <target>/embeddings/<plm>/<split>.h5,通过JSONL中的 id 进行索引。
搜集汇总
数据集介绍
datasets 数据集图片
构建方式
UdonPred数据集专为蛋白质内在无序性预测任务设计,整合了来自atlas、chezod、disprot、pdbflex、plddt、softdis、trizod及trizod2八个不同来源的子数据集。每个子集均以JSONL格式存储,包含训练集、验证集和测试集三部分,每条记录由唯一标识符id、标签y及特征x_0构成。此外,还提供了对应的FASTA序列文件,并针对每个蛋白质预先计算了多种蛋白质语言模型(pLM)的嵌入表示,这些嵌入以HDF5格式存储于各子集下的embeddings目录中。
特点
该数据集的核心特点在于其多源异构性,覆盖了多个内在无序性蛋白质数据集,为模型提供了丰富的训练样本。数据格式统一且简洁,每条样本均包含必要的标识符、标签和特征,便于快速加载与处理。尤为突出的是,数据集附带了预计算的多种pLM嵌入,这能够极大简化特征提取流程,允许研究者直接基于高质量嵌入展开模型训练与评估,显著提升了研究效率。
使用方法
使用该数据集时,用户可通过HuggingFace的datasets库按配置名称(如'disprot')分别加载各子集。每个配置均自动划分train、validation和test三部分,可直接用于模型训练与验证。对于更深层次的研究,可利用预计算的pLM嵌入文件,按<目标>/embeddings/<pLM>/<划分>.h5的路径读取,以获取蛋白质序列的高维向量表示,进而用于构建更复杂的预测模型或进行特征分析。
背景与挑战
背景概述
蛋白质内在无序性(Intrinsic Disorder)是指蛋白质中某些区域在生理条件下缺乏稳定三维结构的特性,这一现象在信号转导、分子识别及疾病发生发展中扮演着关键角色。针对蛋白质无序区域的精准预测,已成为计算生物学与蛋白质组学领域的核心议题之一。UdonPred数据集由研究团队David Wagemann等人于近期构建,旨在为基于深度学习的蛋白质无序性预测模型提供标准化评测基准。该数据集整合了ATLAS、CheZOD、DisProt、PDBFlex、pLDDT、SoftDis、TRIZOD及TRIZOD2等多个子集,覆盖多样化的蛋白质序列与结构特征,显著推动了无序性预测研究从单一结构视角向多模态特征融合的范式转变。作为专门适配UdonPred框架的资源,该数据集通过提供预计算的蛋白质语言模型(pLM)嵌入表示,不仅提升了预测模型的泛化能力,还为相关领域研究者提供了可复现的公共测试平台,对内在无序性功能注释与疾病机制解析产生深远影响。
当前挑战
蛋白质内在无序性预测面临的首要挑战在于无序区域与有序区域在序列和结构上的高度相似性,使得传统基于物理化学属性的方法难以捕捉其动态本质。UdonPred数据集所解决的领域问题正是如何利用多源异构数据——如不同的实验和计算方法生成的标签及嵌入特征——来提升预测的准确性与鲁棒性。在数据集构建过程中,研究人员需克服显著的技术障碍:首先,不同子集(如DisProt的实验数据与pLDDT的计算预测)之间的标签偏差与尺度不一致,需要通过严格的标准化流程进行对齐;其次,为每个目标蛋白预计算来自多种蛋白质语言模型(pLM)的高维嵌入,带来了巨大的存储与计算开销,数据规模与维度爆炸对索引和检索效率构成严峻考验;最后,训练、验证与测试集的划分需避免序列同源性导致的信息泄漏,确保模型评估的公正性。这些挑战共同决定了无序性预测数据集设计的复杂性与创新高度。
常用场景
经典使用场景
UdonPred数据集在蛋白质固有无序区域(IDR)预测领域扮演着举足轻重的角色。该数据集整合了atlas、chezod、disprot、pdbflex、plddt、softdis、trizod及trizod2等多个来源的蛋白质靶标信息,为研究者提供了丰富且标准化的训练、验证与测试样本。其经典应用在于利用这些预处理好的蛋白质序列及其对应的无序标签,训练深度学习模型以精确识别蛋白质中缺乏稳定三维结构的区域,从而揭示无序区域在细胞信号传导、转录调控等生物过程中所蕴含的关键功能。
实际应用
在实际应用层面,UdonPred数据集支撑的预测模型在药物发现与疾病机理研究中展现广阔前景。例如,许多癌症相关蛋白如p53、BRCA1等均包含大量无序区域,这些区域往往是药物靶向的难点;利用基于该数据集训练的模型,研究人员能够更精准地预测这些蛋白的无序边界与功能位点,从而指导针对无序蛋白的小分子或蛋白降解靶向嵌合体(PROTAC)设计。此外,在合成生物学中,该数据集有助于设计具有可控无序特征的工程化蛋白,用于开发智能响应材料或生物传感器。
衍生相关工作
围绕UdonPred数据集,学术界涌现了一系列富有影响力的衍生工作。核心成果是同名软件UdonPred的提出,它基于该数据集训练了先进的深度学习架构,实现了跨靶标的高精度无序预测。随后,研究者利用该数据集探索了语言模型预训练表征(如pLM嵌入)对无序预测的增益效果,推动了融合蛋白质语言模型与无序区域预测的新范式。更有工作基于此数据集开展跨物种无序区域对比分析,揭示了无序区在进化中的保守性与适应性,拓展了人们对蛋白质无序组多样性的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务