遇见数据集

DisProt

收藏
Hugging Face2026-05-22 更新2026-05-23 收录
官方服务:

资源简介:

DisProt蛋白质无序注释数据集是一个从DisProt JSONL源数据转换而来的蛋白质级别Parquet表格数据集。该数据集包含3,199个DisProt蛋白质条目,其中训练集2,875行,测试集324行,采用基于DisProt ID哈希值的确定性分割策略(sha256(disprot_id) % 10,桶0为测试集,桶1-9为训练集)。每个数据行代表一个DisProt蛋白质条目,包含21个关键字段:蛋白质标识符(disprot_id)、UniProt登录号(accession)、蛋白质名称(name)、生物体(organism)、NCBI分类ID、序列长度(length)、无序含量分数(disorder_content)、数据集标签、蛋白质序列(sequence)等。此外,数据集还提供13,396行经过整理的区域级元数据,包括无序区域、功能区域和转换区域的注释信息,可通过单独的metadata/regions.parquet文件访问。区域注释包含区域ID、起止位置、术语名称、证据代码、参考文献ID、交叉引用(如PDB ID)以及来自Pfam、Gene3D等数据库的特征信息。该数据集适用于蛋白质内在无序性研究、生物信息学分析、机器学习模型训练等任务,特别适合需要蛋白质无序区域注释的研究场景。

The DisProt protein disorder annotation dataset is a protein-level Parquet table dataset converted from DisProt JSONL source data. It contains 3,199 DisProt protein entries, with 2,875 rows in the training set and 324 rows in the test set, using a deterministic split strategy based on the hash value of DisProt IDs (sha256(disprot_id) % 10, where bucket 0 is the test set and buckets 1-9 are the training set). Each data row represents a DisProt protein entry and includes 21 key fields: protein identifier (disprot_id), UniProt accession number (accession), protein name (name), organism, NCBI taxonomy ID, sequence length (length), disorder content score (disorder_content), dataset label, protein sequence (sequence), etc. Additionally, the dataset provides 13,396 rows of curated region-level metadata, including annotations for disordered regions, functional regions, and transition regions, accessible via a separate metadata/regions.parquet file. Region annotations include region ID, start and end positions, term name, evidence codes, reference IDs, cross-references (e.g., PDB ID), and feature information from databases such as Pfam and Gene3D. This dataset is suitable for research on protein intrinsic disorder, bioinformatics analysis, machine learning model training, and other tasks, particularly for research scenarios requiring annotations of protein disordered regions.

创建时间:
2026-05-11
原始信息汇总

数据集概述

  • 名称:DisProt Protein Disorder Annotations
  • 许可协议:CC-BY-4.0
  • 数据集类型:蛋白质内在无序性注释数据集
  • 数据格式:Parquet

数据集规模

  • 蛋白质条目总数:3,199
  • 经过人工注释的区域行数:13,396

数据划分

划分方式基于 DisProt ID 的 SHA256 哈希值取模 10:

  • 哈希值桶 0 划分到测试集,桶 19 划分到训练集。
划分 行数
train 2,875
test 324
total 3,199

主要列字段说明

列名 描述
disprot_id DisProt 蛋白质标识符
accession UniProt 登录号
name 蛋白质名称
organism 物种名称
ncbi_taxon_id NCBI 分类编号
length 蛋白质序列长度
disorder_content 序列中标记为无序的比例
dataset_labels DisProt 数据集标签
sequence 蛋白质序列
region_count 人工注释区域的数量
region_ids 人工注释区域 ID
region_starts 区域起始位置
region_ends 区域结束位置
region_terms 区域术语名称
evidence_codes 区域证据代码
reference_ids 区域参考文献 ID
cross_refs 区域交叉引用(如 PDB ID)
feature_databases 特征来源数据库(如 Pfam、Gene3D)
feature_ids 特征 ID
gene_names 基因名称及同义词
split_bucket 由哈希值确定的划分桶

使用方法

  1. 加载所有划分: python from datasets import load_dataset ds = load_dataset("LiteFold/DisProt")

  2. 加载单一划分: python train = load_dataset("LiteFold/DisProt", split="train")

  3. 筛选高无序度蛋白质: python high_disorder = ds.filter(lambda row: row["disorder_content"] is not None and row["disorder_content"] >= 0.5)

  4. 加载区域级元数据: python import pandas as pd from huggingface_hub import hf_hub_download path = hf_hub_download(repo_id="LiteFold/DisProt", repo_type="dataset", filename="metadata/regions.parquet") regions = pd.read_parquet(path)

数据准备

数据集的 Parquet 文件由脚本 scripts/prepare_disprot_dataset.py 生成。

搜集汇总
数据集介绍
DisProt 数据集图片
构建方式
DisProt数据集是一个专注于蛋白质内在无序区域注释的专用资源,其构建基于从DisProt数据库原始JSONL源中系统化转化的流程。通过将源数据归一化为Parquet格式,每个蛋白质条目被整合为一行记录,同时保留了经过精心筛选的无序、功能及过渡区域注释信息作为元数据。数据集的划分采用确定性策略,依据DisProt标识符的SHA256哈希值模10的结果分配,其中哈希值为0的条目归入测试集,其余1至9则构成训练集,最终形成了2,875条训练样本与324条测试样本的稳定分布。
特点
该数据集的显著特点在于其蛋白质级别的综合视图与丰富的注释层次。每个条目包含UniProt登录号、蛋白名称、物种信息、序列长度及无序含量等关键属性,并关联了区域级的起始位置、终止位置、术语名称、证据代码及交叉引用(如PDB编号)。此外,数据集整合了来自Pfam、Gene3D等外部数据库的特征注释,提供了基因名称与同义词信息。无序含量字段直接量化了序列中被注释为无序区域的比例,为研究中识别高无序蛋白提供了便捷的筛选依据。
使用方法
使用DisProt数据集可通过HuggingFace Datasets库轻松加载,用户仅需执行`load_dataset("LiteFold/DisProt")`即可获取所有划分,或指定`split="train"`参数单独加载训练集。利用`filter`方法可基于无序含量等条件高效筛选蛋白质条目,例如提取无序含量不低于0.5的样本。区域级别的元数据存储为独立的Parquet文件,需通过`hf_hub_download`函数下载后使用Pandas读取,便于研究者深入分析每个蛋白质的精细注释结构。数据集已在示例代码中展示了从基础加载到高级过滤的完整操作流程。
背景与挑战
背景概述
内在无序蛋白质(IDPs)在生命科学领域的重要性日益凸显,这类缺乏稳定三维结构的蛋白质在信号转导、转录调控及疾病发生中扮演关键角色。DisProt数据集由国际多家研究机构协同构建,旨在系统收录实验验证的蛋白质无序区域及其功能注释。该数据集于2006年首次发布,历经多次更新迭代,现包含3199条蛋白质条目和13396个经过人工精选的区域注释,涵盖无序区域、功能位点及构象转变区域。作为无序蛋白质研究的权威资源,DisProt极大地推动了蛋白质结构-功能关系的理解,为生物信息学算法开发与疾病机制研究提供了坚实的数据基础。
当前挑战
DisProt数据集所解决的领域挑战在于内在无序区域的实验鉴定与功能解读长期受限于技术手段,传统结构生物学方法难以表征动态无序区,而该数据集通过整合核磁共振、X射线晶体学及生物物理实验证据,为无序蛋白质的系统研究开辟了新路径。构建过程中面临的挑战包括:人工注释标准难以统一,不同实验技术的证据等级差异需严格甄别;跨数据库整合如UniProt、PDB的异构数据时存在标识符映射与格式兼容问题;此外,蛋白质无序程度(disorder_content)的量化需平衡序列长度、功能区域分布与生物学意义,确保注释的准确性与可重复性。
常用场景
经典使用场景
在后基因组时代的蛋白质科学领域,内在无序蛋白(Intrinsically Disordered Proteins, IDPs)因其在细胞信号传导、转录调控及疾病机制中的核心作用而备受瞩目。DisProt数据集作为全球最权威的内在无序蛋白注释资源,其经典使用场景聚焦于蛋白质无序区域的系统鉴定与功能解析。研究人员常利用该数据集提取不同物种蛋白质序列中的无序区域位置、长度及理化属性,构建预测模型以识别新型IDPs。同时,通过分析区内带的注释标签如功能位点或过渡区域,可深入探究无序区域如何介导蛋白质-蛋白质相互作用及翻译后修饰。这种层级化的数据结构使得从单一无序片段到全蛋白无序含量的多尺度分析成为可能,为理解蛋白质构象动态与细胞功能复杂性奠定了数据基础。
实际应用
在生物医药与合成生物学实践中,DisProt数据集展现出广泛的应用价值。在药物发现领域,研发人员借助其详实无序区域注释,可准确界定IDPs中易与候选小分子结合的可药性位点,从而设计靶向蛋白-蛋白相互作用界面的新型抑制剂。在蛋白工程应用中,通过分析DisProt中记录的功能性无序区域与稳定蛋白质结构域的关系,工程师能够优化重组蛋白的溶解性与折叠效率,提升工业酶和抗体药物的生产稳定性。更进一步,该数据集还支持高通量预测管线的后端验证:将机器学习模型判定的无序区域与专家审编结果对比,迭代优化预测精度,已成功应用于人类蛋白质组范围的无序图谱绘制。
衍生相关工作
基于DisProt数据集的丰硕注释信息,学术界衍生出了一系列标志性工作。在计算生物学领域,IUPred2A、SPOT-Disorder等经典无序预测工具均以DisProt作为核心训练与评估基准,其模型性能的持续提升得益于该数据集不断扩增的审编条目。在功能基因组学层面,有研究团队利用DisProt内部的区域ID映射关系,构建了DisProt-PDB互操作平台,首次实现了无序区域与对应三维结构片段的联合可视化。此外,还有学者以数据集的顺序注释为核心,开发出发现全新蛋白质无序与折叠耦合模式的统计框架,并借此鉴定了数十种先前未被注释的、在转录因子中行使调节功能的短线性基序,这些衍生成果极大拓宽了人们对蛋白质构象景观的理解边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务