遇见数据集

keratin-pdb

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

该数据集名为“Human Keratin AlphaFold PDB Structures”,是一个经过系统整理的人类角蛋白蛋白质结构数据集。它基于AlphaFold2/AlphaFold数据库的预测结果,专门收录了51种人类角蛋白的单体三维结构记录,用于支持角蛋白展开力学研究。数据集包含完整的原始PDB坐标文本,并解析提取了丰富的结构元数据,如标题、化合物信息(COMPND)、来源(SOURCE)、数据库引用(DBREF)和序列残基(SEQRES)等注释字段。此外,它还提供了链、残基、原子、元素和坐标的统计摘要。关键特性包括从PDB文件的B因子列解析的每残基pLDDT置信度值,并报告了C-α原子和全原子的pLDDT汇总统计(如平均值、标准差)以及置信度区间计数。数据规模方面,所有蛋白质均来源于智人(NCBI分类ID:9606),包含25个I型角蛋白和26个II型角蛋白,蛋白质序列长度范围为394至644个氨基酸,中位长度为493个氨基酸。数据集还标注了已知的源序列差异标志(如KRT17、KRT26、KRT34)。每条记录关联了UniProtKB和AlphaFold数据库的链接,并包含文件大小、路径、修改时间和SHA-256校验等信息。数据集适用于计算结构生物学、分子动力学模拟(如作为平衡和牵引分子动力学模拟的起始模型)、蛋白质结构分析、生物信息学以及角蛋白相关的生物力学研究。数据基于CC BY 4.0许可,使用者需在后续工作中适当引用UniProt、AlphaFold数据库及相关研究手稿。

The dataset is named "Human Keratin AlphaFold PDB Structures", which is a systematically curated dataset of human keratin protein structures. Based on the prediction results from AlphaFold2/AlphaFold Database, it specifically collects 51 monomeric 3D structure records of human keratins to support research on keratin unfolding mechanics. The dataset contains complete raw PDB coordinate text, and has parsed and extracted rich structural metadata, including annotation fields such as title, compound information (COMPND), source (SOURCE), database reference (DBREF), and sequence residues (SEQRES). In addition, it provides statistical summaries of chains, residues, atoms, elements, and coordinates. Its key features include per-residue pLDDT confidence values parsed from the B-factor column of PDB files, as well as reported aggregated statistics (e.g., mean, standard deviation) and confidence interval counts for both C-α atoms and all atoms. In terms of data scale, all proteins are sourced from Homo sapiens (NCBI taxonomy ID: 9606), including 25 type I keratins and 26 type II keratins. The lengths of the protein sequences range from 394 to 644 amino acids, with a median length of 493 amino acids. The dataset also annotates known source sequence variation markers (e.g., KRT17, KRT26, KRT34). Each record is linked to UniProtKB and AlphaFold Database, and includes information such as file size, path, modification time, and SHA-256 checksum. This dataset is applicable to computational structural biology, molecular dynamics simulations (e.g., as starting models for equilibrium and pulling molecular dynamics simulations), protein structure analysis, bioinformatics, and keratin-related biomechanics research. The dataset is released under the CC BY 4.0 license, and users are required to appropriately cite UniProt, AlphaFold Database, and related research manuscripts in subsequent work.

创建时间:
2026-06-05
原始信息汇总

数据集概述:Human Keratin AlphaFold PDB Structures

基本信息

  • 仓库地址lamm-mit/keratin-pdb
  • 许可证:CC-BY-4.0
  • 语言:英语
  • 数据集规模:少于1000条记录
  • 标签:生物学、蛋白质、角蛋白、PDB、AlphaFold、结构、人类

数据集内容

  • 记录数量:51条
  • 生物体:智人(Homo sapiens,NCBI分类ID:txid9606)
  • 角蛋白类型分布
    • I型角蛋白:25条
    • II型角蛋白:26条
  • 序列长度范围:394至644个氨基酸
  • 中位数序列长度:493个氨基酸
  • 标记为存在序列字符串差异的记录:KRT17、KRT26、KRT34
  • 标记为存在序列长度字段/字符串差异的记录:KRT17、KRT26
  • 生成时间:2026-06-05T15:18:17.880019+00:00

数据字段

每一条记录包含以下字段:

  • 记录ID/基因符号
  • UniProt和AlphaFold的URL
  • NCBI分类单元和生物体名称
  • 角蛋白类型
  • 原始PDB文本
  • 元数据:标题、COMPND、SOURCE、DBREF、SEQRES
  • 链、残基、原子、元素和坐标摘要
  • CA/全原子pLDDT汇总统计和置信带
  • 文件大小、路径、修改时间和SHA-256哈希值

数据集生成

  • 结构来源于AlphaFold2/AlphaFold数据库对51种精选人类角蛋白蛋白质的单体预测。
  • 用于角蛋白解折叠力学研究的配套分子动力学模拟,作为起始分子模型。
  • 每条PDB记录被解析以保留原始坐标文本,并暴露可搜索的结构元数据。
  • 对于AlphaFold风格的PDB文件,每个残基的pLDDT值编码在B-factor列中,报告了Cα和全原子pLDDT统计及置信带计数。

来源与归属

  • 序列记录链接至UniProtKB,结构记录链接至AlphaFold数据库条目。
  • UniProt数据库的版权部分采用CC BY 4.0许可,AlphaFold数据库的数据亦采用CC BY 4.0许可,可用于学术和商业用途。
  • 用户应适当地引用UniProt、AlphaFold数据库以及配套的角蛋白解折叠力学研究手稿。

验证说明

  • 上传工作流检查:唯一记录标识符、预期的I型/II型覆盖、模拟输出的预期速度组、序列长度、力向量长度以及内部PDB残基/SEQRES一致性。
  • 每条记录的布尔字段保留已知的来源序列差异标志,而非静默覆盖。
搜集汇总
数据集介绍
keratin-pdb 数据集图片
构建方式
本数据集基于AlphaFold2数据库,系统性地收集了人类角蛋白家族中51个代表性蛋白的单体结构预测结果。每个结构记录均以PDB格式原始文本保存,并通过自动化解析流程提取了包括标题、COMPND、SOURCE、DBREF、SEQRES等在内的元数据字段。数据构建过程还特别关注链段、残基、原子与元素的统计分析,并利用B因子列信息解析出AlphaFold风格的pLDDT置信度评分,进而生成Cα与全原子层面的置信度统计。为保证数据质量,上传流程执行了多重校验,包括记录唯一性、角蛋白类型分布、序列长度一致性以及PDB残基与SEQRES对齐等检查。
使用方法
该数据集适用于蛋白质结构分析与计算模拟相关研究。使用者可直接加载PDB格式文本进行分子可视化,或利用元数据字段(如链标识符、残基计数、pLDDT统计)进行批量筛选与比较。对于分子动力学模拟,所有结构均经过AlphaFold2预测且已解析出置信度信息,可作为下游弛豫与拉伸模拟的初始模型。数据引用时需注明UniProt、AlphaFold数据库及伴随的角蛋白解折叠力学研究论文,以遵循CC BY 4.0许可协议。建议通过HuggingFace Datasets库加载,或直接下载JSON格式记录进行程序化处理。
背景与挑战
背景概述
人类角蛋白(Keratin)作为中间丝蛋白家族的核心成员,在维持细胞机械完整性及组织结构中扮演关键角色,其结构异常与多种皮肤疾病及肿瘤发生密切相关。2026年,麻省理工学院(MIT)计算生物学研究团队基于AlphaFold2数据库构建了名为“keratin-pdb”的专门数据集,收录了51个源自人类(Homo sapiens)的角蛋白AlphaFold预测结构,涵盖I型(25个)和II型(26个)角蛋白亚型。该数据集不仅提供了经严格校验的原始PDB坐标文本,还集成了UniProt序列注释、链/残基/原子统计摘要及基于B因子列解析的pLDDT置信度信息,旨在为角蛋白去折叠力学机制的分子动力学模拟研究提供高保真度的初始结构模型。其研究核心在于系统性地将深度学习预测的结构与经典生物物理学方法相衔接,推动了蛋白质结构数据在机械生物学领域的深度应用。
当前挑战
该数据集所应对的核心领域挑战在于深度学习预测的蛋白质结构(如AlphaFold模型)虽在整体折叠准确性上表现卓越,但其局部构象的动力学可靠性及机械力学响应特征尚未经过充分验证,尤其是针对角蛋白这类具有高度延展性和动态自组装特性的结构蛋白,如何从静态预测模型中提取有效的力学模拟初始构象成为关键难题。在数据集构建过程中,面临的挑战包括:确保51个角蛋白结构在序列与PDB文件中残基编号及序列字符串的一致性(已标记KRT17、KRT26、KRT34等存在差异的记录);从AlphaFold标准PDB文件的B因子列准确解析并统计每一位点的pLDDT值,以生成各原子与Cα的置信度频带分布;以及协调来自UniProt和AlphaFold Database的异构元数据资源,在保持跨数据库追踪能力的同时消除序列来源的歧义性。
常用场景
经典使用场景
该数据集聚焦于人类角蛋白家族的AlphaFold预测结构,收录了51条经过人工筛选与验证的PDB格式记录。研究者常将其用作起始三维构象,开展角蛋白单分子力学特性的解析工作。通过调用结构中的pLDDT置信度评分,可精确评估各残基区域的预测可靠性,为后续的分子动力学模拟提供高质量的初始坐标。在力学生物学与结构生物信息学交叉领域,该数据集为探索角蛋白纤维在机械应力下的形变与重构机制奠定了坚实的结构基础。
解决学术问题
长期以来,由于角蛋白纤维难以通过实验手段获得高分辨率晶体结构,其力学响应的分子机制始终笼罩在迷雾之中。本数据集依托AlphaFold2的预测能力,系统性地填补了人类角蛋白家族三维结构知识的空白。它使得研究者能够定量比较I型与II型角蛋白在折叠稳定性、残基柔性分布等方面的差异,并借助pLDDT图谱揭示传统实验难以捕获的局部无序区域。这些结构信息为解释角蛋白在表皮屏障功能与细胞骨架力学维持中的角色提供了关键线索,推动了蛋白质力学图谱的构建。
实际应用
在皮肤生物学与组织工程领域,该数据集为设计具有特定力学性能的生物材料提供了理论指导。基于这些结构模型,科研人员可模拟角蛋白纤维在拉伸、压缩或剪切力下的行为模式,从而优化人工皮肤、伤口敷料等医学产品的力学适配性。此外,在化妆品与护肤品产业中,利用角蛋白结构的原子细节,能够更理性地开发靶向角蛋白交联或保护的活性成分,提升产品对毛发及表皮强韧度的实际功效。
数据集最近研究
最新研究方向
该数据集聚焦于人类角蛋白中间丝蛋白的AlphaFold预测结构,为理解角蛋白的力学性能与疾病机制提供了前所未有的结构基础。当前前沿方向集中于利用这些高置信度三维构象,结合定向分子动力学模拟,系统解析角蛋白在机械拉伸下的去折叠路径与力学响应特征。这一方向与个体化医学中角蛋白突变引发的脆性皮肤病(如表皮松解性角化过度症)研究紧密相连,通过建立结构-力学-疾病表型的关联,为设计靶向角蛋白稳定性的治疗策略开辟了新路径。此外,该数据集作为首个系统性整合51种人类角蛋白的结构信息库,填补了软生物材料力学研究在中间丝领域的结构数据空白,对于推动生物力学、材料科学及结构生物学交叉领域的理论发展具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务