遇见数据集

lamm-mit/keratin-fasta

收藏
Hugging Face2026-06-06 更新2026-06-14 收录
官方服务:

资源简介:

该数据集名为Human Keratin FASTA Sequences,是一个精心策划的人类角蛋白蛋白FASTA记录集合,包含51条记录,来自人类(Homo sapiens)。数据集涵盖I型角蛋白(25条)和II型角蛋白(26条),序列长度范围为394-644个氨基酸,中位长度为493。每条记录包括UniProt衍生的序列元数据和计算的序列组成描述符,如氨基酸组成、分数和估计分子量。数据集用于支持一项关于头发角蛋白展开力学的比较分子动力学研究,旨在通过模拟分析分子尺度行为如何影响头发纤维的韧性和弹性。数据生成过程涉及从UniProtKB链接蛋白记录,并标注生物体、基因符号、角蛋白类别等信息,同时保留了序列一致性检查标志,以方便下游用户过滤或审核。

This dataset, named Human Keratin FASTA Sequences, is a curated collection of FASTA records for human keratin proteins, containing 51 records derived from Homo sapiens. The dataset covers 25 Type I keratins and 26 Type II keratins, with sequence lengths ranging from 394 to 644 amino acids and a median length of 493. Each record includes UniProt-derived sequence metadata and calculated sequence composition descriptors such as amino acid composition, fractional values, and estimated molecular weight. This dataset supports a comparative molecular dynamics study on the unfolding mechanics of hair keratins, which aims to analyze how molecular-scale behaviors affect the toughness and elasticity of hair fibers through simulations. The data generation process involved retrieving protein records from UniProtKB, annotating them with details including organism, gene symbol, and keratin category, while retaining sequence consistency check flags to facilitate downstream users' filtering and validation.

提供机构:
lamm-mit
搜集汇总
数据集介绍
lamm-mit/keratin-fasta 数据集图片
构建方式
该数据集源自一项专注于人类毛发角蛋白分子尺度力学特性的研究,由Wei Lu、Fabien Leonforte和Markus J. Buehler等人精心构建。研究者从UniProt知识库中系统检索并整理了51个人类角蛋白单体蛋白的序列记录,涵盖I型和II型两大类。每条记录均关联UniProt登录号,并附有生物体、分类学、基因符号、角蛋白类别及序列长度等元数据。数据集不仅存储了规范的FASTA头部信息与标准氨基酸序列,还计算了氨基酸组成、组分频率、分组残基描述符及估计的单同位素分子量,并通过布尔字段记录了序列一致性校验结果,便于用户追溯与过滤存在源序列差异的条目。
特点
该数据集的核心特点在于其高度结构化与多维度的信息整合。它并非简单的FASTA序列集合,而是融合了序列本身、理化属性及质量控制标记的综合型资源。所有51条序列均经过UniProt注释,并明确标注了角蛋白类型(I型25条、II型26条),序列长度范围为394至644个氨基酸,中位长度为493。此外,数据集提供了氨基酸组成、分子量等计算描述符,并针对KRT17与KRT26等序列字符串或长度字段存在差异的记录保留了标记字段,赋予用户审计与筛选的灵活性。这些特性使其成为连接分子序列与宏观力学性能分析的理想桥梁。
使用方法
使用该数据集时,研究者可基于Hugging Face平台直接加载`lamm-mit/keratin-fasta`仓库中的记录。每条数据包含基因符号、UniProt登录号、角蛋白类型及完整序列等字段,可用于后续的蛋白质结构预测、分子动力学模拟或序列-性质关联分析。建议用户优先利用一致性校验字段过滤出无差异的条目,以确保数据可靠性。对于下游研究,应引用原始文献、UniProt及AlphaFold数据库,并遵循CC BY 4.0许可协议。该数据集尤其适用于比较不同角蛋白类型在受控拉伸模拟中的展开行为,从而揭示序列与结构特征对毛发纤维韧性的分子贡献。
背景与挑战
背景概述
角蛋白作为中间丝蛋白家族的重要成员,在维持上皮组织(如毛发、皮肤和指甲)的结构完整性中发挥着关键作用。该数据集由Wei Lu、Fabien Leonforte和Markus J. Buehler于2026年创建,聚焦于人类毛发角蛋白的分子尺度研究。核心研究问题在于揭示I型和II型角蛋白单体的分子展开力学机制,通过整合51种人类角蛋白的序列信息、AlphaFold预测结构和受控分子动力学模拟,建立起序列特征与力学性能之间的关联。这一工作填补了角蛋白分子层次系统表征的空白,为理解分级结构毛发纤维的韧性和弹性提供了可复现的数据基础,对生物材料力学和蛋白质工程领域具有重要推动作用。
当前挑战
该数据集面临的核心挑战在于解决传统角蛋白研究的多尺度鸿沟。宏观实验难以直接捕捉单个角蛋白分子的展开行为,而计算模拟所需的加速拉伸速度与实际毛发纤维应变率存在显著差异,使得模拟结果只能揭示相对力学趋势而非绝对定量值。数据集构建过程中亦遭遇技术难题:需从UniProt和AlphaFold数据库中精准筛选并验证51个序列记录,尤其是对KRT17和KRT26等序列字符串存在差异的条目进行标注而非静默修正,同时保证类型I与类型II角蛋白的均衡覆盖。此外,氨基酸组成、分子量及二级结构描述符的计算需跨数据库兼容,确保可重复性与下游使用的鲁棒性。
常用场景
经典使用场景
在蛋白质组学与生物力学交叉研究领域,keratin-fasta数据集为深入探究角蛋白单分子力学行为提供了标准化的序列-结构-性质关联基础。该数据集收录了51条经严格筛选的人类角蛋白序列,涵盖酸性I型与碱性II型两大类,并附有从UniProt获取的详尽元数据及计算得到的氨基酸组成、分子量等序列描述符。研究者可基于此数据开展全原子或粗粒化分子动力学模拟,通过施加受控的拉伸载荷,系统比较不同类型角蛋白在解折叠过程中的力-位移曲线、峰值强度及韧性指标,从而揭示序列特征与单分子力学响应的内在关联。该数据集特别适用于构建从角蛋白一级结构到层次化纤维力学性能的多尺度预测模型,为解析毛发、皮肤等上皮组织的非凡机械韧性提供分子层面的定量依据。
解决学术问题
该数据集有效填补了人类毛发角蛋白分子尺度力学表征的系统性空白,解决了长期以来宏观力学实验难以单独揭示的单分子解折叠机制问题。依托于51条高质量序列及其衍生结构预测与分子动力学模拟,研究人员能够首次以统计学显著的数据规模对比I型与II型角蛋白在拉伸下的力学异质性,澄清序列长度、分子量、无规卷曲含量及溶剂可及表面积等分子描述符对强度-韧性耦合的调控作用。该数据集提供的标准框架使得过去受限于单一蛋白或小样本案例的定性观察,得以升级为可量化、可复现的对比分析,进而推动了对毛发纤维韧性起源的分子层面理解,为上皮组织生物力学理论注入了从序列到结构的精密数据驱动视角。
衍生相关工作
keratin-fasta数据集所衍生的代表性工作集中体现在Lu等人发表的《Comparative Molecular Dynamics Characterization of Hair Keratin Unfolding Mechanics》研究中,该工作首次构建了涵盖51个人类角蛋白单体的标准力谱库,并揭示了Type I与Type II角蛋白在强度-韧性耦合模式上的显著差异。此外,该数据集启发了基于AlphaFold预测结构与拉伸解折叠模拟相结合的分析流程,催生了一系列关于角蛋白聚集态超分子组装机制的后续研究。在生物信息学工具开发方面,该数据集提供的序列一致性校验字段、成分描述符及SHA-256校验码,为FASTA质量审计流程设立了参考标准,推动了角蛋白序列数据库的规范化整理。值得一提的是,该数据集已被用于训练机器学习模型,以直接根据角蛋白的氨基酸组成预测其单分子力学性能,实现了从序列到力学属性的端到端映射,开辟了蛋白质力学性质的序列设计新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务