遇见数据集

keratin-mech-seq-ss-md-properties

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

该数据集是一个关于人类角蛋白机械性能、序列特征和分子动力学特性的综合数据集。数据集包含51种人类角蛋白单体(100个I型,104个II型)在四种不同拉伸速度(v0-v4)下的分子动力学模拟结果,共计204条记录。每条记录包含蛋白质的序列信息(氨基酸长度范围394-644,中位数493)、机械性能指标(强度范围749.59-1799.58,韧性范围449074.07-2086165.54)、分子特性(分子量、不稳定指数、等电点、溶剂可及表面积)、二级结构组成(结晶度、结构转变、氢键变化、持久长度)以及详细的力向量数据。数据来源于UniProtKB序列记录和AlphaFold Database结构预测,通过NAMD软件使用CHARMM力场和广义Born隐式溶剂模型进行分子动力学模拟生成。该数据集适用于蛋白质力学特性研究、材料科学分析、生物信息学模型训练以及角蛋白相关生物力学应用。

This dataset is a comprehensive collection of human keratin mechanical properties, sequence features, and molecular dynamics characteristics. It includes molecular dynamics simulation results for 51 human keratin monomers (100 Type I, 104 Type II) under four different stretching speeds (v0-v4), totaling 204 records. Each record contains protein sequence information (amino acid length range 394-644, median 493), mechanical performance indicators (strength range 749.59-1799.58, toughness range 449074.07-2086165.54), molecular properties (molecular weight, instability index, isoelectric point, solvent accessible surface area), secondary structure composition (crystallinity, structural transitions, hydrogen bond changes, persistence length), and detailed force vector data. The data is sourced from UniProtKB sequence records and AlphaFold Database structure predictions, generated through molecular dynamics simulations using NAMD software with the CHARMM force field and generalized Born implicit solvent model. This dataset is suitable for research on protein mechanical properties, materials science analysis, bioinformatics model training, and keratin-related biomechanical applications.

创建时间:
2026-06-05
原始信息汇总

数据集名称

Human Keratin Mechanical, Sequence, SS, and MD Properties(人类角蛋白力学、序列、二级结构及分子动力学性质数据集)

基本信息

  • 存储位置lamm-mit/keratin-mech-seq-ss-md-properties
  • 记录数:204 条
  • 生物体:智人(Homo sapiens, NCBI:txid9606)
  • 角蛋白类型计数:I型 100 条,II型 104 条
  • 序列长度范围:394–644 个氨基酸
  • 序列长度中位数:493.0
  • 独特蛋白质数:51 种
  • 不同拉伸速度行数:每个蛋白质包含 v0、v1、v2、v4 四种速度条件,各 51 条
  • 强度范围:749.59–1799.58
  • 韧性范围:449074.07–2086165.54
  • 标注的序列字符串冲突记录:KRT17、KRT26
  • 标注的序列长度/字符串冲突记录:KRT17、KRT26
  • 生成时间:2026-06-05T15:18:17.881347+00:00

许可协议

  • CC BY 4.0

数据字段

每条记录包含以下类别信息:

  • result_idKRT record_id
  • 拉伸速度条件
  • 蛋白质序列及来源匹配标志
  • 力向量、原始力向量文本、校验和及向量统计量
  • 强度、韧性、归一化强度、归一化韧性
  • 分子量、不稳定指数、等电点、溶剂可及表面积(SASA)
  • 氨基酸计数/百分比、二级结构组成
  • 结晶度、二级结构转变、氢键变化、持续长度
  • 记录来源与校验和字段

数据生成方法

  • 序列描述符:采用 ProtParam 风格计算,包括序列长度、分子量、不稳定指数、等电点。
  • 结构描述符:从折叠结构及模拟轨迹计算,包括 SASA、结晶度、二级结构组成、转变计数、氢键变化、持续长度。
  • 分子动力学模拟:使用 NAMD 软件、CHARMM 力场及广义 Born 隐式溶剂模型(GBIS),进行隐式原子模拟。每个蛋白质先经最小化和平衡,再进行拉伸分子动力学(SMD)。模拟中固定一端,对另一端施加拉伸力直至达到估计的轮廓长度,采用四种加速拉伸速度:0.1、0.125、0.15、0.175 Å/ps。
  • 力学性质提取:力-位移响应结果中,强度定义为最大展开力,韧性定义为力-位移曲线下面积。力迹线通过分段平均重采样至蛋白质序列长度,生成每个残基长度的力向量。数据集包含全部 204 次运行的归一化强度与韧性值。

数据来源与引用

  • 序列记录:链接至 UniProtKB。
  • 结构记录:链接至 AlphaFold 数据库条目。
  • 版权说明:UniProt 数据库可版权部分以 CC BY 4.0 提供;AlphaFold 数据库数据以 CC BY 4.0 提供,可用于学术和商业用途。
  • 引用建议:使用时应引用 UniProt、AlphaFold 数据库及配套的角蛋白展开力学论文。

数据验证说明

上传流程检查了以下项目:唯一记录标识符、预期的 I 型/II 型覆盖、各速度组的模拟输出、序列长度、力向量长度、内部 PDB 残基/SEQRES 一致性。每个记录的布尔字段保留已知的源序列冲突标志,而非静默覆盖。

搜集汇总
数据集介绍
keratin-mech-seq-ss-md-properties 数据集图片
构建方式
该数据集整合了51种人类角蛋白单体的序列信息、结构特征及分子动力学模拟结果。序列描述符通过ProtParam式算法计算得出,涵盖分子量、不稳定指数及等电点等理化属性。二级结构及结构描述符则源自折叠构象与模拟轨迹,包括溶剂可及表面积、结晶度、二级结构组成及转变计数等。利用NAMD软件与CHARMM力场进行隐式全原子分子动力学模拟,采用广义玻恩隐式溶剂模型。每种蛋白质经最小化与平衡后,施以受控拉伸分子动力学模拟,即固定一端并对另一端施加拉力直至达到预估轮廓长度。模拟采用四种加速拉伸速度(0.1、0.125、0.15及0.175 Å/ps)作为计算探针,以比较相对分子尺度上的解折叠行为。每个模拟运行的力-位移响应被处理为最大解折叠力(强度)与力-位移曲线下面积(韧性),同时通过分段平均将力迹线重采样至蛋白质序列长度,生成适用于模型训练的每残基长度力向量。
特点
该数据集共包含204条记录,涵盖51种独特角蛋白,每种蛋白质对应四个拉伸速度条件(v0、v1、v2、v4)。序列长度范围为394至644个氨基酸,中位长度为493.0。数据集中Ⅰ型角蛋白100种,Ⅱ型角蛋白104种,强度范围介于749.59至1799.58之间,韧性范围则从449074.07至2086165.54不等。每条记录均包含来源匹配标志,KRT17与KRT26两个条目被标记存在序列字符串不一致。数据集字段极为丰富,涵盖结果标识符、速度条件、蛋白质序列、力向量及其统计量、强度与韧性的归一化值、分子量与等电点等理化参数,以及结晶度、二级结构转变、氢键变化和持续长度等结构描述符。验证流程确保了记录标识符的唯一性、类型覆盖、速度分组一致性及序列长度、力向量长度的内部一致性。
使用方法
研究人员可直接加载该数据集进行机器学习模型训练,利用每残基长度力向量预测角蛋白的力学响应,或探索序列-结构-力学性质之间的关联。该数据与UniProt及AlphaFold数据库条目相链接,便于获取更广泛的蛋白质背景信息。数据集支持按蛋白质名称或速度条件进行筛选与分组分析。归一化的强度与韧性值便于跨蛋白质比较,而序列长度与力向量长度的一致性检查则为数据可靠性提供了保障。用户应引用UniProt数据库、AlphaFold数据库及伴随的角蛋白解折叠力学手稿。数据采用CC BY 4.0许可协议,可用于学术与商业用途。在具体应用中,可利用该数据集训练预测模型以估算不同突变对力学性能的影响,或评估不同角蛋白类型的力学差异,为生物材料设计提供数据支撑。
背景与挑战
背景概述
人类角蛋白作为中间丝蛋白家族的核心成员,在维持细胞力学完整性及组织机械性能中扮演关键角色。然而,角蛋白单体在单分子尺度下的力学响应机制长期未得到系统解析。为此,麻省理工学院Lamm团队于2026年创建了该数据集,整合了51种人类角蛋白单体的序列、二级结构、分子动力学模拟及力学性能数据,涵盖四种拉动速度下的强度与韧性等关键参数。数据集基于UniProt和AlphaFold数据库进行溯源,并采用NAMD与CHARMM力场进行隐式溶剂拉伸模拟。该数据集首次系统性地将角蛋白序列与纳米力学行为直接关联,为蛋白质材料科学、生物力学及毛发科学提供了标准化的数据资源与基准。
当前挑战
该数据集主要解决了两个层面的挑战。在领域问题层面,角蛋白单体力学性能的实验测量受限于样本制备与仪器精度,传统研究难以获得高分辨率的力-位移曲线,而该数据集通过显式模拟提供了系统化的纳米力学指标,包括强度、韧性、力向量及二级结构转变等,填补了角蛋白力学性能系统性空白。在数据构建层面,模拟需在隐式溶剂模型下协调多种拉动速度以获得可比结果,同时需要确保序列与长度校验一致,部分如KRT17与KRT26的标识异常需被保留而非忽略。此外,力向量需按序列长度重采样以支持后续建模,这些严格的质量控制流程构成了构建过程的核心挑战。
常用场景
经典使用场景
在计算生物力学与蛋白质材料科学的交叉前沿,该数据集为理解人类角蛋白纤维的力学响应机制提供了高保真的分子尺度参考。其最经典的使用场景在于,研究者可借助四条不同拉伸速率下的力-位移曲线,系统剖析角蛋白单体的强度、韧性、归一化力学参数与序列-结构特征之间的深度关联。例如,通过将氨基酸组成、二级结构含量或结晶度作为特征变量,训练回归模型来预测蛋白质在单分子拉伸中的最大断裂力与断裂功,从而建立从一级序列到宏观力学性能的映射桥梁。这种数据驱动的范式不仅适用于角蛋白家族,亦为其他中间丝蛋白乃至结构蛋白的力学设计提供了可复现的基准框架。
衍生相关工作
该数据集的发布催生了一系列富有启发性的衍生研究。它可直接用作训练图神经网络或注意力机制的基准数据,构建能够从蛋白质序列直接预测力学性质的深度学习模型,进而拓展至整个人类蛋白组的力学功能注释。另一条可能的路径是将其与AlphaFold预测的折叠结构结合,发展基于几何深度学习的结构-力学关系模型,揭示力传递路径与β-片层滑动、α-螺旋展开等变形模式的内在联系。此外,借助该数据集中二级结构转变与氢键变化的时间序列特征,可衍生出针对蛋白质折叠-展开动力学的隐变量分析框架,为设计具有特定力学响应特性的智能响应材料提供理论基础。跨物种的角蛋白力学比较研究亦可在此数据上自然延伸,揭示进化保守的力学功能基序。
数据集最近研究
最新研究方向
该数据集聚焦于人类角蛋白的力学性能与分子动力学模拟的前沿交叉领域,为蛋白质材料科学提供了系统性的纳米力学表征资源。当前研究热点在于利用加速拉伸速度下的单分子力谱数据,揭示角蛋白分子序列与二级结构演化对强度、韧性等力学指标的深层调控机制。结合序列描述符与结构属性,该数据集支撑了基于机器学习的蛋白质力学性能预测模型开发,助力探索突变与构象转变对纤维生物力学稳定性的影响。此外,数据集中的力-位移轨迹与残基长度向量为理解角蛋白α-β转变与氢键网络重构的动态过程提供了关键数据,对仿生高性能纤维设计和生物材料损伤机制研究具有重要推动作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务