遇见数据集

lamm-mit/keratin-mech-seq-ss-md-properties

收藏
Hugging Face2026-06-06 更新2026-06-14 收录
官方服务:

资源简介:

这是一个长格式的人类角蛋白机械性能和分子动力学结果数据集,链接到UniProt/AlphaFold角蛋白记录。数据集包含51种人类角蛋白单体序列,每种蛋白质有四个速度特定的行(v0、v1、v2和v4),总计204条记录。数据涵盖了角蛋白的机械性能(如强度和韧性)、序列特征、二级结构描述符和分子动力学特性。研究通过受控的牵引分子动力学模拟角蛋白展开过程,计算了最大展开力(强度)和力-位移曲线下面积(韧性),并提供了归一化的强度和韧性值。数据集还包括分子量、不稳定指数、等电点、溶剂可及表面积、氨基酸组成、二级结构组成、结晶度、氢键变化和持久长度等分子描述符。该数据集旨在比较I型和II型角蛋白的展开力学,为理解分子尺度蛋白质行为如何影响头发纤维的韧性和弹性提供见解。

This is a long-form human keratin mechanical-property and molecular-dynamics results dataset linked to UniProt/AlphaFold keratin records. The dataset includes 51 human keratin monomer sequences, with each protein having four velocity-specific rows (v0, v1, v2, and v4), totaling 204 records. It covers mechanical properties (such as strength and toughness), sequence features, secondary-structure descriptors, and molecular dynamics properties. The study simulates keratin unfolding under controlled steered molecular dynamics conditions, computing maximum unfolding force (strength) and area under the force-displacement curve (toughness), with normalized strength and toughness values provided. The dataset also includes molecular descriptors such as molecular weight, instability index, isoelectric point, solvent-accessible surface area, amino-acid composition, secondary-structure composition, crystallinity, hydrogen-bond change, and persistence length. This dataset aims to compare keratin unfolding mechanics across Type I and Type II keratins, providing insights into how molecular-scale protein behavior contributes to the toughness and resilience of hierarchical hair fibers.

提供机构:
lamm-mit
搜集汇总
数据集介绍
lamm-mit/keratin-mech-seq-ss-md-properties 数据集图片
构建方式
该数据集基于51个人类角蛋白单体序列,结合UniProt和AlphaFold数据库获取序列与结构信息,采用CHARMM力场和广义Born隐式溶剂模型进行隐式原子分子动力学模拟。每个蛋白经历能量最小化与平衡后,通过受控的拉伸分子动力学模拟,以四种加速拉伸速度(0.1、0.125、0.15、0.175 Å/ps)将一端固定、另一端施加拉力直至达到估计的轮廓长度,从而生成力-位移曲线。从中提取强度(最大展开力)和韧性(曲线下面积)等力学属性,并将力迹线按序列长度重采样为每个残基长度的力向量,最终整合为包含204条记录的宽格式数据集。
使用方法
数据集可直接用于训练机器学习模型以预测角蛋白力学性能,或用于探索序列与结构特征对分子尺度展开行为的影响。用户可依据‘velocity’字段筛选特定模拟速度下的数据,或通过‘type’字段区分I型和II型角蛋白进行对比研究。力向量字段可支持序列到力学性质的回归分析,而结构描述符则便于进行主成分分析或相关性研究。使用时应引用UniProt、AlphaFold数据库及随附的角蛋白展开力学研究论文,并注意拉伸速度为计算探针,不直接对应实验应变率。
背景与挑战
背景概述
角蛋白作为构成毛发、皮肤及指甲等上皮组织中间丝的关键结构蛋白,其力学性能的分子起源一直是生物材料领域的研究热点。该数据集由麻省理工学院的研究团队于2026年创建,聚焦于人类毛发角蛋白,旨在通过分子动力学模拟与序列-结构-性质关联分析,系统揭示I型和II型角蛋白单体在单分子尺度上的展开力学行为。研究从UniProt/AlphaFold数据库中精选51种人类角蛋白序列,采用隐式溶剂下的拉伸分子动力学模拟,获取强度、韧性等关键力学参数,构建了首个涵盖序列、二级结构、分子动力学性质的可复现数据集。该工作填补了宏观毛发纤维力学与微观蛋白质展开行为之间的认知鸿沟,为理解角蛋白层级结构的多尺度韧性机制提供了高保真数据支撑。
当前挑战
领域层面,角蛋白的单分子力学行为长期以来缺乏系统表征,宏观纤维实验与分子尺度模拟之间难以建立直接关联,限制了对毛发韧性与损伤耐受机制的深入理解。数据集的构建亦面临多方面挑战:首先,角蛋白家族序列长度跨度大(394至644个氨基酸),且部分记录存在序列与长度字段不一致的问题,需逐条核验与标记;其次,拉伸分子动力学采用的加速速度(0.1–0.175 Å/ps)远高于实验应变率,模拟结果仅适用于相对比较而非直接再现,这要求研究者严格界定其计算探针属性;此外,隐式溶剂模型虽提升了计算效率,但可能遗漏水分子介导的氢键动态变化,需在数据集中记录二级结构转变与氢键变化等补充信息以增强解释力。
常用场景
经典使用场景
该数据集为人类角蛋白力学特性与分子动力学模拟结果的综合资源,专用于研究角蛋白单分子在受控拉伸下的展开行为。研究者可据此提取51种角蛋白在不同拉伸速度下的力-位移曲线,计算强度与韧性等力学指标,并结合序列长度、分子量、二级结构组成等结构描述符,系统分析分子特征与力学性能之间的内在关联。这一经典使用场景为从单分子尺度理解角蛋白的力学响应提供了标准化、可重复的计算框架。
解决学术问题
该数据集系统解决了角蛋白分子水平力学性能缺乏系统性表征的学术空白。传统实验多聚焦于宏观发纤维力学,难以揭示单个角蛋白分子的展开机理。数据集通过比较I型和II型角蛋白在不同拉伸速度下的强度、韧性差异,阐明了序列结构特征与力学性能的耦合关系,揭示了速率敏感性、强度-韧性权衡等分子机制。其意义在于建立了从分子序列到宏观力学性能的桥梁,为蛋白质力学、生物材料设计及组织工程提供了理论基础。
实际应用
该数据集的实际应用涵盖毛发护理与修复领域,通过洞悉不同角蛋白的力学特性,指导开发增强发纤维强度与韧性的护发产品。在生物材料领域,其分子尺度力学数据可助力设计仿生纤维材料,如人造蛛丝或高强度纤维。此外,该数据集可为皮肤病学研究提供参考,帮助理解角蛋白突变导致的脆发或皮肤脆弱等病理现象的分子基础,推动精准医疗与个性化护理方案开发。
数据集最近研究
最新研究方向
该数据集聚焦于人类角蛋白家族在分子尺度上的力学与结构关联性研究,代表了生物力学与材料科学交叉领域的前沿探索方向。通过整合51种人源角蛋白的序列信息、AlphaFold预测结构与受控拉伸分子动力学模拟结果,揭示了I型与II型角蛋白在黏附强度、韧性、次级结构转变及溶剂可及表面积等物理属性上的系统性差异。这一工作本质上构建了从蛋白质序列到纳米力学性能的可计算桥梁,为理解头发纤维此类层级生物材料在微观层面的韧性与弹性机制提供了数据驱动的理论框架。尤其在AI加速蛋白质设计与材料逆向工程日益热门的背景下,该研究为机器学习模型预测中间丝蛋白力学响应奠定了基础,对解决实验表征颗粒度不足的挑战具有重要方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务