遇见数据集

keratin-fasta

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

Human Keratin FASTA Sequences 是一个经过策划的人类角蛋白蛋白质FASTA记录数据集,包含从UniProt衍生的序列元数据和计算出的序列组成描述符。该数据集旨在支持角蛋白分子动力学研究,特别是作为伴随研究《Comparative Molecular Dynamics Characterization of Hair Keratin Unfolding Mechanics》的一部分。数据集包含51条记录,覆盖人类(Homo sapiens)的I型和II型角蛋白类别,其中I型25条,II型26条。蛋白质序列长度范围在394至644个氨基酸之间,中位长度为493个氨基酸。数据集中的记录链接到UniProtKB登录号,并注释了生物体、NCBI分类、基因符号、角蛋白类型、序列长度和来源链接。每个序列存储了详细的字段信息,包括记录ID/基因符号、UniProt登录号和URL、FASTA头字段、规范氨基酸序列、校验和(如MD5、SHA-1)、氨基酸组成计数和频率、分组残基组成描述符(如疏水性、电荷性),以及估计的单同位素分子量。此外,数据集包含序列一致性检查的布尔字段,用于标记源序列差异(例如在KRT17和KRT26中发现的序列字符串和长度字段不一致),以便下游用户过滤或审核。数据适用于生物信息学、蛋白质结构分析、分子动力学模拟和角蛋白相关研究。序列记录基于UniProtKB,结构记录链接到AlphaFold Database条目,两者均遵循CC BY 4.0许可。用户在下游工作中应适当引用UniProt、AlphaFold Database和相关研究手稿。

Human Keratin FASTA Sequences is a curated dataset of human keratin protein FASTA records, containing sequence metadata derived from UniProt and computationally calculated sequence composition descriptors. This dataset is intended to support keratin molecular dynamics research, particularly as a companion resource for the study titled "Comparative Molecular Dynamics Characterization of Hair Keratin Unfolding Mechanics". The dataset comprises 51 records covering Type I and Type II keratins from Homo sapiens, with 25 records for Type I keratins and 26 for Type II keratins. The lengths of the protein sequences range from 394 to 644 amino acids, with a median length of 493 amino acids. Each record is linked to a UniProtKB accession number, and is annotated with organism information, NCBI taxonomy, gene symbol, keratin type, sequence length, and source URL. Detailed field information is stored for each sequence, including record ID/gene symbol, UniProt accession number and URL, FASTA header fields, canonical amino acid sequence, checksums (e.g., MD5, SHA-1), amino acid composition counts and frequencies, grouped residue composition descriptors (e.g., hydrophobicity, charge), and estimated monoisotopic molecular weight. Additionally, the dataset includes boolean fields for sequence consistency checks, which are used to flag discrepancies in source sequences (e.g., inconsistencies between sequence strings and length fields observed in KRT17 and KRT26) to enable downstream users to filter or audit the data. This dataset is applicable to bioinformatics, protein structure analysis, molecular dynamics simulations, and keratin-related research. The sequence records are based on UniProtKB, while structural records are linked to AlphaFold Database entries, both of which are licensed under CC BY 4.0. Users should appropriately cite UniProt, the AlphaFold Database, and the associated research manuscript in their downstream work.

创建时间:
2026-06-05
原始信息汇总

数据集概述:Human Keratin FASTA Sequences

数据集名称:Human Keratin FASTA Sequences
许可证:CC BY 4.0
语言:英文
数据集大小:少于1000条记录
标签:生物学、蛋白质、角蛋白、FASTA、UniProt、人类

数据集摘要

  • 记录数量:51条
  • 生物体:人类(Homo sapiens,NCBI:txid9606)
  • 角蛋白类型统计:I型25条,II型26条
  • 序列长度范围:394–644个氨基酸
  • 序列长度中位数:493个氨基酸
  • 存在序列-字符串差异的记录:KRT17、KRT26
  • 存在序列长度-字段/字符串差异的记录:KRT17、KRT26
  • 生成时间:2026-06-05T15:18:17.879704+00:00

字段说明

每条记录包含以下字段:

  • 记录ID/基因符号
  • UniProt登录号和URL
  • NCBI分类单元和生物体名称
  • 角蛋白类型
  • FASTA标头字段
  • 蛋白质序列及校验和
  • 氨基酸组成、分数和估计分子量
  • 文件大小、路径、修改时间和SHA-256

数据集生成背景

该序列集作为研究论文《Comparative Molecular Dynamics Characterization of Hair Keratin Unfolding Mechanics》(作者:Wei Lu, Fabien Leonforte, Markus J. Buehler)的一部分进行整理。数据集包含51个人类角蛋白单体蛋白,涵盖I型和II型角蛋白类别。蛋白质记录链接到UniProtKB登录号,并注释了生物体、分类单元、基因符号、角蛋白类别、序列长度和来源链接。

每条序列存储了解析后的FASTA标头、标准氨基酸序列、校验和字段、氨基酸计数和频率、分组残基组成描述符,以及估计的单同位素分子量。序列一致性检查结果以布尔字段保留,便于下游用户筛选或审计存在来源序列差异的记录。

数据来源与归属

序列记录链接到UniProtKB,结构记录(如有)链接到AlphaFold数据库。UniProt数据库的可版权部分根据CC BY 4.0提供,AlphaFold数据库的数据同样根据CC BY 4.0供学术和商业用途。用户应适当引用UniProt、AlphaFold数据库以及相关的角蛋白展开力学研究论文。

验证说明

上传工作流程会检查以下内容:

  • 唯一记录标识符
  • 预期的I型/II型覆盖范围
  • 模拟输出的预期速度组
  • 序列长度
  • 力向量长度
  • 内部PDB残基/SEQRES一致性

逐记录布尔字段保留已知的来源序列差异标记,而非静默覆盖。

搜集汇总
数据集介绍
keratin-fasta 数据集图片
构建方式
该数据集源自《Comparative Molecular Dynamics Characterization of Hair Keratin Unfolding Mechanics》研究,系统整理了51条人类角蛋白单体蛋白的FASTA序列,涵盖I型和II型角蛋白类别。每条记录均与UniProtKB数据库交叉关联,并附有物种分类、基因符号、角蛋白类型、序列长度及来源链接等元数据。数据集构建过程中,对每条序列进行了FASTA头部解析、氨基酸序列校验、计数与频率统计、残基组成描述符计算及单同位素分子量估算,并保留了序列一致性检查的布尔字段,便于用户追溯源序列差异。
使用方法
该数据集适用于生物信息学与蛋白质工程领域的下游任务,如角蛋白力学特性的分子动力学模拟、序列比对与进化分析、以及基于机器学习的蛋白质功能预测。用户可直接加载JSON或FASTA格式的记录,利用gene_symbol或UniProt accession进行索引,提取氨基酸组成特征用于回归或分类模型训练。同时,布尔型校验字段可辅助数据过滤,确保分析基于高质量序列。建议在相关研究中引用原始UniProt、AlphaFold数据库出处以及随附的角蛋白解折叠力学论文,以遵守学术规范。
背景与挑战
背景概述
该数据集由麻省理工学院 Markus J. Buehler 团队于2026年创建,源自其研究《Comparative Molecular Dynamics Characterization of Hair Keratin Unfolding Mechanics》。核心问题聚焦于人类角蛋白单体的序列特征与力学行为关联,收录了51条经 UniProt 验证的Ⅰ型和Ⅱ型角蛋白的FASTA记录,涵盖序列长度、氨基酸组成及分子量等计算描述符,为蛋白质力学模拟提供标准化数据基础。
当前挑战
领域挑战在于角蛋白序列多样性(如KRT17与KRT26存在源序列差异)对分子动力学模拟一致性的干扰,以及类型Ⅰ/Ⅱ分类下序列长度范围(394–644个氨基酸)对力场参数通用性的检验。构建挑战包括从UniProt异构数据中解析并校验多源字段(如checksum与序列指纹),通过自动化工作流标记记录级不一致性,而非静默修正,确保数据溯源完整性与可审计性。
常用场景
经典使用场景
该数据集收录了51条经过严格校验的人源角蛋白单体FASTA序列,涵盖I型和II型两大类角蛋白家族,序列长度分布在394至644个氨基酸之间。作为角蛋白组学研究的基石性资源,它常用于构建角蛋白序列的进化树分析、同源建模以及分子动力学模拟的初始构象选取。研究者可借助其中丰富的序列组成描述符,如氨基酸频率、残基分组特征和分子量等元数据,快速开展角蛋白二级结构预测、交叉β-折叠倾向分析以及中间丝装配机制的模拟研究。数据集内置的序列校验标记(如KRT17与KRT26的不一致标志)还为序列质量控制与误差追踪提供了标准化参考,使其成为蛋白质序列分析和生物信息学管道开发中不可或缺的基准数据集。
解决学术问题
该数据集系统性地解决了角蛋白序列资源分散、注释不统一以及缺乏标准化元数据这三大长期以来困扰角蛋白力学与结构生物学的学术瓶颈。通过关联UniProtKB的权威登录号,它消除了不同数据库间命名和引用歧义,使得跨研究对比成为可能。内嵌的序列长度-字段校验机制直接回应了公共数据库中序列记录不一致问题,为高精度分子模拟提供了可溯源的数据保障。此外,氨基酸组成分数与分子量的计算为解析角蛋白独特的疏水和半胱氨酸交联模式提供了量化基础,有力支撑了单分子力学响应、机械韧性起源以及疾病相关点突变功能影响等前沿课题的探索。
实际应用
在实际科研与产业转化中,该数据集可作为角蛋白基生物材料设计的序列资源库,协助工程师筛选具有特定序列特征的角蛋白单体用于重组表达或仿生纤维纺丝。在化妆品与毛发修复领域,基于其序列信息与卷曲力学相关性分析,可预测护发成分对角蛋白多肽链的增韧或柔化效果。在组织工程中,数据集支持的分子动力学模拟结果可为支架材料中角蛋白组装体的力学性能调优提供分子级指导。同时,它也为蛋白质序列AI模型的训练提供了高质量的正样本,尤其在处理稀有角蛋白亚型时体现出无与伦比的注释准确性。
数据集最近研究
最新研究方向
该数据集聚焦于人类角蛋白单体序列的精细表征,为蛋白质力学与结构生物学的前沿交叉领域注入了新的数据驱动力。在生物材料与分子模拟研究热潮中,角蛋白因其在毛发、皮肤等组织中的关键力学性能而备受关注。通过整合UniProt来源的序列元数据、氨基酸组成与分子量等计算描述符,该数据集为解析角蛋白去折叠力学机制的分子动力学模拟提供了标准化输入与验证基准。尤其值得关注的是,数据集内嵌的序列一致性校验字段使研究者能系统审视异常记录,避免因源数据差异导致的模拟偏差,这对高通量蛋白质动力学研究的可重复性具有重大意义。当前,基于此类精准数据的多尺度建模正推动个性化生物材料设计及损伤修复机制探索迈向新高度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务