遇见数据集

lamm-mit/silkome-masp

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

Silkome MaSp数据集是一个用于蜘蛛丝蛋白研究的专业数据集,专注于主要壶腹丝蛋白(MaSp)序列与纤维级机械属性之间的关联。该数据集从完整的Spider Silkome资源(lamm-mit/silkome-full)中筛选出“category1”为MaSp、MaSp1、MaSp2、MaSp2B、MaSp3或MaSp3B的条目,共包含1,033行数据,涉及1,028个唯一蛋白质序列和233个唯一纤维/属性标识符(idv)。数据集中每个行提供蛋白质级丝蛋白序列(氨基酸序列长度范围从115到1,854个氨基酸)以及对应的纤维级机械测量值,包括韧性(toughness)、杨氏模量(E)、强度(strength)和应变(strain)等核心属性及其标准偏差(SD)。数据集提供了完整分割(full)、训练分割(train)和测试分割(test),其中训练/测试分割基于idv分组进行确定性随机划分,确保无重叠,以支持序列到属性预测、条件序列生成和蛋白质设计等研究。该数据集旨在用于蜘蛛丝蛋白语言建模、材料科学工作流程以及MaSp序列基序与机械性能分析,但需注意机械属性是纤维级测量,而序列是蛋白质级,因此属于弱监督资源,适用于生成建模和设计研究。

The Silkome MaSp dataset is a specialized resource for spider silk protein research, focusing on the association between major ampullate spidroin (MaSp) sequences and fiber-level mechanical properties. It is curated from the full Spider Silkome resource (lamm-mit/silkome-full) by selecting rows where category1 is one of MaSp, MaSp1, MaSp2, MaSp2B, MaSp3, or MaSp3B, resulting in 1,033 rows with 1,028 unique protein sequences and 233 unique fiber/property identifiers (idv). Each row includes a protein-level spidroin sequence (amino acid sequence length ranging from 115 to 1,854 residues) paired with corresponding fiber-level mechanical measurements, such as core properties like toughness, Youngs modulus (E), strength, strain, and their standard deviations (SD). The dataset provides full, train, and test splits, with the train/test splits deterministically randomized and grouped by idv to ensure no overlap, supporting research in sequence-to-property prediction, conditional sequence generation, and protein design. It is intended for applications in spider silk protein language modeling, materials science workflows, and analysis of MaSp sequence motifs and mechanical performance, but note that the mechanical targets are fiber-level measurements while sequences are protein-level, making it a weakly supervised resource suitable for generative modeling and design studies.

提供机构:
lamm-mit
搜集汇总
数据集介绍
lamm-mit/silkome-masp 数据集图片
构建方式
Silkome MaSp数据集源自全面蛛丝蛋白组资源(`lamm-mit/silkome-full`),通过筛选`category1`字段中属于MaSp、MaSp1、MaSp2、MaSp2B、MaSp3及MaSp3B类别的条目构建而成。该过程重现了Lu等人研究中聚焦于大壶腹蛛丝蛋白(MaSp)的序列-纤维性能关联表,将蛋白质层面的蛛丝蛋白序列与纤维层面的力学测量数据精准配对。为确保数据完整性,数据集保留了所有八项核心力学性能指标及其归一化向量,覆盖1,033条记录、1,028条独特序列和233个独立的纤维性能标识符(`idv`)
特点
该数据集具有鲜明的多尺度关联特性:每一行包含一条MaSp蛋白序列,而力学性能标签却来源于纤维级别的实测数据。由于蛛丝纤维由多种蛋白组分构成,多个序列可能共享同一组力学测量值,因此该资源本质上是弱监督的序列-性能对照表。数据集提供了基于`idv`分组、确定性随机种子(seed=0)划分的训练集(895行)与测试集(138行),确保同一纤维性能标识符对应的所有序列完全归属同一子集,杜绝训练与测试间的性能标签泄露。序列长度跨度从115到1,854个氨基酸,中位数为378个,覆盖六个MaSp亚类
使用方法
研究人员可通过HuggingFace Datasets库直接加载预定义的`full`、`train`或`test`子集。在序列到性能预测任务中,推荐直接使用基于`idv`分组的内置划分以避免信息泄露;若需重新划分,应复制该分组策略,优先保证不同子集间无重复的纤维性能标识符或八维属性向量。代码示例展示了如何获取单条序列对应的八项原始力学性能或其归一化版本,后者可直接用于条件生成模型的条件向量输入。该数据集主要服务于蛛丝蛋白语言建模、序列-性能关系预测、条件序列生成及蛋白材料设计等工作流
背景与挑战
背景概述
在蛋白质工程与材料科学的交叉前沿,蜘蛛丝因其卓越的力学性能而备受关注,但传统实验方法难以快速解析其序列-性能关系。2024年,由Wei Lu、David L. Kaplan和Markus J. Buehler领衔的麻省理工学院团队在《Advanced Functional Materials》发表了SilkomeGPT研究,并由此构建了Silkome MaSp数据集。该数据集聚焦于大壶腹蛛丝蛋白(MaSp)家族,从完整的蜘蛛丝组资源中筛选出1,033条序列-纤维性能配对条目,涵盖MaSp1、MaSp2等六个亚类。核心研究问题在于建立蛋白质序列与纤维级力学性能(韧性、模量、强度、应变)之间的映射关系,为生成式设计高力学性能丝蛋白提供数据基础。该工作为蛋白质语言模型在材料科学中的应用开辟了新范式,推动了仿生材料设计向数据驱动方向的深刻转型。
当前挑战
该数据集直面多重挑战。在领域问题层面,蜘蛛丝蛋白的序列-性能关系具有弱监督特性——纤维是多种蛋白的复合体,单条序列无法独立决定其力学行为,这给序列-性能预测带来了天然瓶颈。同时,相同纤维样品的多条序列共享同一性能标签,导致传统随机划分易引发数据泄露,需采用基于纤维标识符的分组策略以保证评估的公正性。在构建过程中,从庞大的蜘蛛丝组数据中精准筛选MaSp亚类需要细致的人工审核与类别归一化;跨亚类的序列长度差异显著(115至1,854个氨基酸),增加了模型泛化难度。此外,八维力学性能向量的联合预测与归一化处理,对多目标学习算法提出了高要求,而纤维级指标的测量误差(如标准差的存在)进一步放大了噪声处理的复杂性。
常用场景
经典使用场景
在蛋白质语言建模与材料科学交叉的前沿领域,Silkome MaSp数据集常被用于研究蜘蛛大壶状腺丝蛋白(MaSp)序列与纤维力学性能之间的复杂关联。研究者通过该数据集构建序列到属性预测模型,利用Transformer等深度学习架构捕捉氨基酸序列中隐藏的结构-功能映射关系,从而实现对丝蛋白纤维韧性、强度、断裂应变和杨氏模量等关键力学指标的精准推断。该数据集的经典使用范式涵盖监督式回归预测、表征学习以及弱监督条件下的序列-属性联合建模,为揭示蜘蛛丝蛋白序列进化保守性、重复基序特征及其对宏观力学表现的贡献提供了标准化基准。
实际应用
在实际应用中,Silkome MaSp数据集正在为高性能生物材料的理性设计铺平道路。基于该数据集训练的生成模型能够根据指定的力学性能指标,如高韧性或高强度,自动生成全新的MaSp蛋白序列。这些序列可进一步通过合成生物学技术在大肠杆菌或酵母等宿主中表达,经湿法纺丝工艺转化为具有定制化性能的人造蛛丝纤维。在军工领域,此类材料可用于制造轻质防弹衣或高性能降落伞绳索;在生物医学领域,凭借其卓越的生物相容性和可降解性,可开发为高强度手术缝合线、组织工程支架或药物缓释载体;在纺织工业中,也可用于生产兼具环保属性与超凡耐磨性的高附加值织物。
衍生相关工作
围绕Silkome MaSp数据集,一系列开创性工作应运而生。其直接催生的代表性工作是SilkomeGPT,该研究首次将大型语言模型架构应用于蜘蛛丝蛋白序列的生成与设计,通过条件控制实现力学性能导向的序列创作,并在Advanced Functional Materials上发表,成为该交叉领域的里程碑。此外,后续研究借鉴该数据集的弱监督序列-属性建模框架,衍生出面向其他结构蛋白(如蚕丝蛋白、胶原蛋白)的序列设计方法。在表征学习方面,该数据集也被用于训练蛋白质语言模型中的力学属性预测头,并与AlphaFold等结构预测模型结合,探索序列、结构到性能的全链条预测。这些衍生工作共同构建了从数据到模型再到实验验证的完整研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务