遇见数据集

silkome-masp

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

Silkome MaSp数据集是一个专注于主要壶腹丝蛋白(MaSp)的序列到属性数据集,用于SilkomeGPT研究。该数据集从完整的silkome-full数据集中筛选出category1为MaSp、MaSp1、MaSp2、MaSp2B、MaSp3、MaSp3B的行,旨在重现论文中面向MaSp的序列到纤维属性对应关系:将蛋白质级的丝蛋白序列与纤维级的机械测量值配对。数据集包含1,033行数据,涉及1,028个独特的氨基酸序列和233个独特的纤维/属性标识符(idv)。序列长度范围从115到1,854个氨基酸,中位数为378。数据提供了完整集(full)、训练集(train)和测试集(test)三种分割。基准分割采用确定性随机分组方法,以idv为单位进行分组,确保训练集和测试集之间在idv和属性元组上均无重叠,以防止数据泄漏。数据集列包括:序列和元数据(如idv、sequence、length、分类学信息category1/category2、物种信息、来源分割source_split、基准分割benchmark_split等);八个核心纤维级机械属性(韧性toughness及其标准差、杨氏模量E及其标准差、强度strength及其标准差、应变strain及其标准差,这些核心值无缺失);以及这些属性的归一化版本(如toughnessNorm等),它们构成了SilkomeGPT条件生成中使用的8维属性向量。此外,数据集还保留了一些额外的材料属性列。该数据集适用于蜘蛛丝蛋白语言建模、序列到属性预测、条件序列生成、蛋白质/材料设计工作流等研究。需要特别注意,数据集呈现的是一种弱监督关系:机械目标是纤维级测量结果,而每个序列是蛋白质级丝蛋白序列,因为蜘蛛丝纤维是复杂的多组分材料,多个丝蛋白序列可能共享相同的测量纤维属性。

The Silkome MaSp dataset is a sequence-to-property dataset focused on major ampullate spidroins (MaSp) for SilkomeGPT research. It is filtered from the complete silkome-full dataset to include rows where category1 is MaSp, MaSp1, MaSp2, MaSp2B, MaSp3, or MaSp3B, aiming to reproduce the MaSp-oriented sequence-to-fiber property correspondence in the paper by pairing protein-level silk protein sequences with fiber-level mechanical measurements. The dataset contains 1,033 rows, involving 1,028 unique amino acid sequences and 233 unique fiber/property identifiers (idv). Sequence lengths range from 115 to 1,854 amino acids, with a median of 378. It provides three splits: full, train, and test. The benchmark split uses a deterministic random grouping method based on idv to ensure no overlap in idv and property tuples between the training and test sets, preventing data leakage. The dataset columns include: sequences and metadata (e.g., idv, sequence, length, taxonomic information category1/category2, species information, source_split, benchmark_split, etc.); eight core fiber-level mechanical properties (toughness and its standard deviation, Youngs modulus E and its standard deviation, strength and its standard deviation, strain and its standard deviation, with no missing values for these core properties); and normalized versions of these properties (e.g., toughnessNorm), which form the 8-dimensional property vector used in SilkomeGPT conditional generation. Additionally, the dataset retains some extra material property columns. It is suitable for research in spider silk protein language modeling, sequence-to-property prediction, conditional sequence generation, and protein/material design workflows. It is important to note that the dataset presents a weak supervision relationship: mechanical targets are fiber-level measurements, while each sequence is a protein-level silk protein sequence, as spider silk fibers are complex multi-component materials where multiple silk protein sequences may share the same measured fiber properties.

创建时间:
2026-05-30
搜集汇总
数据集介绍
silkome-masp 数据集图片
构建方式
Silkome MaSp数据集源自全面的蜘蛛丝蛋白质组资源库lamm-mit/silkome-full,通过严格筛选类别为MaSp、MaSp1、MaSp2、MaSp2B、MaSp3及MaSp3B的条目构建而成。该数据集重现了SilkomeGPT研究中聚焦于大壶状腺丝蛋白(MaSp)的序列-纤维性能对应表格,每一条目均包含蛋白质层面的蛛丝蛋白序列及其对应的纤维力学性能测量值。数据集共包含1,033条记录,其中1,028条为独特序列,对应233个独立的纤维/性能标识符。为满足基准测试需求,数据集进一步划分为训练集(895条)和测试集(138条),划分采用确定性随机种子(seed=0)并以idv字段为分组依据,确保同一纤维性能测量关联的所有序列仅归属于一个子集,有效避免了数据泄露。
特点
该数据集的核心特色在于其独特的弱监督序列-纤维性能对应关系:机械性能目标是纤维层面的测量值,而每条记录仅包含单一蛋白质层面的蛛丝蛋白序列,这一设计反映了蜘蛛丝作为多组分复合材料的复杂性。数据集中包含8项核心力学性能指标(韧性、韧性标准差、杨氏模量、模量标准差、强度、强度标准差、应变、应变标准差),以及对应的归一化版本,可用于条件生成任务。序列长度范围从115至1,854个氨基酸不等,中位数为378个氨基酸,覆盖了MaSp家族中MaSp1、MaSp2、MaSp、MaSp3B、MaSp3和MaSp2B六类亚型,其中MaSp1和MaSp2条目最为丰富。此外,数据集还保留了物种分类、性别及多种辅助材料性能属性,为多维度关联分析提供了基础。
使用方法
数据集通过HuggingFace Datasets库便捷加载,支持三种预定义划分:full、train和test。用户可通过load_dataset('lamm-mit/silkome-masp', split='full')获取完整数据,或分别加载训练与测试子集。每条记录以氨基酸序列(sequence)和8维力学性能向量为核心,用户既可提取原始性能值构建回归预测任务,也可采用归一化版本(toughnessNorm等)进行条件序列生成。由于机械性能目标为纤维层面测量,多个序列可能共享同一性能向量,因此基准测试时强烈建议使用基于idv分组的内置划分,或自行按idv或属性元组进行分组,避免训练与测试集之间的数据泄露。代码示例中提供了完整的索引方法和自定义分组策略,便于研究者灵活适配序列-属性预测、蛋白质语言建模及材料设计等多种研究工作流。
背景与挑战
背景概述
蜘蛛丝蛋白因其卓越的机械性能,如高强度与高韧性,成为生物材料领域的研究热点。由麻省理工学院Markus J. Buehler、David L. Kaplan及Wei Lu等研究人员于2024年创建的Silkome MaSp数据集,聚焦于大壶腹蛛丝蛋白(MaSp)序列与纤维机械性能之间的映射关系。该数据集源自SilkomeGPT研究,精选了1033条经过实验测量的蜘蛛丝蛋白序列及其对应的纤维力学参数(如韧性、模量、强度等),旨在推动蛋白质语言建模、序列-性能预测及条件序列生成等研究,对材料科学和计算生物学领域产生了重要影响。
当前挑战
该数据集所解决的领域问题在于蜘蛛丝蛋白的复杂性——纤维是多组分材料,单一序列无法完全决定其力学行为,因此需要弱监督学习范式建模序列与纤维性能之间的关系。构建过程中面临的挑战包括:确保数据集中233个独立纤维标识符对应的序列组无重叠划分,以避免训练与测试集间信息泄露;同时,需保证八维性能向量(含均值与标准差)在划分时完全隔离,防止模型因接触相同目标值而过拟合;此外,还需处理序列长度从115至1854个氨基酸的巨大差异,以及维护来自原始Silkome完整数据集的来源可追溯性。
常用场景
经典使用场景
在蛋白质语言建模与生物材料科学交叉领域,silkome-masp数据集为大腹园蛛主壶腹腺丝蛋白(MaSp)序列与纤维力学性能之间的关联研究提供了宝贵资源。其经典使用场景涵盖基于Transformer架构的蛋白质语言模型训练,通过将氨基酸序列作为输入,预测包括韧性、杨氏模量、强度和应变在内的八维力学性能指标。该数据集包含1033条精心筛选的序列-性能配对,数据源自已发表的SilkomeGPT研究,并提供了基于纤维标识符分组的确定性训练/测试划分,有效避免了数据泄露问题。研究者可借此开展序列到性能的回归预测任务,或探索蜘蛛丝蛋白中隐藏的序列-结构-功能编码规律。
解决学术问题
该数据集系统性地回应了蜘蛛丝蛋白设计中一个核心学术挑战:如何在蛋白质序列层面建立与宏观纤维力学性能之间的弱监督映射关系。传统研究中,蜘蛛丝纤维的性能往往受多种蛋白质组分的协同影响,单一序列与最终力学表现间的关系难以直接量化。silkome-masp通过提供233组独立纤维的力学测量数据与对应的大腹园蛛丝蛋白亚型序列,为解开这一复杂对应关系铺平了道路。它使研究者能够实证检验序列基序与韧性、应变等关键性能指标之间的统计相关性,从而推动从序列信息出发预测材料宏观性质的科学研究范式。此外,该数据集还推动了弱监督学习策略在蛋白质设计问题中的应用发展。
衍生相关工作
基于silkome-masp数据集最著名的衍生工作当属Lu等人提出的SilkomeGPT模型,该研究首次将生成式预训练Transformer架构应用于蜘蛛丝蛋白序列设计,并通过条件生成方式实现了力学性能可控的人工MaSp序列创制。这一开创性工作发表于Advanced Functional Materials,不仅验证了从蛋白质序列预测纤维力学性能的可行性,还展示了将机器学习与蛋白质工程深度结合的新路径。随后,研究者开始借鉴该数据集在弱监督学习框架下的拆分策略与评估方法,推动其他复杂蛋白质-性能数据集的建设与基准测试。同时,该数据集也被用作对比实验的黄金标准,评价不同序列嵌入策略与多任务学习模型在生物材料预测任务上的表现。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务