遇见数据集

lamm-mit/silkome-masp-idv-grouped

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

Silkome MaSp Idv Grouped 是一个按 idv 分组、仅包含 MaSp 的 Silkome 数据集,用于从与相同测量的纤维/性能标识符相关联的主要壶腹丝素蛋白序列集合中预测拖丝纤维级别的机械性能。该数据集衍生自 lamm-mit/silkome-masp,不是将每个蛋白质序列放在单独的行中,而是将具有相同 idv 的序列行分组为一个样本:{MaSp sequences for one idv} -> {toughness, E, strength, strain}。这种设计旨在用于 ESMC 嵌入模型,后接集合级聚合模型。数据集包含 233 个唯一 idv 组,分为训练集(198 组)和测试集(35 组),无训练/测试 idv 或四属性元组重叠。源数据在过滤/分组前有 1033 行,每个 idv 的序列数最小为 1,中位数为 4.0,平均为 4.43,最大为 13。最大 X-linker 连接序列长度为 5896 个残基/令牌。类别计数包括 MaSp(223 行)、MaSp1(349 行)、MaSp2(331 行)、MaSp2B(40 行)、MaSp3(43 行)和 MaSp3B(47 行)。推荐模型输入包括 sequences、sequence_categories、sequence_lengths 和 category_counts_json 等列。目标列包括 toughness、E、strength、strain 及其标准化版本。数据集适用于纤维级机械性能预测、ESMC 嵌入加集合聚合基准测试、序列类别组成和序列-性能关系分析,以及比随机行级序列分割更安全的泄漏评估。

Silkome MaSp Idv Grouped is an idv-grouped MaSp-only Silkome dataset for predicting dragline fiber-level mechanical properties from the set of major ampullate spidroin sequences associated with the same measured fiber/property identifier. This dataset is derived from lamm-mit/silkome-masp. Instead of placing one protein sequence in each row, this dataset groups sequence rows with the same idv into one sample: {MaSp sequences for one idv} -> {toughness, E, strength, strain}. This formulation is designed for ESMC embedding models followed by a set-level aggregation model. The dataset contains 233 unique idv groups, split into train (198 groups) and test (35 groups) with no train/test idv or 4-property tuple overlap. Source rows before filtering/grouping are 1033, with sequences per idv: min 1, median 4.0, mean 4.43, max 13. Maximum X-linker concatenated sequence length is 5896 residues/tokens. Category counts include MaSp (223 rows), MaSp1 (349 rows), MaSp2 (331 rows), MaSp2B (40 rows), MaSp3 (43 rows), and MaSp3B (47 rows). Recommended model inputs include sequences, sequence_categories, sequence_lengths, and category_counts_json columns. Target columns include toughness, E, strength, strain, and their normalized versions. The dataset is intended for fiber-level mechanical property prediction, ESMC embedding plus set aggregation benchmarks, analysis of sequence category composition and sequence-property relationships, and leakage-safer train/test evaluation than random row-level sequence splits.

提供机构:
lamm-mit
搜集汇总
数据集介绍
lamm-mit/silkome-masp-idv-grouped 数据集图片
构建方式
该数据集源于对原始Silkome MaSp数据集的深度重构,通过将具有相同纤维性能标识符(idv)的氨基酸序列聚合至同一样本单元,构建了适用于纤维级力学性能预测的整合型数据体系。每一组样本对应于单一idv下所有主要壶腹腺丝蛋白(MaSp)序列集合,并关联了相应的韧性、杨氏模量、强度与应变等力学指标。这种分组策略有效规避了传统逐序列划分中产生的信息泄露问题。
特点
数据集共包含233个独立idv分组样本,并严格按照来源数据集预设的基准分割方案划分为198个训练样本与35个测试样本,确保两组在idv及力学属性四元组层面均无重叠。每个idv包含的MaSp序列数量介于1至13条之间,中位数为4.0,最长拼接序列可达5896个残基。序列类别涵盖MaSp、MaSp1、MaSp2及其亚型,为分析序列类别组成与力学性能之间的复杂关联提供了丰富的结构维度。
使用方法
推荐采用ESMC嵌入模型对各序列独立编码,并结合类别嵌入与置换不变聚合模型(如均值池化、注意力池化、DeepSets或集合变换器)进行下游属性预测。数据集提供了多序列列表、类别标签、长度统计等核心字段,同时备有多FASTA文本与X残基拼接序列作为兼容性基准。典型工作流程为:加载分组数据,对每条序列独立提取ESMC特征,融合类别嵌入后通过聚合器映射至四维力学目标向量。
背景与挑战
背景概述
蜘蛛丝以其卓越的力学性能,如高韧性和强度,成为仿生材料科学领域的理想研究对象。为揭示蜘蛛丝蛋白序列与其纤维力学性能之间的复杂关联,Arakawa等人在2022年于《Science Advances》上发表了1000个蜘蛛丝组(silkome)的研究,系统测量了牵引丝纤维的力学属性并关联了丝蛋白序列数据。在此基础上,麻省理工学院的研究团队构建了Silkome MaSp Idv Grouped数据集,专注于主要壶腹腺丝蛋白(MaSp)序列集合与纤维级力学性能的预测。该数据集通过将相同力学测试标识符(idv)的MaSp序列聚为一组,为机器学习模型提供了更加直接且避免数据泄漏的训练与评估基准,在蛋白质序列功能预测、材料信息学及蛋白质工程领域具有重要的推动作用。
当前挑战
该数据集应对的领域核心挑战在于,蜘蛛丝纤维的力学性能并非由单一蛋白质序列决定,而是受多种MaSp亚型(如MaSp1、MaSp2等)的组合及比例、实验环境、纺丝条件、翻译后修饰等多重因素共同影响。因此,从序列集合到纤维属性的映射关系极为复杂,需借助能够处理变长、无序序列集合的模型架构。构建过程中,研究人员面临的主要挑战包括:如何从原始丝组数据中准确关联纤维力学测试与对应丝蛋白序列,避免样本泄漏;如何在仅233个有效idv分组、序列长度跨幅大(最长达5896个残基)的小样本条件下设计合理的训练/测试划分;以及如何将类别组成信息(如MaSp亚型计数)有效整合入预测模型,以提升模型的泛化能力。
常用场景
经典使用场景
在材料科学与生物信息学交叉领域,silkome-masp-idv-grouped数据集被设计用于从主要壶腹腺丝蛋白(MaSp)序列集合中预测纤维级别的力学性能。其核心使用场景是将同一光纤/性能标识符(idv)下的多条MaSp序列聚合为一个样本,通过ESMC等蛋白质语言模型进行独立嵌入后,借助置换不变聚合模型(如均值池化、注意力池化或DeepSets)整合序列级表征,最终映射至韧性、杨氏模量、强度和应变四个关键力学指标,为蜘蛛丝力学性能的序列级预测提供了标准化的基准框架。
解决学术问题
该数据集有效解决了蜘蛛丝力学性能预测中因单条序列与纤维性能非直接对应而引发的监督信号模糊问题。传统模型常将每条序列独立映射至纤维测量值,忽略了多序列组合决定单一力学行为的生物学本质。通过构建idv分组的样本结构,数据集实现了对序列组成效应与力学属性间复杂关联的严谨建模,为探究特定MaSp亚类(如MaSp1、MaSp2)比例如何协调影响纤维韧性提供了可量化的数据基础,显著提升了训练与测试集间泄漏控制的安全性。
衍生相关工作
该数据集衍生出多项具有代表性的学术工作,其中SilkomeGPT作为一项开创性研究,基于生成式建模策略探索了蜘蛛丝蛋白序列的设计空间,结合该数据集的分组力学目标实现新序列的定向优化。此外,ESMC嵌入与集聚合模型的基准评测工作得以开展,系统比较了不同聚合策略(如DeepSets与注意力池化)在纤维韧性预测中的表现。该数据集的提出也推动了序列类别构成分析,揭示了MaSp亚类丰度与纤维力学性能之间的统计关联模式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务