遇见数据集

silkome-masp-idv-grouped

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

Silkome MaSp Idv Grouped 是一个用于从主要壶腹丝蛋白(MaSp)序列集预测蜘蛛拖丝纤维力学性能的数据集。该数据集由源数据集 lamm-mit/silkome-masp 衍生而来,其核心创新在于将具有相同测量纤维/属性标识符(idv)的多个 MaSp 蛋白序列行分组为一个样本,形成“{某个idv对应的MaSp序列集合} -> {韧性、杨氏模量、强度、应变}”的映射关系。这种 formulation 专为 ESMC 嵌入模型及后续的集合级聚合模型设计。数据集包含 233 个唯一的 idv 分组样本,划分为训练集(198 个样本)和测试集(35 个样本),划分基于源数据集的 benchmark_split,确保了训练集与测试集在 idv 和四元组属性上零重叠。分组前共有 1033 个源序列行,分组后每个 idv 包含的序列数量中位数为 4,最大序列长度为 5896 个残基。数据覆盖了 MaSp、MaSp1、MaSp2、MaSp2B、MaSp3、MaSp3B 等多种丝蛋白类别。每个样本提供了详细的序列信息(氨基酸序列列表、序列类别、长度、哈希值)、组成与元数据(物种分类、性别、NCBI标识符、各类别丝蛋白的计数统计)以及四个关键的纤维力学性能目标值(韧性、杨氏模量、强度、应变)及其标准差和归一化版本。为方便使用,还提供了序列的FASTA格式文本、以25个‘X’残基连接的串联序列等表示形式。本数据集旨在支持基于分组丝蛋白序列集的纤维级力学性能预测研究,特别是 ESMC 嵌入结合集合聚合(如平均池化、注意力池化、DeepSets、集合变换器)的模型基准测试,并可用于分析序列类别组成与性能之间的关系。其分组设计相比随机序列级划分能提供更安全的防数据泄露评估。需要注意的是,目标值是纤维级别的宏观测量,并非单个蛋白质的直接标签,且纤维性能还受实验、环境、纺丝、结构及翻译后修饰等多种因素影响。

Silkome MaSp Idv Grouped is a dataset for predicting the mechanical properties of spider dragline silk fibers from a set of major ampullate spidroin (MaSp) sequences. It is derived from the source dataset lamm-mit/silkome-masp, with the core innovation being the grouping of multiple MaSp protein sequence rows with the same measured fiber/property identifier (idv) into a single sample, forming a mapping relationship of {MaSp sequence set corresponding to a specific idv} -> {toughness, Youngs modulus, strength, strain}. This formulation is specifically designed for ESMC embedding models and subsequent set-level aggregation models. The dataset contains 233 unique idv grouped samples, divided into a training set (198 samples) and a test set (35 samples), based on the benchmark_split of the source dataset, ensuring zero overlap in idv and quadruple properties between the training and test sets. Before grouping, there were 1033 source sequence rows; after grouping, the median number of sequences per idv is 4, with a maximum sequence length of 5896 residues. The data covers various silk protein categories such as MaSp, MaSp1, MaSp2, MaSp2B, MaSp3, and MaSp3B. Each sample provides detailed sequence information (amino acid sequence list, sequence category, length, hash value), composition and metadata (species classification, gender, NCBI identifier, count statistics for each silk protein category), and four key fiber mechanical property target values (toughness, Youngs modulus, strength, strain) along with their standard deviations and normalized versions. For ease of use, it also includes representations such as FASTA format text of sequences and concatenated sequences connected by 25 X residues. This dataset aims to support research on fiber-level mechanical property prediction based on grouped silk protein sequence sets, particularly for benchmarking models that combine ESMC embedding with set aggregation (e.g., average pooling, attention pooling, DeepSets, set transformers), and can be used to analyze the relationship between sequence category composition and performance. Its grouped design provides a safer evaluation against data leakage compared to random sequence-level partitioning. It should be noted that the target values are macroscopic measurements at the fiber level, not direct labels for individual proteins, and fiber performance is also influenced by various factors such as experimental conditions, environment, spinning, structure, and post-translational modifications.

创建时间:
2026-05-30
搜集汇总
数据集介绍
silkome-masp-idv-grouped 数据集图片
构建方式
该数据集源自lamm-mit/silkome-masp,通过将具有相同idv标识符的序列行归并为一个样本构建而成。每条样本对应一个独立的纤维力学性能测量标识,汇集了来自同一idv的所有主要壶腹腺丝蛋白序列,形成一个从多序列集合到纤维级力学属性(韧性、杨氏模量、强度、应变)的映射关系。数据集包含233个分组样本,其中训练集198个、测试集35个,且训练集与测试集的idv及四元属性元组无重叠,确保了评估的严谨性。
特点
本数据集的核心特点在于以idv为单元对蚕丝蛋白序列进行分组聚合,避免了传统逐序列切片可能导致的数据泄露问题。每个分组包含1至13条MaSp序列,平均4.43条,涵盖MaSp、MaSp1、MaSp2等多种亚型。数据集精心设计了丰富的元数据列,包括序列类别统计、物种信息及归一化力学目标值,为多序列集合建模提供了全面的组成特征。最大交叉链接拼接序列长度达5896残基,适用于ESMC等嵌入模型的集合级聚合。
使用方法
推荐采用ESMC嵌入模型对每条序列独立提取特征,随后通过置换不变聚合器(如均值池化、注意力池化、DeepSets或集合变换器)将序列级表示融合为分组级表示。典型流程为:对每条序列进行ESMC编码并与可学习类别嵌入相加,再经过集合聚合器预测纤维力学属性。数据集还提供了多FASTA文本和X残基拼接序列作为便捷基线,但应优先使用独立的序列列表以实现更生物合理的表示。
背景与挑战
背景概述
蜘蛛丝作为一种天然高性能生物材料,因其卓越的力学性能(如高韧性、高强度与良好延展性)而备受材料科学与生物工程领域的广泛关注。由Arakawa等人于2022年发起的Spider Silkome研究,系统性地测定了数百种蜘蛛拖丝纤维的力学属性,并关联了其丝蛋白(spidroin)序列信息,为揭示序列-性能关系奠定了重要基础。源于麻省理工学院(MIT)Lamm团队创建的Silkome MaSp Idv Grouped数据集,在此基础上将来源于同一力学测试样本(idv)的多个主要壶腹腺丝蛋白(MaSp)序列进行分组聚合,旨在从多序列组合出发预测纤维级别的韧性、模量、强度与应变等关键力学指标。该数据集包含233个独立样本,训练集与测试集在idv与力学属性标签上完全无重复,为评估序列组成对力学性能的预测能力提供了严格而可靠的数据支撑,推动蜘蛛丝蛋白功能预测与仿生材料设计领域的深入发展。
当前挑战
该数据集主要挑战体现在两个层面。首先,在领域问题层面,蜘蛛丝的宏观力学性能并非由单一蛋白质序列唯一决定,而是受多种MaSp亚型(如MaSp1、MaSp2、MaSp3等)的比例、组装方式以及丝纤维制备条件、环境因素、翻译后修饰等多重变量共同调控,使得从序列集合到纤维力学属性的映射关系高度非线性且存在显著不确定性。因此,模型需有效聚合多序列信息并捕获其协同效应。其次,在数据集构建过程中,原始序列数据经过idv分组筛选后,样本量缩减至233个,且每个idv包含的序列数量从1至13不等,序列总长度可达近6000残基,为嵌入模型与集合聚合策略的设计带来了序列长度异构性高、样本不平衡以及信息冗余等数据处理与建模难题。
常用场景
经典使用场景
在材料科学与蛋白质工程交叉领域中,silkome-masp-idv-grouped数据集的核心应用在于构建从主要壶腹腺丝蛋白(MaSp)序列集合到拖丝纤维力学性能的预测模型。通过将属于同一纤维测量标识符(idv)的多条MaSp序列聚合为单一样本,该数据集成为开发基于ESMC嵌入模型与置换不变集聚合架构(如均值池化、注意力池化或深度集合模型)的基准平台。研究者可据此系统性地挖掘丝蛋白序列组成、类别分布与拖丝韧性、弹性模量、强度及断裂应变间的深层映射关系。
衍生相关工作
围绕该数据集已衍生出一系列富有影响力的研究工作,其中最典型的是SilkomeGPT风格的生成式建模框架。该框架将数据集提供的序列-性能配对作为条件约束,利用生成式模型设计具有目标力学特性的全新蜘蛛丝蛋白序列。此外,基于该数据集涌现出的ESMC嵌入加集聚合力的基准模型,已成为后续对比分析序列表征策略、集聚合网络架构以及序列组成编码方式的标准参照,推动了蛋白质组学数据驱动下的材料逆向设计方法论的发展。
数据集最近研究
最新研究方向
在当前蛋白质工程与材料科学的前沿交叉领域中,蜘蛛丝蛋白因其卓越的力学性能而成为仿生材料设计的理想模板。Silkome MaSp Idv Grouped数据集通过创新性地将主要壶腹腺丝蛋白(MaSp)序列按个体标识符进行分组,构建了从氨基酸序列到纤维级力学性能(韧性、模量、强度、应变)的端到端预测框架。该数据集的独特之处在于其面向ESMC嵌入模型与集合聚合架构的设计理念,通过引入序列类别组成分析和泄露安全的训练/测试划分策略,为揭示蜘蛛丝蛋白序列-结构-性能的深层映射关系提供了高保真数据基础。这一研究范式不仅推动了利用深度学习模型直接从多序列集合预测纤维整体性能的发展,还启发了新一代生成式蛋白质设计方法(如SilkomeGPT),在可持续高性能生物材料创制领域具有重要的科学意义与工程应用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务