遇见数据集

silkome-full-idv-grouped

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

Silkome Full Idv Grouped 是一个用于从丝蛋白组(Silkome)序列预测蜘蛛丝牵引丝纤维机械性能的分组数据集。该数据集由原始silkome-full数据集重构而来,核心创新在于将共享相同测量纤维/属性标识符(idv)的所有可用丝蛋白序列行聚合为单个样本,形成序列集合 -> 机械性能的映射关系,旨在服务于基于ESMC等嵌入模型和后续集合级聚合模型的预测流程。数据集包含270个唯一的idv分组样本,总计代表3563条蛋白质序列行。每个分组样本包含一个idv对应的所有丝蛋白氨基酸序列列表(sequences)、每条序列的类别标签(如MaSp1, MaSp2等,共18个类别)、序列长度以及基于类别的组成特征。目标变量是纤维级的四个关键机械性能:韧性(toughness)、杨氏模量(E)、强度(strength)和应变(strain),同时提供了这些性能的标准差及归一化版本。数据还附带了丰富的元数据,包括物种分类学信息(科、属、种)、性别、NCBI标识符等。数据集已预先划分为训练集(230个样本)和测试集(40个样本),采用基于property_tuple_key的确定性分组分割方法,确保训练集和测试集在idv和四元组属性上均无重叠,以进行更严谨、防泄漏的模型评估。该数据集适用于纤维级机械性能预测、序列嵌入与集合聚合模型基准测试、丝蛋白类别组成分析以及序列-性能关系研究等任务。需要注意的是,目标性能是纤维水平的测量值,并非单个蛋白质的直接功能标签,纤维力学还受多种非序列因素影响。

Silkome Full Idv Grouped is a grouped dataset for predicting the mechanical properties of spider dragline silk fibers from Silkome sequences. This dataset is reconstructed from the original silkome-full dataset. The core innovation lies in aggregating all available silk protein sequence rows that share the same measurement fiber/property identifier (idv) into a single sample, establishing a mapping relationship from sequence collections to mechanical properties, and it is designed to support prediction workflows based on embedding models such as ESMC and subsequent collection-level aggregation models. The dataset contains 270 unique idv-grouped samples, totaling 3563 protein sequence rows. Each grouped sample includes the list of all silk protein amino acid sequences (sequences) corresponding to one idv, the category label for each sequence (e.g., MaSp1, MaSp2, 18 categories in total), sequence lengths, and category-based compositional features. The target variables are four key fiber-level mechanical properties: toughness, Young's modulus (E), strength, and strain, with standard deviations and normalized versions of these properties also provided. The dataset also comes with rich metadata, including species taxonomic information (family, genus, species), gender, NCBI identifiers, and more. The dataset has been pre-divided into a training set (230 samples) and a test set (40 samples) using a deterministic grouping split method based on property_tuple_key, ensuring no overlap between the training and test sets in terms of idv and the four-tuple properties, enabling more rigorous and leakage-proof model evaluation. This dataset is applicable to tasks such as fiber-level mechanical property prediction, sequence embedding and collection aggregation model benchmarking, silk protein category compositional analysis, and sequence-property relationship research. It should be noted that the target properties are fiber-level measurements, not direct functional labels for individual proteins, and fiber mechanics are also influenced by a variety of non-sequence factors.

创建时间:
2026-05-30
搜集汇总
数据集介绍
silkome-full-idv-grouped 数据集图片
构建方式
该数据集源自于蜘蛛丝蛋白质组学领域,旨在通过全局视角解析蛛丝蛋白序列与其纤维力学性能之间的复杂关联。在构建过程中,研究者对`lamm-mit/silkome-full`数据集进行了深度整合,摒弃了将单一蛋白质序列作为独立样本的常规思路,转而以纤维/属性标识符`idv`为核心分组单元,将所有关联于同一`idv`的丝蛋白序列汇聚为一个复合样本。此操作将原始3563条序列行压缩为270个聚合数据点,并基于`property_tuple_key`以确定性分组方式(seed=0, test_frac=0.15)划分出230个训练样本与40个测试样本,确保训练集与测试集间在`idv`和完整属性元组上均无重叠,从而有效规避数据泄露风险。
特点
本数据集的核心特征在于其多层级、结构化的序列表示与丰富的辅助元数据。每个样本囊括了同一`idv`下的所有可用序列及其类别标签(如MaSp1、MiSp等),这些类别跨越18种丝蛋白类型,数量分布极不均衡,从稀有类别如Pflag(2条)到丰富类别如AcSp(430条),展现了蜘蛛丝蛋白组的天然异质性。除序列列表外,数据集还提供长度统计、类别计数矩阵(如`n_masp1`)、二值指示变量(如`has_masp2`)以及序列Concat_X25拼接文本,为模型提供了从原始序列到高阶组成特征的灵活输入选择。此外,目标变量包含韧性、弹性模量、强度与应变四项核心力学指标及其标准差,并附有标准化版本,便于不同建模场景下的直接使用。
使用方法
针对该数据集的结构特性,推荐采用基于ESMC嵌入的集合级聚合建模策略。具体流程为:为每个样本中的每条序列独立应用ESMC模型提取嵌入表示,并可选地添加可学习的类别嵌入(如MaSp1嵌入)以注入生物学先验,随后通过均值池化、注意力池化或DeepSets等置换不变集合聚合器将所有序列嵌入融合为样本级特征,最后接入回归头预测四项力学性质。Hugging Face数据集加载后可通过`row["sequences"]`与`row["sequence_categories"]`直接获取序列与类别列表,而`row["targets"]`则提供目标张量。拼接基线(`sequence_concat_x25`)虽适用于简单管道,但因其可能超过ESMC模型最大输入长度,故首选独立的序列列表表示,以最大化模型灵活性与生物合理性。
背景与挑战
背景概述
蜘蛛丝作为一种性能卓越的天然生物材料,因其极高的强度、韧性和延展性而备受材料科学界关注。然而,蜘蛛丝蛋白序列与其宏观力学性能之间的复杂映射关系长期未被充分揭示。2022年,由Arakawa等人在《Science Advances》上发表的“1000 spider silkomes”研究,首次系统性地将蜘蛛丝组(silkome)转录组数据与拖丝纤维的力学性能关联起来,构建了大规模序列-性能数据库。在此基础上,麻省理工学院的研究团队进一步开发了Silkome Full Idv Grouped数据集,该数据集以纤维测量标识符(Idv)为单位,将同一纤维样本关联的所有蜘蛛丝蛋白序列进行分组,旨在为基于ESMC嵌入模型和集合聚合方法的纤维级力学性能预测提供标准化基准。该数据集包含270个分组样本,覆盖18种蜘蛛丝蛋白类别,其构建不仅推动了蜘蛛丝蛋白序列-性能关系的研究,也为生物材料逆向设计提供了关键数据支撑。
当前挑战
该数据集面临的核心挑战在于,蜘蛛丝纤维的力学性能并非由单一蛋白序列决定,而是多种丝蛋白协同作用、加工条件及环境因素共同影响的结果。具体而言,领域问题层面,传统序列-性能预测模型通常忽略了纤维中多种丝蛋白亚型的组合效应,而本数据集要求模型能够从多序列集合中学习不变性表示,处理类别不平衡与序列长度差异极大的挑战。构建过程中,数据来源基于转录组关联而非物理验证,无法确切保证分组内的每条序列均实际参与纤维构成,存在生物学噪声;此外,原始3563条序列经分组后仅得到270个有效样本,样本量稀少且属性标签(如韧性、强度等)存在测量误差,给模型的泛化能力和鲁棒性评估带来了显著困难。
常用场景
经典使用场景
在蛋白质科学与材料设计交叉领域,Silkome Full Idv Grouped数据集的核心应用场景在于利用多序列集合预测蜘蛛拖丝纤维的宏观力学属性。该数据集创新性地将同一纤维样本对应的全部蛛丝蛋白序列(如MaSp、MiSp、AcSp等类别)整合为分组样本,通过序列集合到力学性能(韧性、杨氏模量、强度、应变)的映射,构建起序列组成与成品纤维功能之间的桥梁。研究者通常采用ESMC等蛋白质语言模型对组内各序列独立嵌入,再经由置换不变聚合器(如均值池化、注意力池化或DeepSets)整合成全局表示,最终回归预测纤维力学指标。这一范式不仅规避了单序列预测缺乏上下文的问题,更忠实还原了蜘蛛丝作为多蛋白复合材料的生物本质。
实际应用
在实际应用层面,该数据集直接赋能仿生丝绸材料的智能设计流程。通过训练序列集合到力学性能的预测模型,研究人员可以在虚拟空间中快速评估大量假设的蛋白组成方案,大幅缩短从合成基因到性能测试的试错周期。具体而言,团队可利用该模型筛选最优的MaSp/MiSp配比、蛋白长度分布或类别多样性,指导湿法纺丝实验中多组分蛋白的共混比例。此外,该数据集还可用于开发蛋白质语言模型的微调任务,提升模型对天然纤维这类结构复杂生物材料的表征能力,最终服务于工业级高强高韧丝绸的开发,以及可降解高性能纺织材料的绿色制造。
衍生相关工作
围绕该数据集的独特结构属性,衍生出一系列前沿研究工作。SilkomeGPT模型率先采用自回归生成模型,从该数据集的序列组成模式中学习约束,设计出具有增强韧性的新型蜘蛛丝蛋白序列,验证了序列组合空间的可探索性。其后,基于ESMC嵌入与集合注意力架构的预测模型成为主流基准,研究者进一步引入类别感知位置编码,使模型区分同类别蛋白的细微差异。在无监督领域,对比学习框架被用于从分组的序列集合中挖掘具有代表性的蛋白亚型。此外,针对训练/测试泄漏问题,该数据集提出的基于IDV层级的分割策略已被后续蛋白质组收集类数据集广泛采纳,成为保证评估真实性的标准实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务