遇见数据集

biomodels-sbml-models-with-tcells

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

该数据集是一个生物医学模型相关的数据集,包含44个样本。每个样本代表一个生物医学模型,并附带丰富的元数据信息。数据集的主要字段包括:模型的唯一标识符(id)、名称(name)、提交者信息(submitter)、提交日期(submissionDate)、最后修改时间(lastModified)、数据格式(format)、在线访问地址(url)、相关的PubMed文献标识符(pubmedid)和PMC文献标识符(pmcid)、文献摘要(abstract)、模型概要描述(synopsis)、关联的模型文件列表(modelfiles)、以SBML(系统生物学标记语言)格式表示的模型字符串(sbml_string)、以Antimony格式表示的模型字符串(antimony_string)以及标识符类型(idtype)。该数据集适用于系统生物学、计算生物建模、模型标准化存储与检索等任务,为研究人员提供了结构化的模型描述及其相关学术文献的链接。

This dataset is a biomedical model-related dataset containing 44 samples. Each sample represents a biomedical model and is accompanied by rich metadata information. The main fields of the dataset include: the models unique identifier (id), name (name), submitter information (submitter), submission date (submissionDate), last modified time (lastModified), data format (format), online access URL (url), related PubMed literature identifiers (pubmedid) and PMC literature identifiers (pmcid), literature abstract (abstract), model synopsis description (synopsis), associated model file list (modelfiles), model string in SBML (Systems Biology Markup Language) format (sbml_string), model string in Antimony format (antimony_string), and identifier type (idtype). The dataset is suitable for tasks such as systems biology, computational biological modeling, model standardized storage and retrieval, providing researchers with structured model descriptions and links to related academic literature.

创建时间:
2026-05-28
原始信息汇总

数据集概述:m1969m/biomodels-sbml-models-with-tcells

该数据集是一个用于机器学习的结构化数据集,专注于从BioModels数据库(SBML格式)中筛选出与T细胞相关的模型。

关键信息

  • 来源平台:Hugging Face Datasets
  • 数据集ID:m1969m/biomodels-sbml-models-with-tcells
  • 数据集大小:总大小约 3.6 MB (3,629,553 bytes),下载大小约 743 KB (743,673 bytes)
  • 数据规模:共包含 44 个样本,全部位于 train 分割中

数据特征 (Features)

该数据集包含15个特征,涵盖模型的元数据、标识符、文本描述以及模型内容:

特征名 类型 描述
format string 文件格式
id string 模型唯一标识符
lastModified null 最后修改时间(值为空)
name string 模型名称
submissionDate string 提交日期
submitter string 提交者
url string 相关链接URL
pubmedid string PubMed ID
synopsis string 模型简介
modelfiles list of strings 模型文件列表
sbml_string string SBML格式的模型内容字符串
idtype string 标识符类型
pmcid string PMC ID
abstract string 相关论文摘要
antimony_string string Antimony格式的模型内容字符串

数据划分 (Splits)

数据集仅包含 一个划分 (train),所有44个样本均用于训练。

功能与用途

  • 核心目的:提供一个经过筛选的、包含T细胞相关SBML模型的集合,便于进行生物信息学或系统生物学相关的机器学习研究。
  • 数据格式:模型内容同时以SBML字符串(sbml_string)和Antimony字符串(antimony_string)两种格式提供,方便不同工具链的使用。
  • 元数据丰富:包含PubMed ID、PMC ID、提交者、摘要等链接,可方便溯源到原始模型和文献。
搜集汇总
数据集介绍
biomodels-sbml-models-with-tcells 数据集图片
构建方式
该数据集源自BioModels数据库,专注于收录与T细胞相关的SBML(Systems Biology Markup Language)模型。构建过程中,研究人员从BioModels中筛选出所有涉及T细胞信号通路或生理过程的模型,并提取其元数据与模型文件。每个样本包含模型的格式、唯一标识符、名称、提交者、发布日期、相关PubMed ID及摘要等描述信息,同时保留了SBML格式的完整字符串表示,以及反物质语言(Antimony)的等价描述,确保了模型的可移植性与复现性。最终,经过清洗与格式化,共汇集了44个高质量模型构成训练集。
特点
该数据集最显著的特征在于专注性与多模态表征。所有模型均围绕T细胞这一免疫核心细胞展开,涵盖了激活、分化、信号转导等关键生物过程,为免疫系统建模提供了定向资源。每个模型不仅提供了标准的SBML字符串,还附带了Antimony语言的描述,极大方便了不同建模工具间的转换与使用。此外,丰富的外围元数据如PubMed ID、摘要和模型简介,为研究者快速定位相关文献和背景知识提供了便利,增强了数据集的实用与教学价值。
使用方法
本数据集可直接用于基于文本的生物模型描述生成模型(如BioBERT等预训练模型)的训练与评估。用户可以通过加载SBML字符串或Antimony字符串作为输入特征,结合模型的名称、摘要等文本信息,进行模型到自然语言的映射或反之。同时,由于数据规模适中(44个样本),非常适合于小样本学习场景、提示工程(Prompt Engineering)以及模型微调实验。数据处理时,建议先将‘sbml_string’或‘antimony_string’字段与‘synopsis’字段配对,构建文本-模型对齐任务,从而探究生物模型的结构化与语义化理解。
背景与挑战
背景概述
该数据集名为biomodels-sbml-models-with-tcells,专注于从BioModels数据库中筛选与T细胞相关的SBML(Systems Biology Markup Language)模型。BioModels作为系统生物学领域的重要资源库,收录了大量经过人工审校的定量生物模型,旨在促进生物过程的可计算化与再现性。该数据集由相关研究机构于近期创建,核心研究问题在于系统性地整合T细胞信号传导、免疫应答等关键生物过程的数学模型,从而为免疫学、药物靶点发现及个性化医疗提供计算基础。通过收录44个经过标准化处理的模型,该数据集不仅丰富了系统免疫学的研究素材,也推动了基于社区的标准(如SBML)在免疫模拟中的广泛应用,对理解T细胞动态调控机制具有重要启示。
当前挑战
当前该数据集面临的首要挑战在于领域问题的复杂性:T细胞相关生物过程涉及多层次信号级联与时空调控,现有模型在捕获这种异质性与动态互作方面尚存局限,难以全面反映体内免疫微环境的真实状态。构建过程中面临的挑战则包括模型来源的分散性——不同实验室提交的SBML文件在注释质量、参数取值及仿真环境上存在差异,需投入大量精力进行标准化与审校。此外,数据规模有限(仅44个实例)制约了基于深度学习的多模型比较与泛化能力,且部分模型缺乏完整的元数据(如PubMed ID或PMCID),阻碍了跨文献的验证与复现,对进一步构建可靠的计算免疫模型构成显著瓶颈。
常用场景
经典使用场景
在系统生物学与免疫学交叉研究的广阔领域中,biomodels-sbml-models-with-tcells数据集汇聚了来自BioModels数据库且与T细胞相关的SBML格式模型,成为计算免疫学研究的珍贵资源。这些模型采用标准化的系统生物学标记语言描述,涵盖了T细胞受体信号转导、细胞因子调控网络、分化路径及免疫突触形成等关键生物学过程。研究者可借助该数据集进行模型重参数化、敏感性分析与多尺度模拟,从而定量解析T细胞在感染、自身免疫及肿瘤微环境中的动态行为。该数据集的核心价值在于提供了经过人工审校的高质量模型,使计算实验具有高度可重复性,极大推动了免疫系统定量建模的标准化进程。
实际应用
在临床转化与生物技术领域,该数据集展现出广阔的应用潜力。基于这些SBML模型,科研团队能够在计算机系统中模拟T细胞在感染或肿瘤环境中的应答特征,优化免疫检查点抑制剂的剂量方案与给药时序。制药企业可利用数据集中的模型筛选作用于T细胞信号通路的小分子药物,预判潜在的脱靶效应与毒性风险。在个性化医疗框架下,这些模型能够结合患者特定的免疫参数进行仿真,辅助设计针对自身免疫病的免疫抑制策略或提升过继性T细胞疗法(如CAR-T与TIL)的持久性与效力。此外,数据集还为虚拟临床试验与数字孪生免疫系统的构建提供了基准,加速了免疫疗法从实验室到临床的应用转化。
衍生相关工作
围绕biomodels-sbml-models-with-tcells数据集,学术界已衍生出大量开创性工作。研究者基于这些模型开发了诸多T细胞信号网络的定制化动力学仿真工具,例如整合IL-2信号环路与凋亡通路耦合的模型,推动了T细胞记忆形成机制的定量研究。该数据集亦促进了免疫组库分析与机械建模的融合,衍生出通过图神经网络预测TCR-抗原结合力的计算方法。在计算系统生物学领域,学者们利用这些模型开展多尺度整合研究,将细胞水平的信号转导动态与组织水平的免疫应答进行关联。更有团队基于数据集中的免疫突触模型,开发了预测肿瘤免疫逃逸风险的集成仿真框架,为设计新型联合免疫疗法奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务