遇见数据集

msc-aging-agent-corpus

收藏
Hugging Face2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

MSC衰老智能体语料库是一个经过筛选、可供智能体使用的间充质干细胞(MSC)衰老转录组关联数据集。它整合了来自公共NCBI GEO数据库的转录组数据、DVC Stem的临床研究文献证据以及BioGPS的生物数据集扩展发现信息。该数据集旨在为MSC衰老机制研究、衰老相关生物标志物发现以及跨证据层(转录组、临床、图谱)的关联分析提供结构化资源。数据内容包含多个层次:1) 核心转录组数据:涵盖19个独立的GEO数据集,提供了18,045个经过统计筛选的基因-衰老关联,每个数据集包含样本元数据、基因表达值(长格式和宽格式)以及关联分析结果(如效应值beta、p值、q值)。2) 临床证据层:包含来自DVC Stem研究数据库的54项MSC治疗临床研究的书目元数据,以及13个连接GEO转录组发现与临床文献的“桥梁”条目。3) BioGPS证据层:收录了85个BioGPS数据集的目录,并识别出98个可能与MSC/衰老研究相关的GEO扩展候选数据集,通过4个“桥梁”连接核心语料库与BioGPS图谱。数据规模介于1万到10万条之间,主要文件格式为CSV、压缩CSV和JSON。关键数据文件包括:数据集清单(dataset_manifest.csv)、临床证据清单(dvc_stem_study_manifest.csv)、转录组-临床桥梁文件(transcriptome_clinical_bridges.csv)、BioGPS目录(biogps_geo_catalog.csv)、衰老生物标志物候选基因表(aging_biomarker_candidates.csv)以及分析就绪的表达长格式表(analysis_ready_expression_long.csv.gz)。每个GEO数据集文件夹内还包含详细的样本级数据和解读说明。使用本数据集时需特别注意:必须首先加载并固定语料库的修订版本(通过CORPUS_PROVENANCE.json);需仔细阅读各数据集的解读注意事项(interpretation_caution),因为不同数据集的“衰老轴”(aging_axis)定义各异(例如,可能是供体年龄、细胞传代、发育阶段或疾病表型对比);严禁将临床摘要文本或BioGPS元数据直接等同于转录组统计证据进行合并分析。数据集适用于生物信息学分析、计算生物学建模以及需要结合多源证据的生物医学研究智能体(agent)开发。

MSC Aging Agent Corpus is a curated, agent-ready transcriptome-associated dataset focused on mesenchymal stem cell (MSC) senescence. It integrates transcriptomic data from the public NCBI GEO database, clinical study literature evidence from DVC Stem, and extended discovery information from BioGPS biological datasets. This dataset aims to provide a structured resource for research on MSC senescence mechanisms, discovery of senescence-related biomarkers, and cross-evidence-layer (transcriptomic, clinical, atlas) association analyses. The dataset content covers three layers: 1) Core transcriptomic data: It includes 19 independent GEO datasets, providing 18,045 statistically filtered gene-senescence associations. Each dataset contains sample metadata, gene expression values in both long and wide formats, and association analysis results such as effect size beta, p-value, and q-value. 2) Clinical evidence layer: It comprises bibliographic metadata for 54 MSC therapy clinical studies from the DVC Stem research database, plus 13 "bridge" entries that link GEO transcriptomic findings to clinical literature. 3) BioGPS evidence layer: It compiles a catalog of 85 BioGPS datasets, identifies 98 potential GEO extended candidate datasets relevant to MSC/senescence research, and connects the core corpus to the BioGPS atlas via 4 "bridge" entries. The dataset has a scale ranging from 10,000 to 100,000 entries, with primary file formats including CSV, compressed CSV, and JSON. Key data files are: dataset manifest (dataset_manifest.csv), clinical evidence manifest (dvc_stem_study_manifest.csv), transcriptome-clinical bridge file (transcriptome_clinical_bridges.csv), BioGPS catalog (biogps_geo_catalog.csv), candidate aging biomarker gene table (aging_biomarker_candidates.csv), and analysis-ready long-format expression table (analysis_ready_expression_long.csv.gz). Each GEO dataset folder also contains detailed sample-level data and interpretation notes. Special precautions for using this dataset are as follows: First, you must load and fix the corpus revision version via CORPUS_PROVENANCE.json; second, carefully read the interpretation cautions for each dataset, as the definition of "aging axis" varies across datasets (e.g., it may refer to donor age, cell passage, developmental stage, or disease phenotype comparison); third, it is strictly forbidden to directly combine clinical summary texts or BioGPS metadata with transcriptomic statistical evidence for combined analysis. This dataset is applicable to bioinformatics analysis, computational biology modeling, and the development of biomedical AI agents that require integration of multi-source evidence.

创建时间:
2026-06-12
原始信息汇总

数据集概述:MSC Aging Agent Corpus

MSC Aging Agent Corpus 是一个经过人工筛选、面向智能体(agent)的间充质干细胞(MSC)衰老转录组关联数据集,整合了来自公共GEO数据库的转录组数据、临床证据(DVC Stem)以及BioGPS扩展发现。

数据集全称: MSC Aging Agent Corpus
发布方: Syndicate Laboratories
策展人: Dr. James Utley, PhD(长寿科学家)
核心研究焦点: 间充质干细胞(MSC)生物学作为衰老生物标志物
语言: 英语
许可协议: CC-BY-4.0
数据规模: 10,000 < n < 100,000

数据集组成

组成部分 数量
GEO转录组数据集 23
筛选后的关联(保留) 22,045
临床证据研究(DVC子集) 54
GEO ↔ 文献临床桥梁 15
BioGPS数据集目录 85
GEO扩展候选(MSC/衰老) 106
BioGPS桥梁(GEO ↔ 图谱) 4
机制关联路径 12
机制标记的分泌组命中 251

数据来源

  • 公共转录组队列: NCBI GEO
  • 临床书目元数据: DVC Stem(https://www.dvcstem.com/study-database)
  • 扩展发现: BioGPS(http://biogps.org/api/biogps_dataset)

核心数据文件(推荐加载顺序)

  1. datasets/CORPUS_PROVENANCE.json — 修订版本固定、层级映射、引用模板(必须最先加载)
  2. datasets/dataset_manifest.csv — GEO来源信息、模型、解释指南
  3. datasets/clinical_evidence/dvc_stem_study_manifest.csv — 临床MSC治疗书目元数据
  4. datasets/clinical_evidence/transcriptome_clinical_bridges.csv — GEO ↔ 临床桥梁(跨层级声明前加载)
  5. datasets/biogps_evidence/biogps_geo_catalog.csv — BioGPS关联的GEO目录与扩展候选
  6. datasets/mechanistic_associations/cell_interaction_pathways.csv — MSC ↔ 伙伴细胞关系路径
  7. datasets/aging_biomarker_candidates.csv — 跨数据集基因搜索(仅表达证据)
  8. datasets/analysis_ready_expression_long.csv.gz — 用于重复运行的表达+元数据
  9. datasets/<dataset_id>/ — 各GEO队列的表格与README

关键字段说明

  • Manifest(清单): dataset_id, species, cell_context, aging_axis, aging_axis_type, model_formula, expression_scale, interpretation_caution, n_samples, retained_screened_features
  • Biomarker table(生物标志物表): gene_symbol, beta, p_value, q_value, direction, nominal_significant, fdr_significant + 来源列
  • Expression long(长格式表达表): feature_id, sample_id, expression_value + 关联统计量 + 数据集特定元数据

解释注意事项

  • beta 对应每个数据集 model_formula 中的第一项(即衰老轴)。
  • 部分数据集存在特殊对比(如年龄分组、复制性衰老、发育轴、共培养等),需在跨数据集综合前仔细阅读对应 aging_axis_typecorpus_uniqueness_noteinterpretation_caution
  • 具体数据集解释警告包括:GSE115068(小鼠脂肪MSC周期对比)、GSE94736(老年女性组对比)、GSE34929(双色P12 vs P4)等。

引用说明

  • 必须固定修订版本标签(例如 corpus-v2026.06.6
  • APA引用格式: Utley, J. (2026). MSC Aging Agent Corpus (Version corpus-v2026.06.6) [Data set]. Syndicate Laboratories. https://huggingface.co/datasets/S4MPL3BI4S/msc-aging-agent-corpus
  • 生物学主要来源应引用原始GEO或PubMed(通过 source_urlsource_study_url),不要将Hugging Face作为生物学主要来源引用。

使用示例

python from huggingface_hub import hf_hub_download import json

REPO = "S4MPL3BI4S/msc-aging-agent-corpus" REV = "corpus-v2026.06.6"

provenance = hf_hub_download( repo_id=REPO, filename="datasets/CORPUS_PROVENANCE.json", repo_type="dataset", revision=REV, ) meta = json.load(open(provenance))

其他资源

搜集汇总
数据集介绍
msc-aging-agent-corpus 数据集图片
构建方式
该语料库由Syndicate Laboratories精心构建,旨在为间充质干细胞(MSC)衰老转录组研究提供代理可查询的资源。构建过程从公共GEO数据集中筛选与MSC衰老相关的转录组关联,涵盖供体年龄、传代、衰老、炎症及伙伴细胞免疫调节等对比维度。同时整合了DVC Stem的临床证据(54项研究)与BioGPS的扩展发现(85个数据集),并构建了GEO与临床、GEO与图谱之间的桥梁(共19条)。通过机制标记的分泌组路径(12条)将转录组数据与细胞间相互作用关联,最终筛选出22,045个保留关联,形成多层次、结构化的知识体系。
使用方法
使用该语料库时,需首先加载`datasets/CORPUS_PROVENANCE.json`以获取修订标签与层映射,并固定修订版本(如`corpus-v2026.06.6`)以确保可复现性。通过Hugging Face Hub的`hf_hub_download`函数下载所需文件,例如先读取`dataset_manifest.csv`获取GEO数据集元数据与解释指南,再加载`aging_biomarker_candidates.csv`进行跨数据集的基因搜索。临床证据与BioGPS层分别有独立的清单与桥梁文件,跨层声明前必须加载对应的桥梁文件。引用时需标注语料库修订版本与文件路径,且生物学原始来源应引用GEO或BioGPS的URL,而非Hugging Face页面。
背景与挑战
背景概述
该数据集由Syndicate Laboratories于2026年发布,核心研究人员为詹姆斯·厄特利博士(Dr. James Utley, PhD),旨在系统整合间充质基质/干细胞(MSC)衰老相关转录组学关联。MSC作为衰老生物标志物的潜在载体,其生物学特性在长寿科学领域备受关注。本数据集从23个公开GEO数据集中筛选出22,045个MSC与衰老转录组关联,并融合了54项临床证据(DVC Stem)及85个BioGPS数据集,构建了面向智能体研究流程的结构化资源。通过机制标记的分泌组通路及临床桥梁,该语料库为解析MSC衰老轴、免疫调节及旁分泌信号提供了跨层次证据,显著提升了衰老生物标志物发现的效率与可重复性。
当前挑战
该语料库面临的核心领域挑战在于MSC衰老转录组数据的异质性与解读复杂性,例如不同数据集间物种、细胞背景、衰老轴类型(如供体年龄、传代次数、复制性衰老)及统计模型的差异,需严格标注‘解释注意事项’以避免误读。构建过程中挑战尤为突出:需对每个GEO队列进行标准化筛选与关联统计(如beta值方向性)、处理组别对比(如骨质疏松症)与发育轴等非标准衰老比较、协调临床证据层(DVC Stem)与转录组统计证据的跨层次桥接。此外,需确保数据来源可追溯,在保持分析就绪表达矩阵的同时提供明确的引用规范,防止将临床摘要或BioGPS元数据误用于转录组统计推断。
常用场景
经典使用场景
在间充质干细胞(MSC)与衰老生物学交叉研究领域,该数据集被广泛用作转录组关联分析的标准化基准资源。研究者通过其精心筛选的23个GEO公开数据集,系统性地探究MSC衰老过程中基因表达谱的动态变化,涵盖供体年龄、细胞传代次数、复制性衰老及炎症微环境等多维度衰老轴心。其经典使用方式包括利用预处理后的表达矩阵与统计结果,直接进行跨数据集荟萃分析或验证特定衰老生物标志物的表达趋势。特别地,该语料库为人工智能代理驱动的自动化科研工作流程而设计,研究人员可通过程序化接口查询其中的机制标记分泌组数据与临床关联桥接信息,从而高效生成可验证的假设,无需手动重新下载和清洗原始测序档案。
解决学术问题
该数据集的核心学术贡献在于系统性地解决了MSC衰老转录组研究中长期存在的数据碎片化与可重复性危机。通过整合散布于不同GEO系列中的异质性队列,其构建了统一的统计框架与谨慎的解释规范,有效缓解了因批次效应、模型差异与实验设计混淆变量(如发育轴与传代对比)带来的假阳性风险。这一资源使得研究者能够可靠地识别出跨数据集稳健的衰老相关基因特征,并区分MSC内在的衰老信号与外部微环境或共培养体系中伙伴细胞的转录响应。其研究意义在于为MSC作为衰老生物标志物的理论提供了坚实的组学证据基础,推动了从单一基因关联向机械性信号通路(如MSC与巨噬细胞间的IL10/CXCL8轴)的认知跃迁,进而重塑了干细胞衰老领域的假设生成范式。
实际应用
在实际应用层面,该数据集主要服务于抗衰老药物靶点发现、细胞治疗质量控制与再生医学临床转化评估。药物研发机构可基于其筛选出的22,000余个名义显著基因关联,结合临床证据层中54项MSC治疗研究的元数据,优先验证在体内外模型中具有干预潜力的分泌组因子。细胞治疗企业则利用其传代与衰老轴心的表达谱,建立批次放行标准,监控培养过程中干性维持与衰老规避的关键质量属性。此外,临床医生可借助转录组-临床桥接文件,将体外发现的基因特征与DVC Stem数据库收录的疾病领域安全性及可行性结果相关联,为自体MSC治疗的时机选择与患者分层提供转录组学参考。该语料库的代理就绪架构还支持自动化文献挖掘系统实时更新证据图谱,加速从实验室发现到临床应用的闭环反馈。
数据集最近研究
最新研究方向
该数据集聚焦于间充质干细胞(MSC)衰老转录组关联的智能化挖掘,整合了来自公共GEO数据库的23个转录组数据集、22,045条筛选关联及临床证据桥接,专为智能体研究流程设计。当前前沿方向集中于利用该语料库驱动MSC衰老生物标志物的系统性发现,通过机制标记的分泌组路径与细胞互作通路,探究MSC在炎症、复制性衰老及免疫调节中的转录组动态变化。该研究领域与抗衰老医学和再生疗法的热点紧密相连,尤其在理解MSC作为衰老生物标志物的潜在作用方面,其通过构建从转录组到临床证据的跨层桥梁,为精准干预衰老相关疾病提供了结构化数据基础。这一工作的意义在于推动了数据驱动型长寿科学的发展,使智能体能够无需重新下载原始档案即可高效查询关键关联,加速了从基础转录组发现到临床转化的研究进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务