遇见数据集

Bulk-RNA-Seq-Benchmark

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集是一个用于评估基础模型的批量 RNA-seq 基准测试,源自 38 个公开数据集,整合为 58 个预测任务(25 个回归任务,33 个分类任务)。任务涵盖临床结果预测(如治疗反应、复发、生存期、药物敏感性、分期和分子表型)以及诊断预测(如疾病/感染存在与否或类型)。每个数据集以 Parquet 文件格式存储,每行代表一个样本,包含样本标识符(sample_id)、基因表达矩阵(基因符号列,log1p 尺度,非负)、任务标签列(y__<task>,NaN 表示该样本不属于该任务)以及可选的交叉验证分组键(group__<task>,用于需要按患者/供体分组的数据集)。数据规模从少量样本(n≤100)到数千样本不等,例如 GTEx 的端粒长度任务(n=3940)和 TCGA 的癌症分期任务(n=5206)。该基准测试特别适用于评估基础模型在转录组学数据上的泛化能力,并提供了标准化的加载和交叉验证流程。

This dataset is a batch RNA-seq benchmark for evaluating foundation models, derived from 38 public datasets, consolidated into 58 prediction tasks (25 regression tasks, 33 classification tasks). The tasks cover clinical outcome prediction (e.g., treatment response, recurrence, survival, drug sensitivity, staging, and molecular phenotypes) and diagnostic prediction (e.g., presence/absence or type of disease/infection). Each dataset is stored in Parquet file format, with each row representing a sample, containing sample identifier (sample_id), gene expression matrix (gene symbol columns, log1p scale, non-negative), task label column (y__<task>, NaN indicates the sample does not belong to the task), and optional cross-validation grouping key (group__<task>, used for datasets requiring grouping by patient/donor). Data sizes range from small samples (n≤100) to thousands, e.g., GTEx telomere length task (n=3940) and TCGA cancer staging task (n=5206). This benchmark is particularly suitable for evaluating the generalization ability of foundation models on transcriptomics data, and provides standardized loading and cross-validation workflows.

创建时间:
2026-08-18
原始信息汇总

数据集概述

Bulk-RNA-Seq-Benchmark 是一个用于基础模型评估的批量 RNA 测序(Bulk RNA-seq)基准数据集,包含 58 个任务(25 个回归任务,33 个分类任务),覆盖 38 个数据集,领域涉及临床结局预测、诊断以及生物学/药理学表型分析。

数据格式

  • 每个数据集对应 data/ 目录下的一个 Parquet 文件。
  • 每一行代表一个样本,列包括:
    • sample_id:样本编号(如 GSM 编号、细胞系或供体 ID)。
    • 基因列:原生表达矩阵,以基因符号为列名。
    • y__<task>:每个任务对应的标签列,NaN 表示该样本不属于该任务的队列。任务复现时需筛选该列非 NaN 的行。
    • group__<task>:用于分组交叉验证(如供体/患者)的分组键。
  • 所有表达数据均为 log1p 尺度,非负值:大部分为 log1p-CPM,GTEx 为 log1p,CMP 和 GSE81538 从原始线性 TPM/log2 尺度转换而来。

数据加载示例

python import pandas as pd df = pd.read_parquet("data/CMP.parquet") y = df["y__ic50_Bortezomib"] mask = y.notna() X = df.loc[mask, [c for c in df.columns if not c.startswith(("y__", "group__", "sample_id"))]] y = y[mask]

交叉验证分割

大部分数据集每个受试者只有一个样本,可随机分割。以下数据集包含同一患者/供体的多个样本,必须使用 group__<task> 列进行分组分割(如 GroupKFold / StratifiedGroupKFold),避免同受试者跨折泄漏:

BeatAMLCPTACGSE107995GSE156902GSE157657GSE193677GSE243375GSE278476GSE279480GTExTARGETTCGA

python from sklearn.model_selection import GroupKFold groups = df.loc[mask, "group__ajcc_stage_4"] for tr, te in GroupKFold(5).split(X, y, groups): ...

任务目录

A 类——临床与生物学结局预测

涵盖治疗反应、复发、生存、药物敏感性、分期及分子表型。

小型任务(n ≤ 100)

以下 16 个数据集各包含 1 个任务,任务类型包括分类(如 systemic_recurrencerelapsechemo_response 等)和回归(如 prednisolone_lc50hospital_free_days),样本量从 30 到 99 不等,涉及结直肠癌、白血病、肺癌、膀胱癌、卵巢癌、COVID-19、结核病、类风湿关节炎、黑色素瘤、前列腺癌等疾病。

中型任务(n > 100)

以下 12 个数据集包含 1 至 10 个任务不等:

  • BeatAML:10 个回归任务,预测 10 种靶向药物的体外药物敏感性(AUC),样本量 277 至 492。
  • CMP:10 个回归任务,预测 10 种不同作用机制药物的 IC50,样本量 1177 至 1202。
  • GSE109142:1 个分类任务,预测小儿溃疡性结肠炎第 4 周临床缓解,n=198。
  • GSE112927:1 个分类任务,预测移植肾丢失,n=235。
  • GSE163882:1 个分类任务,预测乳腺癌新辅助化疗病理完全缓解(pCR),n=217。
  • GSE185263:1 个分类任务,预测脓毒症院内死亡率,n=345。
  • GSE193677:1 个分类任务,预测 IBD 组织学缓解,n=1301。
  • GSE243375:1 个分类任务,预测 HER2+ 乳腺癌新辅助治疗 pCR,n=242。
  • GSE51799:1 个回归任务预测 CAG 重复数,1 个分类任务预测突变携带状态,n=124。
  • GSE93624:1 个分类任务,预测小儿克罗恩病 3 年复杂进展,n=245。
  • GSE175718:1 个 4 分类任务,区分肾移植排斥类型,n=234。
  • GSE107995:1 个 4 分类任务,预测结核病未来状态,n=414。

B 类——诊断预测

从转录组预测疾病/感染存在或类型。

共计 11 个数据集:

  • CPTAC:分类任务,预测 AJCC 病理分期(I–IV),n=2464。
  • GSE156902:4 分类任务,区分 GBM/脑转移/多发性硬化/对照,n=642。
  • GSE234297:分类任务,ALS vs 健康诊断,n=144。
  • GSE234587:分类任务,疟疾寄生虫血症 +/−,n=33。
  • GSE279480:分类任务,CMV 血清状态,n=255。
  • GSE51799:分类任务,亨廷顿病突变携带状态,n=124。
  • GSE68086:7 分类任务,泛癌类型 vs 健康,n=246。
  • GTEx:回归任务,预测端粒长度,n=3940。
  • TARGET:分类任务,小儿神经母细胞瘤 INSS 分期,n=158。
  • TCGA:分类任务,泛癌(33 种)AJCC 病理分期,n=5206。
  • GSE81538:回归任务,预测 Ki67 增殖指数,n=405。
搜集汇总
数据集介绍
Bulk-RNA-Seq-Benchmark 数据集图片
构建方式
该数据集整合了38个公开的Bulk RNA-seq数据集,构建了涵盖58项预测任务的基准测试集,涉及25项回归任务与33项分类任务。每个数据集以Parquet文件格式存储,每行代表一个样本,包含样本ID、基因表达矩阵(log1p尺度)以及针对各任务的标签列和分组列。通过非NaN标签筛选可构建特定任务的数据子集,而分组列则用于需要按供体或患者进行分组交叉验证的任务。所有表达数据均统一为log1p尺度,并确保非负,以利于下游分析。
特点
该基准测试集的特点在于其任务多样性,覆盖临床结局预测、诊断、生物学及药理学表型分析,尤其包含药物敏感性、治疗反应、生存分析等关键临床问题。数据集规模从30到5200余样本不等,兼顾小样本与中等样本任务。特别地,部分数据集包含同一患者或供体的多个样本,需采用GroupKFold等分组交叉验证防止信息泄漏,这为模型评估提供了更严格的协议。
使用方法
使用该数据集时,研究者可通过pandas直接读取Parquet文件,依据任务列筛选样本并提取基因表达特征。对于含多样本的患者或供体,必须依据分组列进行分组交叉验证。数据集附带详尽的任务目录,涵盖临床与生物学表型预测及诊断任务,并提供了示例Python代码,便于快速加载与复现,从而系统评估基础模型在多种转录组学预测任务上的表现。
背景与挑战
背景概述
随着高通量测序技术的迅猛发展,批量RNA测序(Bulk RNA-Seq)已成为解析转录组景观、揭示疾病机制与生物表型的核心工具。然而,尽管基础模型在自然语言处理和计算机视觉领域取得了革命性进展,其在转录组学领域的应用仍受限于缺乏标准化、多任务的基准测试平台。为此,研究人员于近期构建了Bulk-RNA-Seq-Benchmark数据集,旨在弥合这一鸿沟。该数据集汇集了38个公开数据集,涵盖58项预测任务,包括临床结果预测、疾病诊断及生物学/药理学表型分析,由致力于推动基因组学AI评估的机构精心整合。其核心研究问题在于系统评估基础模型在跨数据集、跨任务的泛化能力,为转录组学基础模型的研发提供统一、公正的参照系。该基准的发布预计将深刻影响精准医学与药物反应预测领域,推动下一代可解释、可迁移的组学模型发展。
当前挑战
该数据集所面临的挑战颇为多维。领域层面,批量RNA-Seq数据固有的高维度、小样本量及批次效应使得模型泛化举步维艰,而临床结局预测中的类别不平衡与生存数据的删失特性进一步加剧了建模难度。此外,多数据集间的异质性(如不同平台、处理流程)要求模型具备强大的域适应能力。构建过程中,挑战显著:其一,需统一来自多个来源的表达矩阵,将其转换至log1p尺度并确保非负性,此过程涉及繁琐的标准化流程;其二,任务标签的稀疏性尤为突出,每个数据集仅部分样本具有特定任务的标注,导致有效样本量常常远小于队列总数,增加了训练与评估的复杂度;其三,对于包含多位患者/供体样本的数据集(如TCGA、GTEx),必须实施分组交叉验证,以防止同源样本泄漏,这要求对分组键的精准管理。这些挑战共同构成了对基础模型鲁棒性与可复现性的严苛检验。
常用场景
经典使用场景
Bulk-RNA-Seq-Benchmark数据集作为转录组学领域的基础模型评估基准,其经典使用场景在于对预训练的基础模型进行系统性的下游任务微调与性能评测。研究者利用该数据集覆盖的58项任务(涵盖25项回归与33项分类),在38个公共数据集的基因表达矩阵上,对不同架构的模型(如Transformer、图神经网络等)进行泛化能力检验。这一基准设计特别强调对样本分组的严格遵循,例如在涉及多采样点(如患者多次活检)的数据集中,必须采用GroupKFold或StratifiedGroupKFold划分,以避免因个体泄漏导致的性能虚高,从而确保评估结果的科学严谨性。
衍生相关工作
本数据集发布后,已衍生出多项具有影响力的相关工作。一方面,研究团队基于其任务集合开发了新的评估协议,例如统一采用GroupKFold划分以避免数据泄漏,并公开了基线模型(如线性模型、随机森林)在58项任务上的性能分数,这些结果成为后续模型对比的参考点。另一方面,该数据集激发了针对小样本临床队列的元学习(meta-learning)和预训练-微调策略的研究,推动了如scBERT、Geneformer等基础模型在批量RNA-seq领域的适配与优化。此外,部分工作专注利用该基准测试不同批次校正方法(如ComBat-seq、Harmony)对模型性能的影响,或探索多任务联合训练在提高泛化性方面的潜力,从而进一步丰富了转录组学基础模型的评估生态。
数据集最近研究
最新研究方向
该数据集构建了迄今规模最大的批量RNA-seq基础模型评估基准,整合38个数据集、58项任务,覆盖临床结局预测、诊断及生物学/药理学表型分析。其前沿研究方向聚焦于利用基础模型从转录组中提取泛化特征,以应对小样本临床队列的预测挑战,并强调通过群体感知交叉验证策略规避患者间信息泄漏。这一基准的发布推动了可迁移的转录组学表征学习在精准医学中的落地,为药物反应、复发风险及疾病分型等关键临床问题提供了标准化评估平台,成为衡量基础模型生物学洞察力的重要标尺。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务