遇见数据集

tahoebio/parse-de-rhaister

收藏
Hugging Face2026-06-01 更新2026-06-14 收录
官方服务:

资源简介:

Parse PBMC细胞因子筛选差异表达汇总统计数据,包括12个供体、18种免疫细胞类型和90种细胞因子的差异表达分析。该数据用于训练Rhaister模型,这些统计量是从Arc Institute的ST-HVG-Parse数据集的原始单细胞中计算得出的,包含每个基因的折叠变化、显著性水平和伪批量差异。细胞上下文是(供体,细胞类型)组合,扰动是细胞因子。数据集包含两个表(pdex和cell_eval)以及定义文件(过滤/拆分标准)。pdex表为长格式,每行对应(供体,细胞类型,细胞因子,基因),约7.74亿行,包含折叠变化、p值等列;cell_eval表为宽格式,每行对应(细胞类型,供体,细胞因子),每列对应一个基因的伪批量差异。

Differential-expression summary statistics for the Parse PBMC cytokine screen including 12 donors × 18 immune cell types × 90 cytokines. This data was used to train Rhaister. These are the statistics computed from the raw single cells of the Arc Institute ST-HVG-Parse dataset, including per-gene fold changes, significance, and pseudobulk deltas. The cell context is a (donor, cell type) combination and the perturbation is a cytokine. The repo contains two tables (pdex and cell_eval) plus the dataset-definition files (filtering / split criteria).

提供机构:
tahoebio
搜集汇总
数据集介绍
tahoebio/parse-de-rhaister 数据集图片
构建方式
该数据集基于Arc研究所的ST-HVG-Parse原始单细胞数据,经过严格的差异表达分析流程构建而成。研究团队对12名供体的18种免疫细胞类型施加90种细胞因子刺激,通过Mann-Whitney U检验计算每个基因在治疗组与对照组间的差异表达,并应用Benjamini-Hochberg方法进行多重假设校正。数据集以两种互补格式呈现:pdex表采用长格式存储每基因的log2倍数变化、p值、FDR等统计量,约含7.74亿行记录;cell_eval表则以宽格式记录伪批量表达差异,每行对应一个细胞类型-供体-细胞因子组合,包含约四万个基因的线性尺度差异值。此外,数据集还提供了定义文件来描述过滤与分割标准。
特点
该数据集的核心特点在于其多维度的生物学覆盖与精细的统计表征。涵盖12个供体、18种免疫细胞亚型与90种细胞因子刺激条件,构成层次化实验设计,能够系统解析免疫微环境中细胞因子对特定细胞群体的转录调控效应。数据分为长格式与宽格式两种结构:pdex表提供完整的基因级统计信息,支持细粒度差异表达分析;cell_eval表则便于进行伪批量层面的快速评估。特别地,数据集采用组合式划分策略,确保每个测试上下文与细胞因子在训练集中仍有独立样本,从而避免信息泄露,提升模型泛化评估的可靠性。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集。加载pdex表时,需指定配置名'pdex'并启用流式模式,执行`load_dataset('tahoebio/parse-de-rhaister', 'pdex', streaming=True, split='train')`即可获取每行对应供体-细胞类型-细胞因子-基因组合的差异表达统计。加载cell_eval表类似,使用配置名'cell_eval',将获得宽格式的伪批量差异矩阵,便于进行细胞类型或细胞因子层面的模式挖掘。数据集中包含的definition目录下还存储了数据集定义与划分TOML文件,用户可依据官方提供的训练/测试拆分标准进行模型训练与评估,特别适用于基于细胞上下文与扰动条件的基因表达预测任务。
背景与挑战
背景概述
在单细胞生物学与免疫学交叉领域,解析细胞因子对免疫细胞转录程序的特异性调控是理解免疫应答机制的核心难题。为应对这一挑战,研究人员基于Arc研究所公开的ST-HVG-Parse数据集,构建了parse-de-rhaister数据集。该数据集由Tahoe Bio机构于近期发布,整合了12名供体、18种免疫细胞类型及90种细胞因子扰动下的差异表达统计量,通过计算log2倍数变化、Mann-Whitney U检验p值及伪批量表达差值等指标,系统刻画了免疫微环境中的基因调控网络。作为首个大规模多供体单细胞扰动差异表达资源,该数据集为后续Rhaister模型的训练提供了标准化基准,推动了免疫系统定量建模与个性化干预策略的发展。
当前挑战
该数据集所解决的核心领域问题在于:现有单细胞扰动研究多集中于单一细胞类型或有限因子,缺乏跨供体、跨细胞类型的高维统计对比。构建过程中的挑战包括:其一,需整合12个供体生物学变异与18种免疫细胞类型异质性,导致数据规模达7.74亿行;其二,需在保护隐私前提下设计复杂的留出分裂策略,确保每个细胞上下文与细胞因子组合在训练集中被独立观测;其三,计算伪批量表达差值需对原始单细胞数据进行归一化处理,并处理零膨胀表达矩阵导致的无穷大倍数变化,这对统计鲁棒性提出严苛要求。此外,还需确保跨基因表达量差异的统计可比性,以支撑下游调控网络推断。
常用场景
经典使用场景
在单细胞转录组学与免疫学交叉研究中,parse-de-rhaister数据集凭借其涵盖12名供体、18种免疫细胞类型及90种细胞因子的精细扰动实验设计,成为探索免疫细胞对细胞因子应答的经典资源。研究者利用该数据集中的差异表达统计量,如基因表达倍数变化、Mann-Whitney U检验p值和伪批量表达差值,系统评估特定细胞因子针对不同免疫细胞亚型的转录调控效应。尤其适用于构建扰动响应预测模型,通过跨供体与细胞类型的综合比对,揭示免疫微环境中细胞因子信号网络的复杂异质性,为理解免疫调节机制提供高分辨率数据基础。
实际应用
在实际应用中,parse-de-rhaister数据集为药物研发与精准免疫治疗提供了关键参考。制药企业可依据该数据显示的特定细胞因子对免疫亚群的差异化调控,筛选肿瘤免疫治疗中的靶点细胞因子组合,优化联合用药策略以减少副作用。在临床诊断领域,该数据集辅助构建供体特异性免疫响应基线,使医生能够基于患者免疫细胞类型对细胞因子刺激的敏感度,个体化调整免疫调节方案。此外,生物技术公司利用数据中的伪批量表达变化评估基因编辑或干预措施在免疫细胞中的扰动效果,加速从机制研究向临床转化的迭代过程。
衍生相关工作
基于该数据集,衍生了多项开创性研究工作。其中最具代表性的是Rhaister模型——一种专门针对细胞因子扰动下免疫细胞转录响应预测的深度学习框架,该模型利用pdex表中的基因表达倍数变化与显著性统计进行训练,能够推断未知细胞因子-免疫细胞作用对的差异表达谱。此外,数据集中定义的组成性留出划分策略被后续研究广泛采纳,用于评估模型对未见组合的泛化能力。该数据集还催生了跨供体扰动响应对比分析工具的开发,其定义文件中的过滤与分裂标准为复杂实验设计下的数据拆解提供了标准化范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务