遇见数据集

PerturbQA

收藏
arXiv2025-09-30 收录
官方服务:

资源简介:

该数据集是对扰动实验的结构化推理的基准,重点关注对未见扰动条件下差异表达预测和变化方向的研究,同时包含基因集富集分析。该数据集还包括对最先进的机器学习和统计方法在建模扰动方面的评估,强调在此领域需要改进方法。任务涵盖了差异表达预测、变化方向预测以及基因集富集分析。

This dataset serves as a benchmark for structured reasoning in perturbation experiments, focusing on the prediction of differential expression and direction of expression changes under unseen perturbation conditions, and also includes gene set enrichment analysis. It further encompasses evaluations of state-of-the-art machine learning and statistical methods for perturbation modeling, emphasizing the critical need for improved methodologies in this field. The covered tasks include differential expression prediction, direction-of-change prediction, and gene set enrichment analysis.

提供机构:
Genentech
搜集汇总
数据集介绍
构建方式
在生物医学领域,湿实验标签的稀缺性长期制约着大规模推理数据集的构建。PerturbQA数据集正是为了应对这一挑战而生,其构建方式摒弃了对真实标签的依赖,转而利用模型内在的不确定性信号进行数据筛选。具体而言,针对每个细胞类型-扰动-基因三元组,研究者首先使用前沿大语言模型采样多条链式思维推理轨迹,涵盖一条贪心解码轨迹与多条高温采样轨迹。随后,通过整合语义一致性与预测困惑度的混合不确定性指标CoCoA,对每条推理轨迹进行质量评估。最终,在每个类别内部保留不确定性最低的10%的轨迹,从而在无需任何湿实验标签的前提下,获得高质量、类别平衡的合成推理数据集。
特点
PerturbQA数据集的核心特征在于其开创性的标签无关性与内在质量保障机制。不同于传统依赖外部验证的合成数据,该数据集完全基于模型自身的置信度信号进行筛选,使数据质量随不确定性降低而单调提升,准确率从完整数据集的0.42跃升至保留1%数据的0.49。尤为突出的是,其按类别过滤的策略有效纠正了类别间不确定性尺度的差异,使得少数类别的F1分数获得显著改善。此外,混合不确定性指标CoCoA的采用超越了单一信号的效果,在保持数据规模精简的同时,确保了推理链条的生物学合理性与最终预测的可靠性。
使用方法
PerturbQA数据集的使用方法极为直接且高效,适用于标签稀缺场景下的模型训练与评估。使用者可直接将过滤后的低不确定性推理轨迹作为监督微调的训练语料,指导基础大语言模型同时学习推理过程与最终预测。该数据集已提供标准的训练集与测试集划分,便于复现与公平比较。在具体应用中,研究者可基于CoCoA指标灵活调整保留比例,平衡数据质量与数量。实验表明,仅使用10%的过滤后数据(约4800条样本)进行微调,即可获得超越全量未过滤数据训练的效果,显著缩小了与完全监督训练之间的性能差距。
背景与挑战
背景概述
PerturbQA数据集由Novo Nordisk与牛津大学的研究团队于2025年联合创建,聚焦于生物学扰动预测这一核心领域问题。该数据集以自然语言三元组(细胞类型、扰动、基因)的形式,将基因表达变化预测任务转化为语言模型可处理的多分类问题,旨在评估模型对扰动后基因上调、下调或不变三类状态的推理能力。通过构建包含48,000条合成推理轨迹的基准,PerturbQA不仅为细胞扰动预测提供了标准化评估平台,更揭示了湿实验标签稀缺背景下,合成数据质量与模型泛化性能之间的深层关联,对药物发现与疾病建模领域产生了重要推动作用。
当前挑战
PerturbQA所面临的挑战首先体现在领域问题层面:生物学扰动预测需处理高度非线性的基因调控网络,且湿实验标签成本高昂,导致传统监督学习方法难以规模化应用。其次,在数据集构建过程中,合成推理轨迹的质量控制成为关键瓶颈——模型生成的轨迹可能包含事实性错误或逻辑偏差,而缺乏真实标签使得筛选高质量样本尤为困难。此外,类别不平衡问题(非调控类占主导)进一步加剧了数据过滤的复杂性,如何在无标签条件下平衡各类别代表性并剔除低置信度推理,成为提升合成数据集效能的核心技术挑战。
常用场景
经典使用场景
PerturbQA 数据集的核心经典使用场景在于评估和提升大型语言模型在生物扰动预测任务中的推理能力。该数据集将细胞类型、扰动方式(如基因敲除或药物处理)与目标基因表达变化(上调、下调或无变化)构建为自然语言三元组,为模型提供了结构化的推理测试环境。研究者通常利用该数据集,通过链式思维(Chain-of-Thought)提示来生成合成推理轨迹,并基于不确定性过滤技术筛选高质量数据,以训练模型在缺乏湿实验标签的条件下,仍能准确预测基因调控结果,从而验证无标签推理方法的有效性。
实际应用
在实际应用中,PerturbQA 数据集为药物研发和疾病建模领域提供了关键支撑。通过训练大型语言模型在无标签条件下准确预测基因扰动后的表达变化,研究人员能够快速筛选候选药物靶点或评估基因编辑效果,大幅减少对昂贵且耗时的湿实验的依赖。例如,在早期药物发现阶段,该数据集驱动的模型可模拟不同化合物对细胞通路的影响,从而优先验证最有潜力的分子。此外,该数据集还可用于个性化医疗,通过分析患者特异性基因变异,预测治疗响应,加速精准医学的落地进程。
衍生相关工作
PerturbQA 数据集的提出催生了一系列经典衍生工作,尤其在无监督推理数据构建领域。例如,SynthPert 方法借鉴了该数据集的扰动预测框架,通过标签条件化的合成推理轨迹增强模型泛化能力。此外,基于不确定性过滤的思想被扩展到其他标签稀缺领域,如药物相互作用预测和单细胞转录组分析。更广泛地,该数据集启发了针对大型语言模型的不确定性量化研究,如 CoCoA 混合度量方法,推动了自一致性与困惑度联合评估在数据筛选中的应用,为构建高效、可靠的合成训练数据树立了标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务