遇见数据集

TCGA-SurvReport

收藏
arXiv2026-08-17 更新2026-08-19 收录
数据链接:
官方服务:

资源简介:

TCGA-SurvReport是一个由香港科技大学构建的综合性癌症生存预测基准数据集,整合了六个TCGA队列的病理、临床和分子证据,形成统一的患者报告文本。该数据集包含大量右删失样本(超过60%),旨在为报告为中心的生存分析提供标准化评估平台。数据集的创建通过从TCGA获取原始记录,并结构化组织为可供大语言模型直接处理的报告格式。该数据集用于评估生存预测模型的排序一致性,尤其适用于解决删失数据下的相对预后排序问题,推动语言模型在临床预后中的可靠应用。

TCGA-SurvReport is a comprehensive cancer survival prediction benchmark dataset constructed by The Hong Kong University of Science and Technology, which integrates pathological, clinical and molecular evidence from six TCGA cohorts to form unified patient report texts. This dataset contains a large number of right-censored samples (over 60%), and aims to provide a standardized evaluation platform for report-centric survival analysis. The dataset is created by acquiring original records from TCGA and structuring them into report formats that can be directly processed by large language models. It is used to evaluate the ranking consistency of survival prediction models, and is particularly suitable for solving the relative prognostic ranking problem under censored data, so as to promote the reliable application of language models in clinical prognosis.

提供机构:
香港科技大学
创建时间:
2026-08-17
原始信息汇总

CACSurv 数据集概述

CACSurv 是一个与癌症生存预测研究相关的数据集,其全称为 Concordance-Aligned Comparative Learning with Large Language Models for Cancer Survival Prediction,即“基于大型语言模型的一致性对齐比较学习用于癌症生存预测”。该数据集是论文《CACSurv: Concordance-Aligned Comparative Learning with Large Language Models for Cancer Survival Prediction》的官方配套资源。

该数据集的详情页面地址为:https://github.com/xmed-lab/CACSurv

目前,该数据集的代码、模型以及数据集本身尚未公开发布,将在后续版本中逐步放出。因此,当前阶段该数据集暂不可直接获取或使用。

如需了解更多信息,建议持续关注该 GitHub 仓库的更新动态。

搜集汇总
数据集介绍
TCGA-SurvReport 数据集图片
构建方式
TCGA-SurvReport数据集的构建基于六大TCGA癌症队列(BLCA、BRCA、COADREAD、HNSC、LUAD和STAD),整合了病理文本、临床记录和分子谱数据。原始病理报告经过Qwen2.5-72B-Instruct的抽取式处理,剔除冗余内容并统一为结构化患者报告,同时确保不引入源记录中缺失的医学信息。存活时间与生命状态作为独立标签保留,不纳入统一报告中。最终保留了具有有效报告和生存记录的病例,各队列统计特征如图3所示。
使用方法
使用TCGA-SurvReport时,可将患者报告作为大语言模型的唯一输入,用于报告中心的生存预测任务。模型需处理成对或三元组的迷你队列,并预测患者间的相对生存排序。训练阶段利用一致性对齐奖励和GRPO优化模型,而推理阶段采用蒙特卡洛参考聚合,通过与参考患者的多轮比较获得稳定的队列级排名。数据集支持五折交叉验证,便于与其他方法进行公平对比。
背景与挑战
背景概述
TCGA-SurvReport是由香港科技大学Xiang等人构建的面向报告中心癌症生存预测的基准数据集,涵盖膀胱癌、乳腺癌、结直肠癌、头颈癌、肺癌和胃癌六种TCGA队列。该数据集将病理、临床和分子证据整合为统一的结构化患者报告,开创了以文本报告作为核心输入的生存预测范式。其创建源于对现有方法过度依赖结构化数据或全切片图像而忽视患者报告潜力的洞察,旨在推动大语言模型在预后分析中的应用。通过提供标准化且经过事实核验的报告,该基准为评估语言模型在生存预测中的推理能力建立了新标杆,对个性化医疗和临床决策支持具有深远影响。
当前挑战
该数据集面临双重挑战。在领域层面,生存预测本质上是排序问题而非数值回归,传统C-index评估关注患者间预后顺序,而直接时间回归难以保证排序一致性;同时,右删失数据占比较高,仅表示患者存活超过随访时间,无法作为精确回归目标,但蕴含部分排序信息,需设计合理的监督方式。在构建层面,原始病理报告格式混杂、含冗余内容,需借助LLM进行提取性清洗和结构化,并严格保证事实一致性,避免引入源记录未包含的诊断或预后信息;此外,多源数据(OCR病理文本、临床记录、分子谱)的整合及患者匹配也构成技术挑战。
常用场景
经典使用场景
TCGA-SurvReport作为一项面向癌症生存预测的基准数据集,其核心使用场景在于支持以患者报告为直接输入的报告中心生存分析。该数据集整合了来自六个TCGA癌种队列的病理、临床及分子信息,形成统一的患者报告文本,为大型语言模型(LLM)提供丰富的预后推理依据。研究者可利用该基准评估模型在相对预后排序任务上的表现,通过比较同一癌种内患者的生存时长,直接检验模型对疾病进展、治疗反应及个体差异的捕获能力,从而推动从绝对时间回归向一致性排序预测的范式转变。
解决学术问题
该数据集有效解决了现有生存预测研究中患者报告利用不足的问题,并针对传统时间回归范式与生存评估指标之间的错配提出系统性方案。通过引入右删失条件下的部分排序监督,TCGA-SurvReport缓解了删失数据无法提供精确事件时间而导致的训练信号缺失,同时支持基于一致性指数的评估框架,使模型优化目标与临床评价标准高度统一。这一设计不仅提升了生存预测的准确性,也为LLM在医学预后分析中的可靠应用奠定了方法论基础。
实际应用
在实际应用中,TCGA-SurvReport所支持的报告中心生存预测模型可辅助临床决策,例如用于癌症患者的风险分层、治疗方案选择及随访管理。通过自动解析病理报告、临床记录和分子特征,模型能够为医生提供个体化的预后评估,帮助识别高风险患者并优化资源配置。此外,该数据集还可用于开发患者教育工具或临床试验筛选系统,提升肿瘤诊疗的精准性和效率。
数据集最近研究
最新研究方向
TCGA-SurvReport数据集的构建标志着癌症生存预测领域正经历从多模态表征学习向以患者报告为核心、以相对排序为范式的深刻转变。该基准整合了六个TCGA癌种队列的病理、临床及分子信息,为评估大语言模型在报告中心场景下的预后判别能力提供了统一平台。前沿研究聚焦于利用语言模型的推理优势,通过小型队列内的比较推理取代传统的绝对时间回归,并引入符合删失约束的一致性对齐奖励,以弥合公式化预测与审查监督之间的结构性错配。蒙特卡洛参考聚合机制进一步将比较结果转化为稳定的队列级排序,显著提升了C指数。这一方向不仅挖掘了非结构化文本中蕴含的丰富预后证据,更推动了生存分析评价体系与生成式模型训练目标的内在统一,为精准肿瘤学的智能化决策开辟了兼具理论深度与临床转化潜力的新路径。
相关研究论文
  • 1
    CACSurv: Concordance-Aligned Comparative Learning with Large Language Models for Cancer Survival Prediction香港科技大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务