遇见数据集

xpertsystems/hconc014-sample

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

HC-ONC-014转移性癌症队列数据集是来自XpertSystems.ai合成数据工厂的样本数据集(500名患者的单表队列),属于肿瘤学垂直领域的第14个SKU(最终版)。这是一个完全合成的转移性癌症队列,涵盖13种转移性癌症类型(乳腺癌转移20%、非小细胞肺癌转移18%、结直肠癌转移14%等),具有12个器官趋向性矩阵、同步与异时转移、按癌症类型划分的全面生物标志物面板、4线治疗序列、获得性耐药机制、寡转移定向局部治疗、骨改良剂、全面的支持性护理以及基于Weibull锚定的生存终点。该数据集设计用于转移性癌症结果分析、治疗序列建模、寡转移干预研究和姑息治疗质量基准测试,同时保持100%合成性——无真实患者数据、无PHI、无重新识别风险。

Sample dataset (500-patient single-table cohort) from the XpertSystems.ai Synthetic Data Factory — Oncology vertical, SKU 14 (FINAL). A fully synthetic metastatic cancer cohort spanning 13 metastatic cancer types with 12-organ tropism matrices, synchronous vs metachronous metastasis, comprehensive biomarker panels by cancer type, 4-line treatment sequences with biomarker-routed regimens, acquired resistance mechanisms, oligometastatic-directed local therapy, bone-modifying agents, comprehensive supportive care, and Weibull-anchored survival endpoints. Built to be drop-in usable for metastatic cancer outcomes analytics, treatment sequencing modeling, oligometastatic intervention research, and palliative care quality benchmarking while remaining 100% synthetic — no real patient data, no PHI, no re-identification risk.

提供机构:
xpertsystems
搜集汇总
数据集介绍
xpertsystems/hconc014-sample 数据集图片
构建方式
该数据集源自XpertSystems.ai合成数据工厂的肿瘤学垂直领域,是系列14个SKU中的最终产品,专注于转移性癌症领域。其构建基于对13种转移性癌症类型(包括乳腺癌、非小细胞肺癌、结直肠癌等)的全面建模,并整合了12器官趋向性矩阵(依据Disibio 2008尸检系列校准)、生物标志物面板(如EGFR、ALK、HER2等)、4线治疗方案序列及获得性耐药机制。通过Weibull分布锚定至里程碑式临床试验(如CLEOPATRA、KEYNOTE-189等)的生存终点,并使用结构化约束(如100%性别与癌症类型耦合、100%同步转移者定义为IV期)确保临床逻辑一致性。最终生成了一个包含500名患者、109列属性的单表扁平化队列,并以CSV格式提供。
特点
该数据集的核心特点在于其高度综合性且临床一致性极强。它跨越了13种转移性癌症类型,覆盖了12个器官部位的转移模式,并纳入了从人口统计学、肿瘤负荷到生物标志物、局部治疗、姑息护理及生存结果的五大模块。所有变量均依据RECIST 1.1、AJCC第8版及NCCN 2024指南构建。特别值得关注的是,该数据集严格通过了14项零违规结构验证(如前列腺癌男性100%、卵巢癌女性100%),并在器官趋向性比例(如乳腺癌骨转移约70%)和关键临床试验生存期(如HER2+转移性乳腺癌中位OS 53-59个月)上实现了高精度校准,同时完全合成、不含真实患者数据或PHI。
使用方法
该数据集设计为即插即用,适用于转移性癌症结局分析、治疗序列优化及寡转移干预研究等场景。用户可通过pandas直接加载CSV文件,或使用Hugging Face的`datasets`库快速导入。示例应用包括:使用Kaplan-Meier方法绘制不同癌症类型的总生存曲线;通过分组分析比较寡转移患者接受局部治疗(如SBRT)与未接受者的中位生存期;统计一线至二线治疗响应变化;或审计骨转移患者中骨修饰剂(地舒单抗vs唑来膦酸)的使用率。所有分析均可基于单表结构高效执行,且附带完整验证报告以支撑基准复现。
背景与挑战
背景概述
在肿瘤学研究中,转移性疾病是导致约90%癌症死亡的主要原因,也是肿瘤治疗支出中最庞大的部分,然而由于治疗序贯、寡转移干预、器官特异性嗜性及姑息治疗决策间复杂的相互作用,该领域的数据建模始终是重大挑战。XpertSystems.ai于近期推出的HC-ONC-014数据集,是该公司肿瘤学垂直领域14个SKU系列中的最终版本,由XpertSystems.ai研究团队创建,旨在为转移性癌症结局分析、治疗序贯优化及姑息治疗质量基准测试提供合成数据支持。该数据集覆盖13种转移性癌症类型、12器官嗜性矩阵、基于标志性临床试验校准的生存终点以及完整的治疗线序贯,其发布为医学研究者提供了一个无需隐私顾虑即可探索晚期肿瘤复杂演化逻辑的宝贵资源。
当前挑战
该数据集所面对的领域挑战首先在于转移性癌症建模的复杂性,包括治疗线序贯动态调整、器官特异性转移模式预测、寡转移与广泛转移分类边界模糊、以及获得性耐药机制对疗效和生存的影响,同时还需整合姑息治疗质量与骨修饰药物使用等临床敏感性指标。在构建过程中,挑战体现于将13种癌症的嗜性模式精确对齐尸检系列数据、确保结构性约束(如性别与癌症类型的耦合、同步转移定义)的零违规,以及校准生存终点以匹配CLEOPATRA、KEYNOTE-189等里程碑临床试验的OS基准。此外,生成器默认的转移负荷阈值设定导致数据集内寡转移患者比例异常偏高(约73%),而弥漫性转移患者比例近乎为零,这一校准偏差成为影响其真实临床分布代表性的关键局限。
常用场景
经典使用场景
在肿瘤学与临床数据分析的交汇领域,hconc014-sample数据集为研究者提供了一个全面且精细的转移性癌症合成队列。该数据集涵盖了13种转移性癌症类型、12种器官趋性模式以及多达六线的治疗序列记录,使其成为开展转移性癌症预后建模与治疗路径分析的理想起点。科研人员可借此数据集拟合Cox比例风险模型,评估不同癌种、生物标志物状态、体力状况评分及转移负荷类别对总生存期的影响,从而在合成环境下复现诸如CLEOPATRA、KEYNOTE-189等里程碑式临床试验的生存结局。此外,其单表扁平化结构使得数据加载与初步分析极为便捷,特别适合作为教学与培训场景中的规范化数据集,用于培养医学肿瘤学与机器学习交叉领域人才对晚期疾病建模的基本技能。
解决学术问题
该数据集精准回应了转移性癌症研究中长期存在的核心学术困境:真实世界数据获取困难、患者隐私保护严格以及样本量不足所导致的统计效能低下。通过构建一个经Disibio 2008尸检系列与多项行业标杆试验锚定校准的合成队列,研究者首次获得了一个同时具备器官趋性层次结构、生物标志物分层驱动、寡转移局部干预细节以及获得性耐药机制的标准化数据资源。这一资源使得学术界得以系统性地探索治疗序列优化策略,衡量不同治疗线数之间转换对总生存的累积效应,并量化立体定向放射治疗或手术切除等局部干预在寡转移患者中的生存获益。由此,该数据集为验证NCCN指南依从性、评估骨改良剂使用模式以及建立姑息治疗质量基准提供了方法论基础,推动了从描述性统计向因果推断过渡的实证研究范式转变。
衍生相关工作
围绕hconc014-sample这一合成队列,学界已衍生出若干具有显著创新性的研究方向与工具开发工作。基于其丰富的生物标志物与治疗序列信息,研究者构建了面向转移性癌症的强化学习治疗策略优化框架,将每一线治疗视作状态转移节点,从而推荐最优的治疗路径。在器官趋性预测方面,该数据集催生了基于图神经网络的转移灶分布预测模型,将12个器官部位视为节点,利用癌症类型与生物标志物特征推断转移模式。此外,数据集的Weibull锚定生存端点设计启发了生存分析领域的校准方法学工作,即如何利用合成数据中的已知真实参数来评估不同生存模型在有限样本下的偏差与方差。在工具链层面,社区已开发出基于该数据集的自动报告生成管线,能够一键输出包含Kaplan-Meier曲线、器官趋性热图及治疗响应级联的验证报告,显著降低了转移性癌症数据分析的技术门槛。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务