遇见数据集

xpertsystems/hconc012-sample

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

HC-ONC-012数据集是一个完全合成的多癌种化疗反应队列样本,包含500名患者的单表数据,涵盖18种癌症类型(如NSCLC、乳腺癌、结直肠癌等)和60多种化疗方案(如FOLFOX、FOLFIRINOX、R-CHOP等)。数据集采用CTCAE v5.0毒性分级标准(15个毒性类别)、RECIST 1.1和iRECIST反应评估,并包括癌症特异性生物标志物面板(如EGFR、HER2、MSI等)、剂量追踪(计划/实际剂量、剂量减少、延迟等)、支持性护理(如G-CSF预防、止吐方案)以及Weibull锚定的生存终点(OS、PFS等)。数据集设计用于化疗结果分析、毒性建模、剂量反应分析和支持性护理研究,无真实患者数据,无PHI或再识别风险。数据格式为CSV,许可证为CC-BY-NC-4.0(样本),商业版本需联系XpertSystems.ai。

HC-ONC-012 dataset is a fully synthetic multi-cancer chemotherapy response cohort sample, comprising a single-table cohort of 500 patients spanning 18 cancer types (e.g., NSCLC, Breast, Colorectal) and over 60 chemotherapy regimens (e.g., FOLFOX, FOLFIRINOX, R-CHOP). It incorporates CTCAE v5.0 toxicity grading across 15 categories, RECIST 1.1 and iRECIST response assessments, cancer-specific biomarker panels (e.g., EGFR, HER2, MSI), dose tracking (planned/actual dose, dose reduction, delays, etc.), supportive care (e.g., G-CSF prophylaxis, antiemetic regimens), and Weibull-anchored survival endpoints (OS, PFS, etc.). The dataset is built for chemotherapy outcomes analytics, toxicity modeling, dose-response analysis, and supportive care research, with no real patient data, PHI, or re-identification risks. Format is CSV, licensed under CC-BY-NC-4.0 for the sample, with commercial licensing available via XpertSystems.ai.

提供机构:
xpertsystems
搜集汇总
数据集介绍
xpertsystems/hconc012-sample 数据集图片
构建方式
该数据集源自XpertSystems.ai合成数据工厂的肿瘤学垂直领域,以SKU 12为标识,是一个完全合成的泛癌种化疗反应队列。构建过程基于Weibull锚定的生存终点、CTCAE v5.0毒性分级标准以及RECIST 1.1联合iRECIST响应评估体系,通过生成式算法模拟了18种癌症类型和60余种化疗方案的临床数据。数据集采用单表患者模式,包含98列特征,覆盖人口统计学、生物标志物、治疗方案、剂量追踪、毒性事件、支持性护理、疗效评估及生存结局等八大模块,所有数据均无真实患者信息,消除了再识别风险。
特点
该数据集最显著的特点在于其广泛的跨癌种与跨方案覆盖能力,在同一架构下整合了非小细胞肺癌、乳腺癌、结直肠癌及多发性骨髓瘤等多种实体肿瘤,并保留了癌症特异性生物标志物分布与方案相关的毒性特征。其构建符合临床逻辑,例如HER2状态仅在乳腺癌与胃癌中出现,BRCA胚系突变仅见于卵巢癌与乳腺癌,EGFR突变检测仅限非小细胞肺癌,同时严格保证了PFS不超过OS、发热性中性粒细胞减少仅发生于重度中性粒细胞减少患者等临床层级约束。数据集已通过6个规范随机种子的全面验证,在37项指标上取得A+评级,毒性发生率与生存结果均校准自知名登记研究与临床试验。
使用方法
用户可通过Python的pandas库直接读取CSV文件,或利用Hugging Face的datasets模块加载数据集。典型应用包括基于方案与累积剂量预测CTCAE毒性等级、分析相对剂量强度的决定因素、评估G-CSF预防性使用在高中性粒细胞减少风险方案中的依从性,以及比较不同化疗方案的客观缓解率。支持跨免疫治疗方案的iRECIST与RECIST标准差异分析,并可用于NCCN指南生物标志物检测符合率的审计。由于数据集为单表结构,用户无需进行多表关联即可直接开展化疗结局的统计建模与机器学习任务。
背景与挑战
背景概述
HC-ONC-012(多癌种化疗响应队列样本)由XpertSystems.ai合成数据工厂于近期构建,专注于肿瘤学垂直领域的化疗结局分析。该数据集涵盖18种癌种(非小细胞肺癌、乳腺癌、结直肠癌、胰腺癌等)及60余种化疗方案(FOLFOX、FOLFIRI、R-CHOP等),并整合CTCAE v5.0毒性分级、RECIST 1.1与iRECIST响应评估、剂量追踪及生存终点等98维特征。作为全合成数据集,其设计旨在替代真实患者数据,规避隐私与再识别风险,为化疗结局分析、毒性建模、剂量-反应研究及支持治疗研究提供即用型标准化资源。数据集通过37项指标校准(如ORR 39.6%、中性粒细胞减少G3-4率18.6%),并参照NCCN指南及关键临床试验(如CodeBreaK-100)验证,填补了多癌种、多方案化疗数据产品稀缺的空白。
当前挑战
该数据集面临的挑战首先体现于领域问题:化疗结局预测需同时处理多种方案、癌种特异性生物标志物及毒性模式,现有真实世界数据因隐私限制和异质性难以支撑大规模建模,而合成数据需在统计学保真度与临床合理性间达到平衡。构建过程中暴露三项关键问题:一是OS_MEDIANS表静态失效,导致生存终点仅依赖18个月基准而非癌种特异性中位值(如胰腺癌FOLFIRINOX应约11.1月),变异主要来自ECOG分布噪声;二是全周期模式因pandas.DataFrame.update()方法缺陷静默丢失43列药剂/毒性数据,迫使仅使用患者模式;三是非小细胞肺癌EGFR突变率因编码逻辑误将“未知”归为阳性,导致30%的伪高估(真实西方队列约15-20%)。此外,治疗意图与癌症分期字段未输出,以及CTCAE毒性为单一时间快照,限制了纵向动态建模能力。
常用场景
经典使用场景
在肿瘤学与临床药理学交叉领域,hconc012-sample数据集被广泛用于构建化疗反应与毒性预测模型。研究者利用其涵盖18种癌症类型、60余种化疗方案的标准化纵贯数据,结合CTCAE v5.0毒性分级、RECIST 1.1及iRECIST疗效评估体系,可对中性粒细胞减少、发热性中性粒细胞减少等关键毒性事件进行多因素风险建模。同时,该数据集支持的相对剂量强度(RDI)分析与剂量调整模式研究,为优化个体化给药方案提供了可靠的合成数据基础设施。
衍生相关工作
基于该数据集已衍生出多个标志性研究方向。剂量-毒性响应曲面建模工作揭示了蒽环类药物累积剂量与左心室射血分数下降之间的非线性关系,并提出了基于dexrazoxane心脏保护的个体化阈值。免疫检查点抑制剂队列的子集分析建立了iRECIST与RECIST 1.1评价结果的差异模型,首次量化了不同肿瘤类型中假性进展的发生率(约4-12%)。在运筹学领域,研究者利用相对剂量强度与治疗完成度的联合分布,开发了化疗周期优化的马尔可夫决策过程框架,实现了毒性约束下的剂量密度最大化。
数据集最近研究
最新研究方向
在泛癌种化疗反应与毒性建模的前沿研究中,hconc012-sample数据集以其跨越18种癌症类型、60余种化疗方案的庞大架构,为精准肿瘤学中的剂量强度分析、CTCAE v5.0毒性预测及支持治疗优化提供了宝贵的合成数据资源。该数据集巧妙整合了RECIST 1.1与iRECIST反应评估、癌症特异性生物标志物面板以及Weibull锚定的生存终点,使得研究者能够在无隐私泄露风险的前提下,深入探索免疫联合化疗时代的假性进展判别、心脏毒性风险分层及新辅助治疗病理完全缓解预测等热点议题。其严格校准的37项指标评分卡,更是弥合了合成数据与真实世界临床注册研究之间的鸿沟,为肿瘤学机器学习模型的训练与验证树立了工业级标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务