遇见数据集

xpertsystems/hconc011-sample

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

HC-ONC-011是一个多癌症肿瘤进展与生存队列的样本数据集,来自XpertSystems.ai合成数据工厂的肿瘤学垂直领域。这是一个完全合成的泛癌症队列,涵盖10种癌症类型:非小细胞肺癌(NSCLC)、结直肠癌、乳腺癌、胰腺癌、卵巢癌、肝细胞癌(HCC)、前列腺癌、胶质母细胞瘤(GBM)、黑色素瘤和膀胱癌。数据集具有SEER锚定的发病率分布、按癌症类型分期的阶段分布、全面的癌症特异性生物标志物面板(如NSCLC中的EGFR/ALK/ROS1等)、基于生物标志物和癌症分期的现代治疗方案、肿瘤动力学(指数增长和治疗反应)、ctDNA纵向轨迹(基线/3个月/6个月/12个月的VAF)、RECIST 1.1影像评估(3/6/12/24个月)、多器官转移倾向(肝/肺/脑/骨/腹膜)以及基于17项里程碑试验、TCGA泛癌症图谱和SEER 2023校准的OS/PFS终点。数据集设计为可直接用于泛癌症分析、治疗模式建模、多癌症生存基准测试和生物标志物分层建模,同时保持100%合成,无真实患者数据、无PHI、无重新识别风险。样本包含500名患者和73列数据,格式为CSV单表。

HC-ONC-011 is a synthetic cohort dataset for multi-cancer tumor progression and survival, sourced from the oncology vertical of XpertSystems.ai’s Synthetic Data Factory. This is a fully synthetic pan-cancer cohort covering 10 cancer types: non-small cell lung cancer (NSCLC), colorectal cancer, breast cancer, pancreatic cancer, ovarian cancer, hepatocellular carcinoma (HCC), prostate cancer, glioblastoma (GBM), melanoma, and bladder cancer. The dataset features SEER-calibrated incidence distributions, stage distributions stratified by cancer type, comprehensive cancer-specific biomarker panels (e.g., EGFR/ALK/ROS1 in NSCLC), modern treatment regimens stratified by biomarkers and cancer stage, tumor dynamics (exponential growth and treatment response), longitudinal circulating tumor DNA (ctDNA) trajectories (variant allele frequency, VAF, at baseline, 3-month, 6-month, and 12-month time points), RECIST 1.1 imaging assessments at 3, 6, 12, and 24 months, multi-organ metastatic propensity (liver, lung, brain, bone, peritoneum), and overall survival (OS) and progression-free survival (PFS) endpoints calibrated against 17 landmark clinical trials, the TCGA Pan-Cancer Atlas, and SEER 2023 data. This dataset is designed for direct application in pan-cancer analysis, treatment pattern modeling, multi-cancer survival benchmarking, and biomarker-stratified modeling, while remaining 100% synthetic with no real patient data, no protected health information (PHI), and no re-identification risks. It contains 500 patient samples and 73 data columns, formatted as a single CSV table.

提供机构:
xpertsystems
搜集汇总
数据集介绍
xpertsystems/hconc011-sample 数据集图片
构建方式
HC-ONC-011数据集由XpertSystems.ai基于其合成数据工厂生成,面向肿瘤学垂直领域,SKU编号为11。该数据集属于单表结构,包含500名患者的73个变量。生成过程底层调用SEER 2023年肿瘤登记数据库校准肿瘤类型构成与分期分布,并融入TCGA泛癌图谱及KEYNOTE-189、POLO等17项里程碑式临床试验的终点数据,以Weibull分布拟合总生存期与无进展生存期。肿瘤动力学采用指数增长叠加治疗反应模型,ctDNA纵向轨迹和RECIST 1.1影像学评估按固定时间窗口模拟,生物标志物谱参考各癌种权威文献的突变流行率构建,治疗方案的分配严格基于癌症类型与分子标志物适配现行临床指南。
特点
该数据集的核心价值在于将10种高发恶性肿瘤统一纳入同一架构,同时保留癌种特异的生物学特征。涵盖非小细胞肺癌、结直肠癌、乳腺癌、胰腺癌、卵巢癌、肝细胞癌、前列腺癌、胶质母细胞瘤、黑色素瘤与膀胱癌,每种癌症均配备专有的生物标志物面板、组织学亚型与转移倾向。数据集内置结构级质量控制机制,如分期与转移状态的逻辑约束、性别与癌种的严格耦合、PFS不超过OS的时点裁剪,并在六个随机种子下均获得满分10.0的验证评分。同时公开披露了前列腺癌性别分配错误等生成器缺陷,体现高度透明性。
使用方法
该数据集以单表CSV格式提供,可直接被pandas通过read_csv加载,或借助Hugging Face datasets库一键获取。适用于多元任务,包括基于lifelines绘制10种癌症的Kaplan-Meier生存曲线、使用cox回归进行预后标志物发现、利用ctDNA连续数值预测肿瘤进展,以及基于RECIST序列分析构建最佳总体应答分类器。亦可用于R语言survival包中的竞争风险建模或scikit-learn中的多分类管线。对于追求高质量训练数据的机器学习模型,该样本集可直接作为验证集或原型开发基础;完整商业版本支持自定义病例数量和灵活的随访时间配置。
背景与挑战
背景概述
HC-ONC-011是XpertSystems.ai于2026年发布的合成肿瘤学数据集,旨在为泛癌种研究与临床决策支持提供标准化、无隐私风险的模拟数据基底。其核心研究问题聚焦于如何在一个统一的表格架构中,同时囊括非小细胞肺癌、结直肠癌、乳腺癌等10种主要实体瘤的流行病学分布、分子分型、治疗响应及生存预后信息。通过锚定TCGA泛癌图谱、SEER 2023发病率统计及17项里程碑式临床试验终点,该数据集在肿瘤动力学建模、循环肿瘤DNA纵向轨迹模拟、RECIST 1.1影像评估校准等维度实现了高精度还原。作为首个可商用的多癌种全合成队列,它在推动跨癌种分析方法的开发与复现方面具有显著价值,为精准肿瘤学的数据驱动研究提供了坚实的基础设施。
当前挑战
该数据集构建面临的核心挑战首先在于如何在高保真度与生物合理性之间取得平衡。具体而言,需解决跨癌种特异性标记物的无泄漏分配(如确保EGFR驱动突变仅出现在非小细胞肺癌中)、基于癌症类型与分期的生物标志物门控治疗方案映射(如EGFR-TKI与帕博利珠单抗的精准路由),以及多器官转移倾向性建模(如非小细胞肺癌IV期脑转移率约40%)。此外,构建过程自身暴露出诸多工程挑战,包括前列腺癌性别分配缺陷(约50%假性女性)、肿瘤突变负荷与PD-L1 TPS的泛癌种通用分布参数化、以及标准化分级的癌症特异性缺失(如Gleason评分与BCLC分期未独立实现)。这些局限要求后续对生成管线进行生物学优先级重排序与分布参数校准,以提升临床模拟的可靠性。
常用场景
经典使用场景
在肿瘤学与计算医学交叉领域,HC-ONC-011数据集凭借其独特的泛癌种设计,为研究者提供了标准化的多癌种生存分析平台。该数据集涵盖非小细胞肺癌、结直肠癌、乳腺癌、胰腺癌等十种主要恶性肿瘤,并整合了来自SEER与TCGA的标准化分期、生物标志物及治疗信息。其最经典的应用场景是进行泛癌种生存曲线对比,研究者可基于统一的模式轻松绘制不同癌种在IV期患者中的总生存期与无进展生存期曲线,从而揭示癌种间预后差异的生物学基础。此外,该数据集还支持基于RECIST 1.1标准的影像学评估序列分析,有助于探索治疗反应动力学特征与长期预后的关联。
实际应用
在实际应用层面,HC-ONC-011数据集展现出显著的临床转化价值。在药物研发领域,制药企业可利用其生物标志物通路模拟不同分子亚型患者的治疗路径,优化临床试验入组标准的模拟设计。对于医疗机构,该数据集支持构建基于循环肿瘤DNA动态轨迹的疾病进展预测模型,通过基线至12个月的等位基因频率变化曲线,辅助临床医生制定个体化随访策略。在医疗器械与诊断技术验证场景中,它可作为基准测试集,评估新型影像组学算法对RECIST响应分类的判别性能,或检验液体活检panel对不同癌种微小残留病灶的检测灵敏度,从而加速诊断工具的临床落地进程。
衍生相关工作
围绕该数据集衍生的相关工作已形成清晰的研究脉络。基于其生成的模拟真实世界数据,研究者已开展生物标志物指导的治疗路径优化分析,例如验证KRAS-G12C抑制剂在非小细胞肺癌中的生物标志物门控逻辑是否符合NCCN指南推荐。在方法学领域,该数据集催生了面向肿瘤学的时间序列预测模型评估框架,研究者利用其纵向ctDNA浓度与RECIST序列数据,对比了长短时记忆网络与Transformer架构在肿瘤动力学建模中的表现。此外,基于该数据集的多器官转移趋向性结构化标注,已有研究开发了基于图神经网络的转移模式预测模型,能够以高准确率区分不同癌种的转移特异性器官分布规律,为转移性疾病的预防性干预提供计算支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务