遇见数据集

xpertsystems/hconc010-sample

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

HC-ONC-010 — 卵巢癌合成队列(样本)是一个完全合成的上皮性卵巢癌数据集,涵盖所有6种组织类型:高级别浆液性癌(HGSOC,约70%)、低级别浆液性癌(LGSOC,约5%)、透明细胞癌(约8%)、粘液性癌(约5%)、子宫内膜样癌(约10%)和混合/其他类型(约2%)。数据集基于FIGO 2014分期(从IA到IVB子阶段),包含全面的BRCA1/2种系和体细胞分析、通过Myriad myChoice CDx进行的HRD评分、组织类型特异性分子标记(如HGSOC中的TP53标志、粘液性癌/LGSOC中的KRAS等)、叶酸受体α(FRalpha)表达(用于mirvetuximab资格评估)、细胞减灭手术(包括初次减瘤术PDS、间歇减瘤术IDS和二次手术)及其Aletti复杂性评分和残留疾病(R0/R1/R2)状态、CA-125纵向动力学(每患者121个月的月度序列,含Rustin复发标准和HEGP动力学分类)、铂类化疗(含贝伐珠单抗组合)及其RECIST 1.1反应、无铂间期(PFI)和铂敏感性分类、PARP抑制剂维持治疗(如奥拉帕利SOLO-1、尼拉帕利PRIMA等)及其锚定PFS分布、IV型mirvetuximab soravtansine(FRalpha靶向ADC)、Weibull校准的生存终点(OS、PFS、PFI、TTNT、DOR)、复发模式和继发原发性癌症监测。数据集旨在直接用于妇科肿瘤分析、建模、演示和教育,同时保持100%合成,无真实患者数据、无PHI、无重新识别风险。样本包括500名患者的主要队列和500行CA-125 121个月纵向序列,数据格式为CSV,遵循CC-BY-NC-4.0许可。

HC-ONC-010 — Ovarian Cancer Synthetic Cohort (sample) is a fully synthetic epithelial ovarian cancer dataset spanning all 6 histotypes: High-Grade Serous (HGSOC ~70%), Low-Grade Serous (LGSOC ~5%), Clear Cell (~8%), Mucinous (~5%), Endometrioid (~10%), and Mixed/Other (~2%). It incorporates FIGO 2014 staging (IA → IVB with substages), comprehensive BRCA1/2 germline and somatic profiling, HRD scoring via Myriad myChoice CDx, histotype-specific molecular markers (e.g., TP53 hallmark in HGSOC, KRAS in Mucinous/LGSOC), Folate Receptor Alpha (FRalpha) expression for mirvetuximab eligibility, cytoreductive surgery (Primary Debulking PDS / Interval Debulking IDS / Secondary) with Aletti complexity scoring and residual disease (R0/R1/R2), CA-125 longitudinal kinetics (121-month monthly series per patient with Rustin relapse criteria and HEGP kinetic classification), platinum-based chemotherapy (including bevacizumab combinations) with RECIST 1.1 response, Platinum-Free Interval (PFI) and platinum sensitivity classification, PARP inhibitor maintenance (e.g., Olaparib SOLO-1, Niraparib PRIMA) with anchored PFS distributions, IV mirvetuximab soravtansine (FRalpha-targeted ADC), Weibull-calibrated survival endpoints (OS, PFS, PFI, TTNT, DOR), relapse patterns, and secondary primary cancer surveillance. Built to be drop-in usable for gynecologic oncology analytics, modeling, demos, and education while remaining 100% synthetic — no real patient data, no PHI, no re-identification risk. The sample includes a 500-patient primary cohort and 500-row CA-125 121-month longitudinal series in CSV format, licensed under CC-BY-NC-4.0.

提供机构:
xpertsystems
搜集汇总
数据集介绍
xpertsystems/hconc010-sample 数据集图片
构建方式
HC-ONC-010数据集基于XpertSystems.ai合成数据工厂构建,专注于妇科肿瘤学领域的上皮性卵巢癌建模。该样本数据集包含500例患者的主队列和500条CA-125纵向时序数据,每例患者覆盖121个月的月度检测序列。数据集严格遵循FIGO 2014分期标准、RECIST 1.1疗效评估准则及Rustin生化复发判据,病理类型涵盖所有6种上皮性组织学亚型,其中高级别浆液性癌约占70%。每个患者的临床表型、分子特征和治疗路径均通过Weibull校准的生存终点和生物学依赖性规则系统生成,确保数据内部的病理生理一致性。构建过程中引入39项行业级校准指标,将合成队列的统计分布锚定于SEER登记库、关键临床试验及文献报告范围,实现数据质量的多维度验证。
特点
该数据集的核心优势在于其多模态、多层次的综合表征能力。主队列包含118个变量,系统覆盖人口学信息、FIGO分期细节、BRCA1/2胚系与体细胞突变谱、HRD评分、组织学特异性分子标志物(TP53、KRAS、ARID1A等)、叶酸受体α表达水平、细胞减灭术细节、化疗方案与RECIST反应、PARP抑制剂维持治疗路径及全面生存结局。CA-125动力学模块提供长达10年的月度时序数据,涵盖Rustin生化复发判据和HEGP动力学分类。值得注意的是,所有变量间的生物学依赖关系均通过结构性规则精准建模,如BRCA突变与HRD阳性的强关联、铂类敏感性与无铂间隔的关系,以及PARP药物使用与BRCA/HRD状态的逻辑门控。
使用方法
数据集以CSV格式提供两张可直接关联的表格,通过patient_id作为主键连接。用户可使用pandas或Hugging Face datasets库快速加载主队列数据,对于CA-125纵向序列,需通过json.loads解析单细胞中的121个浮点数值数组。数据集适用于多种分析场景,包括基于组织学亚型的Kaplan-Meier生存分析、PARP抑制剂疗效预测建模、细胞减灭术结局预测、CA-125轨迹动力学建模,以及NCCN指南一致性审计。例如,可通过lifelines库实现亚型分层的生存曲线绘制,或通过筛选BRCA突变患者比较PARP组与对照组的无进展生存期。使用前需注意已知的数据生成器瑕疵,如CA-125归一化率异常偏低及Mirvetuximab使用率为零的bug。
背景与挑战
背景概述
卵巢癌作为妇科恶性肿瘤中致死率最高的疾病,其生物学异质性使得精准诊疗面临巨大挑战。基于此,XpertSystems.ai团队于近期发布了HC-ONC-010数据集,该数据集是一个完全合成的上皮性卵巢癌队列,覆盖全部6种组织学亚型,并严格遵循FIGO 2014分期标准。数据集的构建整合了BRCA1/2胚系与体细胞突变、HRD评分、CA-125动力学曲线、PARP抑制剂维持治疗等核心临床变量,旨在为妇科肿瘤学分析、建模与教育提供可直接使用的合成数据资源。该数据集弥补了真实世界数据因组织学混合或样本稀疏而导致的生物学信息丢失问题,其设计基准锚定SEER登记库及SOLO-1、PRIMA等关键临床试验,对推动卵巢癌的亚型分层研究与治疗模型开发具有重要价值。
当前挑战
该数据集所解决的领域问题的核心挑战在于卵巢癌的高度生物学异质性——6种组织学亚型具有截然不同的分子通路与预后特征,而现有真实世界数据集要么混合亚型丢失关键生物学信息,要么仅聚焦于高级别浆液性癌导致罕见亚型的建模缺失。数据集通过合成方式完美模拟了TP53在高级别浆液性癌中的标志性突变、KRAS在黏液性癌中的富集以及ARID1A在透明细胞癌中的表达等亚型特异性分子模式,同时整合了FIGO分期、手术残瘤、CA-125动力学与PARP抑制剂响应等治疗决策链中的关键节点。在构建过程中,团队面临的核心技术挑战包括:确保合成数据的生物学一致性,如BRCA突变的互斥性与HRD评分的高相关度;校准各项指标以匹配临床试验和真实世界登记库的基准值,例如奥拉帕利在BRCA突变患者中的无进展生存期需锚定SOLO-1试验的56个月;以及解决生成器内部的单位混淆错误,如CA-125正常化率因半衰期单位误解而偏离文献值,这要求公开披露所有生成器缺陷以保证用户对数据工件的正确评估。
常用场景
经典使用场景
在妇科肿瘤学与人工智能交叉的前沿领域,hconc010-sample数据集作为一款全合成的上皮性卵巢癌队列,其经典使用场景首要体现在基于组织学分层的生存建模中。研究人员可借助该数据集对高级别浆液性、低级别浆液性、透明细胞、黏液性、子宫内膜样及混合型这六种组织学亚型,分别构建Cox比例风险模型或随机生存森林,精准评估BRCA1/2突变状态与同源重组修复缺陷评分等分子协变量对总生存期和无进展生存期的差异化影响。该数据集提供的标准化FIGO 2014分期信息和经过文献校准的生存终点,使其成为检验和比较不同组学特征预后效力的理想实验平台。
实际应用
在临床实践与卫生经济学评估层面,hconc010-sample展现出广阔的应用前景。该数据集可用于开发和验证肿瘤细胞减灭术结局的预测模型,依据患者基线特征与肿瘤播散模式预测R0切除的可能性,为手术决策提供量化参考。在药物经济学领域,基于其完善的PARP抑制剂维持治疗方案与相应的PFS分布数据,研究者能够构建微观模拟模型,评估不同基因检测策略下靶向药物的成本效益比。此外,该数据集还被设计为妇科肿瘤住院医师规范化培训的教学工具,其合成性质彻底消除了隐私合规风险,学员可以在安全环境中演练CA-125轨迹的HEGP动力学分类解读、RECIST 1.1疗效评估等关键技能。
衍生相关工作
围绕该数据集特定的生物学锚定与结构合理性,学术界已经衍生出多项具有启发意义的经典工作。研究者利用其组织学特异性的分子标志物分布,验证了TP53突变在高级别浆液性癌中作为诊断标志物的必然性,这一发现直接呼应了TCGA卵巢癌基因组图谱的核心结论。基于该数据集对CA-125动态轨迹的121个月序列化建模,衍生出针对Rustin生化复发标准的自动化判定算法,大幅提升了肿瘤复发早期预警的效率和可重复性。更为重要的是,通过对PARP抑制剂维持治疗适应症的符合性审计,学界重新审视了NCCN指南的依从性测量工具,推动了从临床试验数据到真实世界证据之间桥接方法论的创新,为后续基于合成数据的因果推断研究奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务