遇见数据集

oncodatasets

收藏
github2026-07-05 更新2026-07-07 收录
官方服务:

资源简介:

oncodatasets包提供了一个精选的肿瘤学、临床试验和癌症生存数据集集合,用于数据分析、统计建模和机器学习研究。包括乳腺癌诊断、肺癌和膀胱癌生存分析、肿瘤基因表达谱、实验室动物剂量反应致癌物实验、患者报告的生活质量指标、流行病学发病率和死亡率数据,以及来自CRAN上精选R包的临床试验结果。

The oncodatasets package provides a curated collection of oncology, clinical trial, and cancer survival datasets for data analysis, statistical modeling, and machine learning research. The included datasets cover breast cancer diagnosis, survival analysis for lung and bladder cancers, tumor gene expression profiles, carcinogen dose-response experiments using laboratory animals, patient-reported quality of life metrics, epidemiological incidence and mortality data, as well as clinical trial results sourced from curated R packages on CRAN.

创建时间:
2026-06-15
原始信息汇总

数据集概述:oncodatasets

oncodatasets 是一个面向肿瘤学、临床试验及癌症生存分析研究的 Python 数据集集合包,适用于数据分析、统计建模和机器学习研究。

数据集涵盖领域

  • 癌症诊断:例如基于乳腺肿块细针穿刺(FNA)图像特征的数据集。
  • 生存分析:包括肺癌、膀胱癌等癌症的生存数据。
  • 基因表达谱:肿瘤基因表达相关数据。
  • 流行病学数据:如不同区域的癌症发病率和死亡率。
  • 临床实验与患者报告结果:包括患者生活质量(QoL)指标和临床试验结果。
  • 动物实验数据:实验室动物中致癌物剂量-反应实验数据。

部分可用数据集示例

数据集名称 描述
breast_cancer_diagnostic 来自威斯康星医院乳腺肿块数字化FNA图像的特征数据。
lip_cancer_scotland 苏格兰56个郡(1975–1980年)观察与预期的唇癌病例数据。
cancer_dogs 1994年关于除草剂暴露与狗患癌风险的病例-对照研究数据。

完整数据集列表可通过运行 oncodatasets.list_datasets()ocd.list_datasets() 获取。

安装与使用

  • 安装命令:pip install oncodatasets
  • 核心功能:
    • ocd.list_datasets():列出所有可用数据集。
    • ocd.load_dataset(dataset_name):加载指定数据集为DataFrame。
    • ocd.describe(dataset_name):查看数据集描述。

数据来源与许可

  • 所有数据集均源自CRAN上已有的R包,并保留其原始许可和归属。
  • oncodatasets 库本身采用 GNU General Public License v3 (GPLv3) 开源许可。

重要声明

  • 本数据集仅供教育、研究和信息参考使用。
  • 作者不对数据的准确性、完整性或适用性作任何保证。
  • 用户需自行承担使用数据的合规性与伦理责任。
  • 禁止将本数据集用于临床诊断或医疗决策,相关用途应咨询专业医疗人员。
搜集汇总
数据集介绍
oncodatasets 数据集图片
构建方式
oncodatasets 数据集构建于对 CRAN 上多个精选 R 包中肿瘤学、临床试验及癌症生存数据的系统性整合与再封装。开发者从经同行评议的学术研究和公共数据库中提取出涵盖乳腺癌诊断特征、肺癌与膀胱癌生存分析、肿瘤基因表达谱、实验动物致癌物剂量反应、患者报告生活质量指标、流行病学发病与死亡率以及临床试验结果等多元数据,并通过统一的 Python 接口进行标准化处理,确保跨平台的数据兼容性与可复现性。
特点
该数据集集合具有鲜明的跨学科整合特性,囊括从分子层面(如基因表达)到人群层面(如癌症发病率)的多维度信息,尤其包含罕见病种(如苏格兰唇癌)及特殊群体(如犬类癌症)数据,为机器学习与统计建模提供了丰富的应用场景。所有数据均源自权威 R 包,并附带原始许可与归属说明,保障了学术使用的合规性;同时,通过严格的伦理声明与免责条款,引导研究者仅限教育与科研用途,避免临床误用。
使用方法
使用者可通过 pip 安装 oncodatasets 库后,利用 list_datasets() 函数查看所有可用数据集的完整列表,并以 load_dataset() 加载特定数据集(如 breast_cancer_diagnostic),返回符合 pandas DataFrame 格式的结构化数据,便于后续分析与建模。describe() 函数则提供了数据集的元数据描述,帮助研究者快速理解变量含义与数据来源,从而高效地应用于肿瘤预后建模、药物响应预测或流行病学分析等任务。
背景与挑战
背景概述
在肿瘤学与临床数据分析领域,高质量、标准化的数据集对于推动统计建模与机器学习研究至关重要。oncodatasets数据集由研究团队于近年创建,旨在整合并便捷地提供来自CRAN上精选的R包中的肿瘤学、临床试验及癌症生存分析数据。该数据集涵盖了乳腺癌诊断、肺癌与膀胱癌生存分析、肿瘤基因表达谱、实验动物剂量-反应致癌实验、患者报告的生活质量指标、流行病学发病率与死亡率以及临床试验结果等多维信息。其核心研究问题聚焦于降低数据获取门槛,促进跨学科研究者对癌症相关数据的可重复分析与模型开发,已在精准医学与计算肿瘤学领域产生了显著影响力。
当前挑战
该数据集面临的首要挑战是解决肿瘤学数据异质性带来的标准化困境,例如不同来源的临床数据在编码方式、缺失模式及样本量上差异显著,这增加了多数据集整合与统一分析的复杂性。此外,构建过程中需克服数据许可与伦理合规的难题,确保从外部R包中提取的数据保留原始归属与使用条款,同时规避隐私泄露风险,如癌症患者生存数据中的去标识化处理。领域内另一关键挑战是模型泛化能力不足,部分数据集(如犬类癌症风险病例对照研究)样本量有限且地域聚焦,可能限制其在更广泛人群中的推断效力,这要求研究者谨慎评估数据适用性以得出可靠结论。
常用场景
经典使用场景
在肿瘤学与计算生物学交叉研究领域,oncodatasets为研究者提供了一套精心编排的公开数据集,涵盖乳腺癌细胞核显微图像特征、肺癌与膀胱癌患者生存分析、肿瘤基因表达谱以及实验室动物剂量-反应致癌实验数据。经典使用场景包括使用乳腺癌诊断特征构建分类模型以区分良性与恶性病变,或利用苏格兰唇癌空间流行病学数据进行区域风险建模。此外,研究者可基于患者报告的生活质量(QoL)指标与临床试验结局数据进行预后因素分析,从而推动肿瘤学数据驱动的研究范式。
实际应用
在实际应用中,oncodatasets赋能制药企业与学术机构开展肿瘤药物研发的早期探索。例如,临床研究人员可基于肿瘤基因表达谱与动物剂量-反应实验数据评估候选化合物的致癌风险,而流行病学家则利用发病率与死亡率数据构建区域癌症负担模型。此外,患者生活质量指标与临床试验结果被用于优化个体化治疗策略,提升临床试验设计的统计学功效,从而在转化医学与公共卫生决策中发挥桥梁作用。
衍生相关工作
该数据集衍生了一系列影响深远的经典工作,包括基于乳腺癌诊断特征的集成学习分类器研究(如随机森林与支持向量机对比),以及利用苏格兰唇癌数据开发的空间疾病制图贝叶斯统计模型。此外,犬类癌症病例对照数据促使了兽医流行病学中混杂因素校正方法的改进,而肿瘤基因表达谱则推动了多组学整合分析框架的建立。这些工作不仅在《BMC Bioinformatics》等期刊上发表,更催生了新的开源工具包(如survcomp与DOSE),极大丰富了肿瘤生物信息学的方法论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务