遇见数据集

electricsheepafrica/africa-surgical-mortality

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

这是一个用于非洲手术环境中围手术期死亡率预测的合成表格数据集。它捕获了完整的手术生态系统——包括患者因素、手术复杂性、团队能力、设施资源和术后护理。

This is a synthetic tabular dataset for predicting perioperative mortality in African surgical settings. It captures the full surgical ecosystem, including patient factors, surgical complexity, team capabilities, facility resources, and postoperative care.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-surgical-mortality 数据集图片
构建方式
非洲围手术期死亡率预测数据集基于合成数据生成技术构建,旨在弥补非洲外科领域缺乏标准化手术登记系统的研究空白。首先从Lancet Global Surgery、WHO Surgery等权威来源提取流行病学权重与临床风险分布,据此生成10,000条记录,其中5,000例阳性病例模拟高并发症与资源受限场景,5,000例对照病例模拟资源充足场景。通过泄漏过滤剔除不符合临床分类逻辑的对照样本,确保类别纯净性。随后基于领域特定权重与临床指南,构造手术复杂度、资源就绪度、团队能力等复合评分特征,并加入均匀噪声防止过拟合。最终以42号随机种子实现完美类别平衡(50/50),保持零缺失值,并保留原始分类变量字符串标签以增强可解释性。
特点
该数据集深刻体现了非洲医疗生态系统的独特性。20个国家按人口与疾病负担权重进行采样,捕捉了撒哈拉以南非洲外科基础设施严重匮乏的现实:多数国家每10万人中不足1名外科医生,频繁断电与间歇性供氧是常态,多数地区医院缺乏血库,氯胺酮单药麻醉普遍,低无菌评分与高术后脓毒症构成典型临床图景。40余个原始与工程化特征涵盖患者因素、手术复杂性、团队容量、设施资源及术后护理全链条。复合评分特征(如资源就绪度、转诊可及性)基于临床指南设计,高敏感度高危标志适用于分诊筛查。初步随机森林分析表明,复合风险评分位居特征重要性前五,国家指示变量提供强地理信号,基础设施与患者层面的交互效应显著。
使用方法
数据集以表格CSV格式提供,可通过HuggingFace Datasets库直接加载并转为Pandas DataFrame处理。支持多种高级建模范式:生存分析可建模风险轨迹,多任务学习可联合预测标签与中间结局,成本敏感学习适用于筛查场景,贝叶斯方法与共形预测可实现不确定性量化,倾向性评分匹配用于因果推断,联邦学习模拟分布式训练,SHAP与LIME值助力临床解释。预处理建议包括对分类变量进行独热编码、连续变量标准化、按国家分层划分(推荐70/15/15比例)以保障地理代表性,以及使用5折分组交叉验证检测过拟合。基准测试显示,逻辑回归可达0.72-0.78准确度与0.78-0.84 ROC-AUC,XGBoost最佳性能可达0.85-0.91准确度与0.91-0.95 ROC-AUC。
背景与挑战
背景概述
该数据集由Electric Sheep Africa于2024年创建,聚焦于非洲外科围手术期死亡率预测这一关键公共卫生问题。鉴于非洲围手术期死亡率是高收入国家的10至20倍,且除南非外绝大多数国家缺乏外科注册登记系统,导致团队因素、基础设施缺口及ASA分级记录不全等数据严重匮乏。该数据集通过合成方式模拟了涵盖20个非洲国家、2019至2024年间的外科生态系统,包含40余项特征与工程化指标,旨在弥合数据鸿沟,为资源有限环境下的手术安全优化、资源配置与质量改进提供可复用的基准资源。其发布对全球外科研究、尤其是非洲本土的外科预后建模与政策制定具有重要推动作用。
当前挑战
该数据集主要解决以下挑战:首先,非洲外科领域面临的核心问题包括麻醉医师与外科医师严重不足(多数国家每10万人中不足1名外科医师)、基础设施脆弱(频繁停电、氧气中断、缺乏血库与消毒保障)以及高发的术后脓毒症,这些因素导致围手术期死亡率居高不下,而现有数据系统无法有效捕捉这些多维风险。其次,构建过程中需克服数据稀疏与质量不一的困难,通过领域知识驱动生成合成数据,保证类平衡与地域流行病学权重,并精心设计工程化特征(如资源就绪度与团队能力评分)以避免数据泄露,同时确保合成的连续变量保留真实异质性与噪声,从而实现模型的可迁移性与临床适用性。
常用场景
经典使用场景
在非洲外科医疗资源极度匮乏的背景下,围手术期死亡率是高收入国家的10至20倍,而数据驱动的精准干预却因缺乏系统化的手术登记而举步维艰。该数据集构建了一个涵盖患者因素、手术复杂性、团队能力、设施资源及术后护理全生态的合成表格,完美平衡了5000例阳性与5000例对照样本,成为围手术期死亡率预测与安全性优化领域的核心基准。研究者可利用其丰富的结构化特征开展多分类任务,并通过复合风险评分、资源就绪度指数等工程化变量,探索资源受限环境下风险分层与急诊分诊的智能决策。
解决学术问题
该合成数据集直面非洲外科统计学中的重大空白:由于缺乏本土手术注册库,传统模型在低资源环境中常因数据稀疏而失效。它首次系统性整合了基础设施脆弱性(如间断供电、无血库、仅依赖氯胺酮麻醉)与团队能力缺口(每10万人不足1名外科医生),解决了手术并发症与死亡风险预测中跨维度变量交互作用难以量化的困境。通过引入溯源严格的复合评分体系,研究得以检验资源-过程-结局这一因果链条中的非线性关系,为全球健康公平性评估、手术质量基准比较及任务转移安全性验证提供了可重复、可扩充的计算基座。
衍生相关工作
围绕该数据集已生长出多个标志性研究方向:基线研究中随机森林与XGBoost分别达到0.93与0.95的AUC,印证了复合风险特征对非线性模式的捕捉力;后续工作通过Cox比例风险模型将二分类拓展为生存分析,描绘了术后30天内并发症发生的时间动力学。在可解释性领域,SHAP与LIME的应用揭示了基础设施得分与传染性疾病共病对死亡率的交互调节效应。值得关注的是,多任务学习联合预测并发症类型与严重等级,以及使用对抗验证检测模型对特定国家的过拟合倾向,已成为评估模型泛化的标准操作。未来,差分隐私合成数据生成与跨种族公平性审计将进一步推动该基准在临床部署中的可信性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务