遇见数据集

electricsheepafrica/africa-traditional-medicine-safety

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

这是一个合成表格数据集,专注于非洲人口中传统医学和补充医学的安全性。它模拟了非洲大陆上最广泛使用的医疗系统中的安全风险。数据集包含10,000行数据,完美平衡了正例(标签=1,表示不良事件)和对照例(标签=0,表示安全),覆盖20个国家,时间跨度为2019年至2024年。特征包括40多个原始和工程化列,如国家、患者年龄、性别、从业者类型、草药类型、给药途径、不良事件严重性等,无缺失值。数据集旨在解决非洲传统医学安全数据缺乏的问题,支持不良事件预测、草药-药物相互作用建模、从业者风险分析等应用,并包含伦理和数据治理考虑。

tags: - 合成数据(synthetic) - 合成数据集(synthetic-data) - 表格分类(tabular-classification) - 传统医学(traditional-medicine) - 安全(safety) - 非洲(africa) - 医疗保健(healthcare) - 药物警戒(pharmacovigilance) task_categories: - 表格分类(tabular-classification) - 其他(other) task_ids: - 表格多分类(tabular-multi-class-classification) language: [] pretty_name: 传统医学安全数据集(Traditional Medicine Safety Dataset) size_categories: - 10000条<样本数<100000条 # 传统医学安全数据集(Traditional Medicine Safety Dataset) ## 数据集描述 本数据集为面向非洲人群的传统与补充医学安全的合成表格数据集,旨在模拟非洲大陆最普及的医疗体系中的安全风险场景。 ## 数据集统计信息 | 指标 | 数值 | |----------|-------| | 总记录数 | 10,000 | | 阳性样本(标签=1) | 5,000 | | 对照样本(标签=0) | 5,000 | | 覆盖国家 | 20个 | | 时间跨度 | 2019–2024年 | | 特征数(原始+工程化特征) | 40+ | | 缺失值占比 | 0%(完全合成的数据集) | | 数据格式 | 表格型CSV | | 随机种子 | 42 | ## 类别平衡与分布 本数据集采用完美的50/50类别平衡,以避免下游模型出现类别不平衡偏差。国家采样遵循反映非洲人口与疾病负担分布的流行病学权重。所有类别特征均保留为字符串标签,以提升可解释性。 ## 研究空白 非洲80%的人口使用传统医学,但目前几乎不存在结构化的安全数据集。草药与西药相互作用、肝毒性、从业者监管、剂量标准化以及儿科用药脆弱性等领域的相关记录均严重不足。 ## 非洲医疗体系背景 - 80%的人口将传统医学作为初级医疗手段 - 不足10%的传统医疗从业者已完成注册 - 肝毒性是急性肝衰竭的主要诱因之一 - 除南非、加纳、尼日利亚外,多数地区缺乏传统医学整合政策 - 生物勘探相关顾虑为研究带来额外复杂性 ## 信息来源 | 来源 | 网址 | |--------|-----| | 世界卫生组织传统医学战略(WHO TM Strategy) | https://www.who.int/publications/i/item/9789240033895 | | 非洲联盟(African Union) | https://au.int/ | | 南非传统医学中心(SA TMC) | https://tmc.co.za/ | | 尼日利亚国家传统与补充医学发展局(NMEDA Nigeria) | https://nmeda.gov.ng/ | ## 字段说明 | 字段名 | 数据类型 | 描述 | |--------|------|-------------| | country | string | 国家 | | patient_age | int | 患者年龄 | | gender | string | 性别 | | practitioner_type | string | 从业者类型 | | years_practicing | int | 从业年限 | | reason_for_visit | string | 就诊原因 | | herb_type | string | 草药类型 | | preparation_method | string | 炮制方法 | | administration_route | string | 给药途径 | | dosage_known | int | 是否知晓剂量 | | frequency_daily | int | 每日用药频率 | | duration_weeks | int | 用药时长(周) | | concurrent_western_meds | string | 合并使用的西药 | | disclosure_to_doctor | int | 是否向医师告知用药情况 | | adverse_event | string | 不良事件 | | severity | string | 严重程度 | | time_to_onset_days | int | 不良事件发作时间(天) | | outcome | string | 事件结局 | | hospitalisation_required | int | 是否需要住院 | | previous_adverse_events | int | 既往不良事件史 | | registration_status | int | 从业者注册状态 | | quality_control | int | 质量控制 | | label | int | 1=发生不良事件,0=用药安全 | ## 工程化特征 | 特征名 | 描述 | |---------|-------------| | practitioner_experience_score | 从业年限 + 注册状态 + 质量控制得分的综合评分 | | herb_risk_score | 炮制方法 + 给药途径 + 剂量知晓情况 + 用药频率的综合风险评分 | | concurrent_med_risk | 合并用药的相互作用严重程度 | | care_integration_score | 医师告知情况与用药风险的综合评分 | | patient_vulnerability | 患者年龄 + 既往不良事件史的综合脆弱性评分 | | event_severity_score | 加权后的事件严重程度评分 | | high_risk_traditional | 高风险传统用药复合标记 | ## 特征工程方法 复合评分基于文献与临床指南推导的领域专属权重构建,所有评分均保留两位小数以确保可复现性。原始字段保留了各组成部分的贡献值,方便研究人员重构或修改复合评分。 **高风险标记**为二元指示变量,当多个风险维度同时超出阈值时触发。该设计优先保证灵敏度(捕获绝大多数高风险案例)而非绝对特异性,因此适用于分诊与筛查场景。 ## 特征重要性说明 基于初步随机森林(Random Forest)分析结果: - 复合风险评分通常位列前5个最重要的特征 - 国家指示变量可提供较强的地理分布信号 - 时间特征(年份、季节)可捕捉长期趋势 - 基础设施与患者层面变量间的交互效应具有统计学显著性 - 请始终在留出的测试集上验证特征重要性,以避免数据泄露(leakage) ## 支持的应用场景 - 不良事件预测 - 草药与西药相互作用建模 - 从业者风险画像 - 质量控制基准测试 - 医疗整合政策设计 - 儿科用药安全研究 - 监管效果评估 ## 高级建模方法 - **生存分析(Survival analysis)**:针对存在时间-to-事件结局的数据集,可使用Cox比例风险模型构建风险轨迹 - **多任务学习(Multi-task learning)**:联合预测标签与中间结局(如并发症类型、严重程度分级) - **代价敏感学习(Cost-sensitive learning)**:在筛查场景中,为假阴性赋予高于假阳性的权重 - **不确定性量化(Uncertainty quantification)**:使用共形预测或贝叶斯方法标记低置信度预测结果,供人工复核 - **因果推断(Causal inference)**:基于机构类型或国家进行倾向得分匹配,以估算干预效应 - **联邦学习(Federated learning)**:无需集中化数据,即可在模拟的医院节点间训练模型 - **可解释AI(Explainable AI)**:通过SHAP与LIME值帮助临床医师理解模型驱动的风险评分 ## 使用示例 python from datasets import load_dataset dataset = load_dataset("electricsheepafrica/africa-traditional-medicine-safety", split="train") df = dataset.to_pandas() python import pandas as pd from sklearn.model_selection import train_test_split from sklearn.ensemble import RandomForestClassifier from sklearn.metrics import classification_report, roc_auc_score df = pd.read_csv("data/processed/traditional_features.csv") X = df.select_dtypes(include=["int", "float"]).drop(columns=["label"]) y = df["label"] X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, stratify=y, random_state=42) clf = RandomForestClassifier(random_state=42) clf.fit(X_train, y_train) print(classification_report(y_test, clf.predict(X_test))) print("ROC-AUC:", roc_auc_score(y_test, clf.predict_proba(X_test)[:, 1])) ## 数据生成流程 1. 阳性样本:包含不良事件与高风险用药场景 2. 对照样本:包含安全用药与明确剂量的场景 3. 过滤泄露样本:移除临床中会被归类为阳性的对照样本 4. 平衡样本量:5000个阳性样本 + 5000个对照样本 5. 生成从业经验、用药风险与患者脆弱性特征 6. 使用随机种子42生成数据 ## 预处理建议 1. **独热编码(One-hot encode)**:针对类别型字段(国家、机构类型、地区等) 2. **标准化(Standardise)**:对连续特征使用Z-score或MinMax归一化,适配基于距离的模型 3. **分层拆分(Stratify)**:按国家进行分层拆分,以保证地理分布代表性 4. **采样策略**:若需子采样,可使用SMOTE或类别加权;本数据集已天然平衡 5. **交叉验证**:使用按国家分组的5折分层交叉验证,以检测针对特定国家的过拟合 6. **特征选择**:工程化复合评分具有较高信息价值,可与原始特征对比评估 7. **数据泄露检查**:确保从标签衍生的字段(如事件结局、诊断分期)未被纳入特征集 ## 基线性能预期 | 模型 | 预期准确率 | 预期ROC-AUC值 | 说明 | |-------|------------------|------------------|-------| | 逻辑回归(Logistic Regression) | 0.72–0.78 | 0.78–0.84 | 可解释性优异的基线模型 | | 随机森林(Random Forest) | 0.82–0.88 | 0.88–0.93 | 可较好处理非线性交互效应 | | XGBoost / LightGBM | 0.85–0.91 | 0.91–0.95 | 表格数据建模的最优表现 | | 神经网络(MLP) | 0.80–0.86 | 0.85–0.90 | 需要特征标准化,存在过拟合风险 | | 线性支持向量机(Linear SVM) | 0.74–0.80 | 0.80–0.85 | 对特征缩放敏感 | 以上为分层80/20训练测试拆分下的近似性能范围,实际结果可能因特征工程与超参数调优有所差异。 ## 统计属性 - **阳性样本**:从高风险临床特征分布中采样,且有意保留一定重叠以反映真实世界的异质性 - **对照样本**:从低风险特征分布中采样,但保留合理的方差;约10%的对照样本可能存在轻微风险指标 - **泄露过滤**:移除临床中会被归类为阳性的对照样本,以保证类别间的清晰分离 - **国家权重**:基于世界卫生组织/联合国儿童基金会的疾病负担估算与人口规模推导 - **相关结构**:工程化特征与原始临床指标存在有意设置的相关性;在线性模型中需避免重复计数 - **噪声注入**:连续变量加入均匀分布噪声,以避免模型过拟合合成的精确阈值 - **时间一致性**:年份、季节与天气异常值均为连贯生成(如干旱月份与作物减产存在对应关联) ## 验证清单 在将本数据集用于研究或生产前,请完成以下检查: - [ ] 验证训练/测试拆分中的类别平衡情况 - [ ] 检查工程化特征与标签间是否存在意外相关性 - [ ] 验证高风险标记在极端场景下的行为是否符合预期 - [ ] 确认国家分层不会导致模型被特定国家的特征主导而产生虚假偏差 - [ ] 通过完全留出一个或多个国家的方式测试模型泛化能力 ## 局限性 - 合成数据集 - 草药分类较为简化 - 仅支持二元结局预测 ## 伦理考量 - 尊重传统知识体系 - 避免污名化传统医疗从业者或使用者 - 支持传统医学与现代医疗的整合 - 遵循社区知情同意原则 - 保护从业者身份信息 ## 数据治理与保护 - **匿名化处理**:所有记录均为合成生成,不包含任何真实患者、家庭或机构标识符 - **合成数据验证**:部署前需验证合成分布是否与目标国家的真实监测数据匹配 - **社区参与**:部署预测工具前,需咨询当地卫生部门与社区群体 - **算法公平性**:审计模型在不同国家、性别与社会经济阶层间的性能差异 - **解释权保障**:当用于临床或政策决策时,需提供可解释的模型输出 - **数据留存**:后续收集的任何真实数据需遵循机构与国家的数据保护政策 - **利益共享**:确保参与或被纳入数据集的社区可从相关工具与研究成果中获益 - **开放科学**:在同行评审的研究成果中公开方法学、代码与模型卡片 ## 推荐数据拆分 - 训练集:70% - 验证集:15% - 测试集:15% ## 引用格式 bibtex @dataset{traditional_medicine_africa_2024, title = {Traditional Medicine Safety Dataset}, author = {Electric Sheep Africa}, year = {2024}, url = {https://huggingface.co/datasets/electricsheepafrica/africa-traditional-medicine-safety} } ## 许可证 CC BY-SA 4.0 ## 联系方式 electricsheepafrica@proton.me ## 版本历史 - v1.0 — 初始发布

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-traditional-medicine-safety 数据集图片
构建方式
该数据集采用合成数据生成技术构建,以弥补非洲传统与补充医学安全领域中结构化数据的严重缺失。生成流程严格遵循临床流行病学原则:首先基于非洲20个国家的人口权重与疾病负担分布,分别采样5,000例阳性病例(出现不良事件)与5,000例对照病例(安全使用),确保完美的类别平衡(50/50)以避免模型偏差。随后通过领域专家权重与文献临床指南,构建了包含40余个原始特征与工程化特征的完整表格,涵盖患者人口学、从业者资质、草药种类与制备方式、用药方案、合并用药及不良事件详情等关键维度。工程化特征如从业者经验评分、草药风险评分、患者脆弱性评分等均基于理论权重计算并保留两位小数,以确保可复现性。最后通过泄漏过滤剔除可能被临床判定为阳性的对照样本,并在连续变量中注入均匀噪声以防止过拟合,最终生成包含10,000条完整记录、无缺失值的标准结构化数据集。
特点
本数据集的核心特色在于其高度的真实世界模拟性与多维风险建模能力。数据集不仅涵盖了从基础人口统计到精细临床指标的全面字段,更通过精心设计的工程化特征(如并发用药风险评分、护理整合得分、高风险传统治疗复合标志)捕捉了传统医学安全性评估中的复杂交互作用。其类别平衡设计(5,000例阳性与5,000例对照)有效避免了常见的不平衡学习问题,而基于WHO/UNICEF流行病学权重进行的国家分层抽样则确保了地理与人群代表性。此外,数据集内置了时间一致性(2019–2024年)与相关性结构,使得工程特征与原始临床指标之间存在有意义的共变关系,为因果推断与多任务学习提供了坚实基础。合成数据的匿名性也彻底规避了真实患者隐私泄露风险,符合数据治理与伦理要求。
使用方法
本数据集的使用灵活多样,研究人员可通过HuggingFace Datasets库直接加载为Pandas DataFrame,或采用传统CSV读取方式进行本地分析。对于分类任务,推荐使用Scikit-learn流水线:首先对类别型特征(如国家、性别、草药类型)进行独热编码,并对连续型特征进行标准化处理;随后采用分层抽样策略按国家划分训练集(70%)、验证集(15%)与测试集(15%),以确保地理代表性。基线实验表明,逻辑回归可达到0.72–0.78的准确率与0.78–0.84的ROC-AUC,随机森林可将ROC-AUC提升至0.88–0.93,而XGBoost等梯度提升模型更可达到0.91–0.95。高级应用包括生存分析(针对时间至事件结局)、多任务学习、成本敏感学习(在筛查场景中加重假阴性权重)以及可解释AI(SHAP与LIME值辅助临床解读)。建议始终进行5折分层交叉验证并检验特征与标签间的泄漏关系。
背景与挑战
背景概述
传统医学在非洲大陆扮演着至关重要的角色,据统计,约80%的非洲人口依赖传统医学作为初级医疗保健手段。然而,这一广泛应用的医疗体系长期缺乏系统性的安全性数据,尤其是在草药-药物相互作用、肝毒性、从业者监管及剂量标准化等关键领域。为填补这一研究空白,Electric Sheep Africa团队于2024年创建了非洲传统医学安全性数据集(africa-traditional-medicine-safety),这是一个完全合成的表格分类数据集,涵盖2019至2024年间20个非洲国家的10000条记录,正负样本均衡分布。该数据集通过结构化方式模拟了非洲人群中传统与补充医学的安全性风险,旨在为药物警戒、政策制定和临床决策提供数据支撑。其发布对于推动非洲传统医学循证研究、促进医疗体系整合具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于,非洲传统医学虽被广泛使用,却几乎不存在结构化安全数据,导致草药毒性、药物相互作用及儿童等脆弱人群的安全性评估严重缺失。同时,构建过程中面临多重挑战:首先,须合成高保真的临床风险特征,确保正例样本反映高风险病例的异质性,而对照样本保留真实方差;其次,需基于WHO和UNICEF的疾病负担估计设计国家权重,实现地理代表性;此外,需通过漏报过滤机制移除临床上会被归类为正例的对照样本,确保类别纯净;最后,合成数据虽能规避隐私问题,但其简化草药类别和二元结果标签限制了疾病严重程度及复杂交互作用的建模能力,需在后续验证中确保分布与现实监测数据匹配。
常用场景
经典使用场景
在非洲大陆,传统医学作为最广泛使用的医疗体系,却长期缺乏系统的安全性数据。该数据集专为传统与辅助医学的安全性建模而设计,提供了一个包含一万条样本、完美平衡的合成表格数据,覆盖20个国家的40余项特征,包括患者基本信息、草药类型与制备方法、用药剂量与频率、合并用药情况、不良事件类型与严重程度等。经典用途在于训练分类模型以预测不良事件的发生,如利用随机森林或XGBoost预测患者是否会出现用药安全问题,并识别高风险人群和关键风险因素。
解决学术问题
该数据集直面非洲传统医学领域的核心学术困境:80%的非洲居民依赖传统医学,但关于草药与药物相互作用、肝毒性、从业者监管、剂量标准化及儿童用药安全性等关键问题几乎不存在结构化数据。它填补了这一空白,使研究者能够基于合成数据构建预测模型,量化传统医学的安全风险,探索不同国家、从业者类型和用药方式下的风险差异,并为制定整合政策、建立药物警戒体系提供数据驱动的科学依据,对推动传统医学现代化和公共卫生产生深远影响。
衍生相关工作
基于该数据集,研究者可衍生多种前沿学术工作:利用Cox比例风险模型进行生存分析,建模不良事件的时间风险轨迹;采用多任务学习联合预测事件类型与严重程度;引入成本敏感学习权衡假阴性与假阳性代价;运用因果推断方法估计政策干预效果;通过联邦学习框架在模拟医院节点间训练模型而不集中原始数据;借助SHAP和LIME等可解释性工具揭示模型决策依据。这些工作将极大深化对传统医学安全性的理解,推动合成数据在药物警戒领域的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务