遇见数据集

electricsheepafrica/africa-nutrition-climate-vulnerability

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

一个关于非洲人口家庭营养和气候脆弱性的合成表格数据集。整合了气候冲击、农业生产力、粮食安全和营养结果。

A synthetic tabular dataset for household nutrition and climate vulnerability in African populations. Integrates climatic shocks, agricultural productivity, food security, and nutritional outcomes.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-nutrition-climate-vulnerability 数据集图片
构建方式
该数据集以撒哈拉以南非洲地区家庭营养与气候脆弱性为背景,采用合成数据生成范式构建。首先依据流行病学权重从20个非洲国家中采样,生成5000例经历气候冲击与营养不良的脆弱家庭(标签为1)和5000例气候稳定、农业丰收的对照组(标签为0),确保50/50完美平衡。随后通过文献推导的领域特异性权重,对原始40余项特征(包括气候、农业、营养、社会保护等维度)进行工程化组合,构造出气候压力指数、粮食安全评分等7项复合指标。生成过程执行泄漏过滤以剔除不符合临床实际的对照组样本,并注入均匀噪声以规避过拟合风险。全部数据以完整CSV表格形式呈现,无缺失值。
特点
本数据集最显著的特征在于其多维整合性与临床可解释性。它系统性地融合了气候异常(干旱月数、洪水事件、温度和降雨异常)、农业生产(作物产量、多样化指数、灌溉条件)与营养结局(发育迟缓、消瘦、贫血患病率)三大核心模块,并引入户主性别、市场距离等社会脆弱性变量,形成了覆盖双重重担营养不良全链条的精细刻画。工程化复合指标(如高营养风险标记)以高灵敏度为设计原则,适用于筛查场景。此外,数据集包含完全保留的字符串类别标签以保障可解释性,且特征重要性经随机森林预分析验证,复合风险分数普遍位列前五。
使用方法
该数据集主要适用于表格分类任务,可通过HuggingFace datasets库一键加载为Pandas DataFrame,亦可直接读取本地CSV文件。使用前建议对类别特征进行独热编码、连续特征标准化,并基于国家变量进行分层交叉验证以避免地理过拟合。模型选择层面,支持从逻辑回归(期望ROC-AUC 0.78–0.84)到XGBoost(期望ROC-AUC 0.91–0.95)的渐进式调优路线;高级用法涵盖生存分析、多任务学习、成本敏感学习、因果推断及联邦学习等前沿范式。推荐按70/15/15比例划分训练、验证与测试集,并需警惕工程化特征与标签间的潜在信息泄漏。
背景与挑战
背景概述
该数据集由Electric Sheep Africa于2024年创建,聚焦于非洲人口中家庭营养与气候脆弱性的交叉问题。在气候变化加剧、食品安全危机频发的背景下,非洲面临营养不足与微量营养素缺乏的“双重负担”,而现有数据往往碎片化,无法系统整合气候冲击、农业生产力、食品安全与营养结局。该数据集通过合成10,000条平衡样本,覆盖20个非洲国家及2019-2024年时间跨度,构建了40余项特征和复合风险指标,为营养不良风险预测、气候冲击评估及社会保护政策制定提供了结构化数据基础,推动了数据驱动型干预在非洲公共卫生与农业领域的应用。
当前挑战
该数据集所解决的领域问题主要围绕营养不良与气候脆弱性的耦合机制。具体挑战包括:1) 如何量化气候异常(如干旱、洪水)对农业产量和膳食多样性的非线性影响;2) 如何整合家庭层面的社会经济、营养与气候变量以识别高风险群体;3) 如何实现跨国家、跨时间的可比性分析。在数据构建过程中,挑战在于:基于有限真实流行病学数据生成逼真的合成样本,确保分布特征与实际一致;避免特征工程中的信息泄漏,保证复合指标的独立性;同时解决缺失值处理与类别平衡问题,以支持下游模型的公平性和泛化能力。
常用场景
经典使用场景
该数据集作为面向非洲人群的家庭营养与气候脆弱性合成表格数据,经典使用场景聚焦于营养不良风险预测。研究者可基于40余项特征(涵盖气候冲击指数、农业生产力、膳食多样性评分及微量营养素缺乏指标等),利用随机森林、XGBoost等机器学习模型,精准识别具有高营养脆弱性的家庭样本。数据集的平衡类别设计(正负样本各5000例)与完整的缺失值控制,为构建稳健的分类器提供了理想基准,尤其适用于评估气候异常对粮食安全与营养状况的交互影响。
衍生相关工作
该数据集衍生了一系列前沿方法论探索,包括基于Cox比例风险模型的生存分析、多任务学习框架(同时预测标签与中间营养结局)以及成本敏感学习(在筛查场景中惩罚假阴性)。联邦学习模拟实验可验证跨国家节点的分布式训练效果,而SHAP与LIME可解释性工具则用于量化气候压力指数等特征对模型决策的贡献。同时,倾向性评分匹配方法已被用于估计人道主义援助对营养恢复的因果效应,为具象化政策评估开辟了新路径。
数据集最近研究
最新研究方向
该数据集聚焦于非洲人口营养脆弱性与气候变化的交叉研究,通过整合气候冲击、农业生产力、粮食安全及营养健康等多维指标,构建了一个涵盖20个国家、10,000条合成样本的平衡数据集。当前前沿方向集中于利用机器学习模型(如随机森林、XGBoost)进行营养不良风险预测与气候冲击评估,尤其关注双重营养不良负担、微量营养素缺乏及性别脆弱性等复杂议题。数据集支持社会保护精准定位、农业干预优化及粮食价格早期预警等应用,其复合特征工程(如气候压力指数、营养脆弱性指标)为因果推断与可解释AI提供了坚实基础。结合联合国粮农组织、世界粮食计划署等权威来源,该数据在应对气候导致的粮食不安全与儿童发育迟缓热点事件中具有重要推动意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务