electricsheepafrica/africa-ilo-eip-wdis-sex-edu-geo-nb-discouraged-job-seekers-by-sex-education-and-rural
收藏数据链接:
官方服务:
资源简介:
该数据集包含关于非洲40个国家在1999年至2025年间其他劳动力未充分利用的衡量指标的6,564个观测值,具体指标是按性别、教育和城乡区域划分的沮丧求职者(千人)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为非洲国家,涵盖了性别、教育和区域等分解维度,用于表格分类、回归和时间序列预测等任务。
This dataset contains 6,564 observations of Other measures of labour underutilization data across 40 Africa countries, spanning 1999–2025, with a specific indicator on Discouraged job-seekers by sex, education and rural / urban areas (thousands). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), filtered to Africa countries via API, and includes disaggregation dimensions such as sex, education, and area type, suitable for tabular classification, regression, and time-series forecasting tasks.
提供机构:
electricsheepafrica搜集汇总
数据集介绍

构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于非洲地区因性别、教育水平及城乡区域划分的“丧失信心的求职者”规模(单位为千人)。Electric Sheep Africa团队通过调用ILOSTAT官方REST API,直接提取指标代码为EIP_WDIS_SEX_EDU_GEO_NB的原始数据,并依据非洲ISO3国家代码进行地理范围过滤。数据经过ILO依据国际劳工统计学家会议(ICLS)定义进行标准化处理,保留了源调查来源标记(source.label)以保持溯源透明度。最终整理为包含6,564条观测记录的表格数据集,时间跨度覆盖1999年至2025年,涉及40个非洲国家,并提供Parquet格式以提升机器学习的加载效率。
特点
该数据集的核心特色在于其精细的多维分类结构。不仅按性别(男性、女性、总计)进行常规分层,还纳入了教育水平聚合等级(classif1)与地理覆盖类型(classif2,如国家、城乡区域)的交叉分析,能够支持深入探究劳动参与中结构性差异的成因。数据集涵盖的40个非洲国家中,南非、埃及、卢旺达等国的观测记录尤为丰富,提供了长时段的追踪视角。此外,数据质量标注(如obs_status)对不可靠或修订后的指标进行了标记,并附有系列断裂(break in series)等注释信息,为严谨的统计分析保留了关键上下文。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset()函数一键加载该数据集,并转换为Pandas DataFrame进行后续探索。针对特定国家(如肯尼亚)的筛选、对单一指标的时间序列可视化,以及构建国家×年份的透视矩阵等常见分析需求均可在数行Python代码内完成。由于数据以标准化的表格格式组织,研究者可直接利用ref_area、time和obs_value等核心字段开展面板数据分析或时间序列建模。该数据集同样适用于分类与回归任务,为评估非洲劳动力市场的未被充分利用状况提供了便捷的机器学习入口。
背景与挑战
背景概述
在全球劳动统计领域,非正规就业与隐性失业现象长期困扰着政策制定与学术研究。国际劳工组织(ILO)作为全球劳动统计的权威机构,通过其核心数据库ILOSTAT系统性地收集并标准化各国劳动力数据。该数据集由Electric Sheep Africa于2025年重新整理发布,聚焦非洲地区“丧失信心的求职者”这一关键劳动利用不足指标,涵盖40个非洲国家、1999至2025年间共计6564条观测记录。其核心研究问题在于:如何通过性别、教育程度与城乡区域的多维交叉分类,精准刻画非洲大陆隐形失业人群的分布特征与演变趋势。该数据集为探讨非洲劳动力市场的结构性矛盾、评估就业政策效果及追踪可持续发展目标(SDG)中的体面劳动进展提供了重要基础。
当前挑战
在领域问题层面,该数据集主要应对的是传统失业统计难以捕捉的“隐性失业”现象——丧失信心的求职者因长期求职失败而退出劳动力市场,其存在使得官方失业率无法真实反映劳动参与障碍,尤其在南非(882条记录)、埃及(460条)等观测密集国家,这种偏差可能掩盖严重的结构性失业。在构建过程中,数据面临多重挑战:跨国家庭调查的采集方法差异导致指标可比性受限,ILO虽依据国际劳工统计学家会议(ICLS)定义进行协调,但“非标准教育水平”等分类注释表明数据仍需审慎解读;部分观测值被标记为“不可靠”或“方法论修订”,反映出历史数据的质量波动;此外,数据仅覆盖年度频率而缺失月度或季度序列,限制了高时频分析的能力。
常用场景
经典使用场景
在劳动力经济学与发展经济学的研究版图中,该数据集被广泛应用于探索非洲国家中灰心丧气求职者的分布规律与结构性特征。研究者借助其按性别、教育水平及城乡地域精细划分的观测值,能够刻画不同类型劳动力在就业信心受损程度上的异质性。例如,通过时间序列分析可揭示经济周期对不同教育层次女性或男性求职意愿的冲击差异,而面板数据建模则有助于识别城市化进程中农村灰心阶层向城市迁移的潜在动力。该数据为检验效率工资理论、搜寻匹配模型在非洲制度环境下的适用性提供了难得的经验素材,其年度观测跨度恰好覆盖了若干重大经济政策调整与危机事件,从而成为评估政策干预效果的天然实验场。
实际应用
在实际政策制定与国际发展合作中,该数据集成为非洲各国劳动部与国际组织诊断劳动力市场健康度的重要工具。世界银行与非洲开发银行借助其按教育层次与城乡细分的灰心求职者数据,能够精准识别最需要职业技能培训或创业扶持的脆弱群体。例如,若数据显示农村地区高学历女性灰心比例持续攀升,政策制定者可针对性设计居家就业支持计划或远程职业引导服务。非政府组织利用该序列评估过去十年减贫战略的成效,判断经济增长是否真正惠及边缘劳动者。此外,数据集的时间序列特性使其可用于构建早期预警系统,当灰心人数在特定地区异动时可触发社会保障体系的预案调整。
衍生相关工作
该数据集催生了一系列衍生学术成果,尤其是在劳动经济学与空间经济学的交叉领域。研究人员构建了基于性别-教育-地域三维交互的灰心求职者聚类模型,发现撒哈拉以南非洲的灰心现象存在明显的‘教育悖论’——中等教育程度者反而比文盲群体更易表现出职场退缩倾向。另有工作利用该数据检验了不同国家最低工资调整对灰心群体的非对称影响,揭示出农村劳动力市场具有更强的工资黏性。在方法创新上,学者开发了基于贝叶斯结构时间序列的预测框架,整合ILO与各国统计局的多源数据以弥补非洲调查数据的稀疏性。这些衍生研究不仅深化了对非洲劳动力市场非正规转型的理解,也为跨国比较劳动统计提供了标准化分析范式。
以上内容由遇见数据集搜集并总结生成



