electricsheepafrica/africa-ilo-ees-tees-sex-ifl-dsb-nb-employees-by-sex-informal-formal-job-and-disabilit
收藏数据链接:
官方服务:
资源简介:
这是一个关于非洲非正规经济的数据集,包含2,059个观测值,覆盖31个非洲国家,时间跨度为2007年至2025年,涉及1个指标:按性别、非正规/正规工作和残疾状况分类的雇员数据(以千计)。数据源自国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Africa重新打包,用于表格分类、回归和时间序列预测等任务。
This dataset contains 2,059 observations of informal economy data across 31 Africa countries, spanning 2007 to 2025, covering 1 distinct indicator: Employees by sex, informal/formal job and disability status (thousands). It is sourced from the ILOSTAT database of the International Labour Organization (ILO) and repackaged by Electric Sheep Africa, intended for tasks such as tabular classification, regression, and time-series forecasting.
提供机构:
electricsheepafrica搜集汇总
数据集介绍

构建方式
该数据集依托国际劳工组织中央统计数据库(ILOSTAT)的原始统计资料构建,由Electric Sheep Africa团队进行元数据标准化与格式重组。原始数据覆盖2007至2025年间31个非洲国家的非正规经济就业统计,共计2059条观测记录。构建过程中,团队沿用源数据中关于性别、非正规/正规就业形态及残疾状况的分类维度,将其整理为结构化的Parquet文件,并配套生成标准化的元数据清单、溯源说明与加载指引,最终以CC BY 4.0许可协议在Hugging Face平台发布,形成可供非洲数据探索使用的一致化目录条目。
特点
数据集以表格与文本双重模态呈现,聚焦非洲地区非正规经济领域的就业统计,涵盖性别、就业形态与残疾状况的交叉分类信息。其规模处于一千至一万行之间,以Parquet格式存储,便于高效读取与列式分析。每条记录均承载明确的地理与时间标签,支持跨年度、跨国别的比较研究。数据集附带标准化的元数据注释与溯源说明,提示使用者关注变量定义、单位及缺失值处理,同时保留源数据中未声明的国别代码等元数据缺口,为分析工作提供透明的质量参照。
使用方法
研究者可通过Hugging Face的datasets库以load_dataset函数直接加载该数据集,获取各切分的数据表并检视其特征与样本。对于表格型数据,可利用to_pandas方法转换为数据框,进而开展缺失值探查、变量分布剖析及按地理、时间与子群维度的统计画像。建议在建模前核实变量定义与计量单位,审慎处理缺失值并记录插补规则。该数据集亦可与Electric Sheep Africa目录中的其他非洲数据集按国家、年份与指标字段进行联结,以构建可复现的分析流程,并在成果中同时引用原始来源与Hugging Face仓库。
背景与挑战
背景概述
非洲非正规经济部门就业结构长期缺乏系统量化证据,国际劳工组织统计数据库(ILOSTAT)虽为全球劳动统计权威来源,但按性别、就业形态与残疾状况交叉分类的国别数据仍较稀缺。该数据集由Electric Sheep Africa于2026年基于ILOSTAT元数据标准化构建,覆盖31个非洲国家、2007至2025年间2059条观测记录,聚焦非正规与正规就业中雇员规模(以千人计)的性别与残疾维度分布。其核心研究问题在于揭示非洲劳动力市场中非正规就业的性别差异与残障群体参与状况,为劳动经济学、发展研究与包容性政策分析提供可复用的结构化证据,并推动了非洲开放数据基础设施在机器学习场景下的可发现性。
当前挑战
数据集所回应的领域问题在于:非洲非正规经济就业统计长期存在性别与残疾维度交叉分类的空白,难以支撑精准的劳动市场政策评估。构建过程中的挑战涵盖多重层面:源数据按国别、年份与指标分散于ILOSTAT体系,标准化对齐需协调不同国家统计口径与报告周期;非正规就业与残疾状况的定义在国际比较中缺乏统一操作化标准,易引入测量偏差;元数据中country与upstream_publisher字段缺失,地理归属需依赖标题推断,增加了分析假设负担;低收入国家残障群体就业数据可能存在系统性漏报或缺失,需在建模前审慎评估缺失机制,避免插补规则掩盖结构性偏差。
常用场景
经典使用场景
在劳动经济学与非正规经济研究的交汇处,该数据集凭借其覆盖三十一个非洲国家、跨越近二十年的两千余条观测,成为刻画非洲劳动力市场中性别、就业形态与残疾状况交互格局的基准性资源。研究者通常以国别与年份为双重视角,将正规与非正规就业人数按性别与残疾状态分层,构建面板数据或进行横截面比较,以揭示非正规部门吸纳劳动力的结构性特征。其表格化与文本化并存的形态,亦便于开展特征工程、缺失值诊断与分类回归建模,从而支撑可复现的实证分析流程。
解决学术问题
该数据集直面长期困扰劳动统计研究的核心难题,即非正规就业与残疾身份交叉维度上的数据稀缺与碎片化,为检验残障群体在正规与非正规部门中的就业分布差异提供了量化基础。它使得学者得以在跨国比较框架下探究性别与残疾双重边缘化机制,评估非正规经济对弱势群体就业的缓冲或固化效应。其意义在于将以往多依赖国别调查或定性叙述的议题,推进到可跨时空比较的实证层面,为包容性劳动政策研究提供了可复用的经验证据基础。
衍生相关工作
围绕该数据集,已有工作沿两条脉络展开,一是在 Electric Sheep Africa 元数据目录框架下将其与同源非洲劳动统计数据集进行国别与指标层面的关联整合,二是以 ILOSTAT 原始口径为基准开展非正规就业测度与残疾就业差距的跨国比较研究。这些衍生实践推动了非洲劳动统计数据在 Hugging Face 平台上的标准化封装与可发现性建设,并为后续构建机器学习驱动的劳动市场预测模型提供了数据准备与基准参照。
以上内容由遇见数据集搜集并总结生成



