遇见数据集

electricsheepafrica/africa-ilo-ees-tees-sex-age-eco-nb-employees-by-sex-age-and-economic-activity-thousan

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含274,111个观测值,覆盖49个非洲国家,时间跨度为1982年至2025年,核心指标为按性别、年龄和经济活动划分的雇员数据(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,提供了按性别(总计、男性、女性)、年龄组和经济活动部门细分的雇员统计信息。数据集适用于表格分类、回归和时间序列预测等任务,经过Electric Sheep Africa重新打包为机器学习就绪格式,以方便研究人员和开发者使用。

This dataset contains 274,111 observations across 49 African countries, spanning the years 1982 to 2025, with the core indicator Employees by sex, age and economic activity (thousands). Sourced from the International Labour Organization (ILO) ILOSTAT database, it provides employee statistics disaggregated by sex (total, male, female), age groups, and economic activity sectors. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, repackaged by Electric Sheep Africa into a machine-learning-ready format for ease of use by researchers and developers.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ees-tees-sex-age-eco-nb-employees-by-sex-age-and-economic-activity-thousan 数据集图片
构建方式
该数据集以国际劳工组织统计数据库(ILOSTAT)为原始数据源,由Electric Sheep Africa团队进行工程化再加工而成。构建过程遵循标准化元数据著录规范,将原始统计记录整理为Parquet格式,并配以统一的数据字典、来源标注与使用指引。数据集汇集了49个非洲国家自1982年至2025年间的雇员统计观测,合计274,111条记录,按性别、年龄组与经济活动类别进行分组,单位为千人。构建过程中保留了缺失值的原始状态,未施加插补处理,并对国家、年份与指标字段进行了显式结构化标引,以确保跨国比较与时间序列分析的可复现性。
特点
该数据集以非洲劳动力市场为地理核心,覆盖范围广泛且时间跨度逾四十年,兼具横截面与纵贯分析的双重价值。其突出特征在于维度设计的多层性,将性别、年龄组与经济活动类别交叉嵌套,使研究者得以在细分层次上考察就业结构的异质性。数据以表格与文本混合模态呈现,文件规模介于十万至百万行之间,适合中大规模统计建模。元数据标签体系涵盖劳动、就业、经济学与金融等主题,并附有标准引用信息与许可声明,为数据溯源与学术引用提供了规范化支撑。
使用方法
研究者可通过Hugging Face的datasets库以单行代码加载该数据集,进而访问其数据表、特征结构与样本记录。加载后可将指定数据切分转换为Pandas数据框,以便开展描述性统计、缺失模式诊断与可视化探索。在使用过程中,建议先行核验变量的定义、单位与编码方式,再依据国家、年份与指标字段进行跨数据集联结或分组回归分析。对于缺失值,应在建立可辩护的插补规则之前予以保留,并在下游分析中明确记录地理归属的推断假设,以确保研究结论的稳健性与可重复性。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于构建全球劳动力统计的标准框架,其核心数据库ILOSTAT为比较各国就业结构提供了权威依据。在此脉络下,Electric Sheep Africa于2026年将ILOSTAT中非洲区域的就业人员数据重新整理发布,形成涵盖49个非洲国家、1982年至2025年、共计274111条观测的标准化数据集。该数据集按性别、年龄组和经济活动部门对就业人员规模(以千人为单位)进行细分,为非洲劳动市场的结构性分析、性别就业差距测算以及非正规经济部门研究提供了可复现的数据基础,亦与联合国可持续发展目标中体面劳动议题形成呼应。
当前挑战
该数据集所回应的领域问题在于非洲劳动力市场统计长期面临的碎片化与可比性不足——各国就业定义、年龄分组口径及经济活动分类标准存在显著差异,跨国面板分析因此困难重重。在构建过程中,原始ILOSTAT数据的元数据完整性构成主要障碍:本数据集缺失国家标识与上游发布者字段,ISO3覆盖未予声明,地理归属仅能从标题或来源语境中推定。此外,部分年份与国家的观测值存在缺失,经济活动分类的版本变迁亦可能导致时序断裂。如何在保留缺失值的同时建立可辩护的插补规则,并避免从标签本身推断政策含义,是使用该数据集时需审慎应对的方法论挑战。
常用场景
经典使用场景
在劳动经济学与人口统计学的交汇地带,该数据集凭借其覆盖49个非洲国家、1982至2025年逾二十七万条观测的时空纵深,构成了刻画非洲大陆就业结构的经典语料。研究者通常以其为基座,依照性别、年龄组与经济活动部门三重维度,对各国雇员人数的分布形态进行横截面比较与历时性追踪,进而揭示非洲劳动力市场中性别分层与年龄分化的演变轨迹。
解决学术问题
该数据集所直面的核心学术命题,在于非洲劳动统计长期存在的碎片化与口径不一问题。ILOSTAT的标准化框架将分散于各国统计机构的雇员数据加以整合,为跨国面板分析提供了统一尺度,使研究者得以检验诸如经济结构转型与女性劳动参与率关联、青年就业脆弱性等假设,其意义在于将非洲劳动市场研究从个案叙事推进至可比性实证阶段。
衍生相关工作
基于该数据集及其所属的Electric Sheep Africa目录,研究者已衍生出若干经典工作方向,包括非洲各国就业结构的聚类分析、劳动参与率的空间计量建模,以及与人口普查、家庭调查数据的多源融合研究。这些工作进一步丰富了ILOSTAT数据在机器学习与可复现分析框架下的应用生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务