遇见数据集

africa-ilo-emp-temp-sex-age-nb-employment-by-sex-and-age-thousands

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

该数据集是国际劳工组织(ILO) ILOSTAT数据库中关于非洲就业统计的标准化表格数据集,由Electric Sheep Africa项目重新打包发布。核心内容为按性别和年龄划分的就业人数(千人)这一指标,包含31,194个观测值,覆盖53个非洲国家,时间跨度为1970年至2025年。数据来源于ILO的权威劳动力统计数据库ILOSTAT,整合了多种数据源如劳动力调查、家庭收入调查等,并使用国际劳工统计学家会议(ICLS)的定义进行标准化处理。数据集通过ILOSTAT REST API获取,专门筛选了非洲国家的数据。包含14个字段,包括国家代码和名称、数据来源、指标、性别分类、年龄分类、观测年份、观测数值、观测状态标志等。性别维度提供总计、男性和女性三种分类。适用于表格分类、回归分析和时间序列预测等机器学习任务,可用于研究非洲各国就业趋势、性别差异、年龄结构变化等社会经济问题。数据为年度频率,当同一国家同一年份有多个数据源时,采用ILO选择的最佳来源。数据以Parquet格式发布,便于使用Hugging Face Datasets库直接加载。

This dataset is a standardized tabular dataset on African employment statistics from the International Labour Organization (ILO) ILOSTAT database, repackaged and released by the Electric Sheep Africa project. The core content is the indicator Employment by sex and age (thousands), containing 31,194 observations covering 53 African countries, with a time span from 1970 to 2025. The data is sourced from ILOs authoritative labor statistics database, ILOSTAT, which integrates various data sources such as labor force surveys, household income surveys, enterprise surveys, and administrative records, and is standardized using definitions from the International Conference of Labour Statisticians (ICLS). The dataset is obtained via the ILOSTAT REST API and specifically filtered for African countries. It includes 14 fields, covering country codes and names, data sources, indicators, gender classifications, age classifications, observation years, observation values, observation status flags, etc. The gender dimension provides three categories: total, male, and female. It is suitable for machine learning tasks such as tabular classification, regression analysis, and time series forecasting, and can be used to study socio-economic issues like employment trends, gender disparities, and age structure changes across African countries. The data is at an annual frequency, and when multiple data sources exist for the same country and year, the best source selected by ILO is used. The data is released in Parquet format, facilitating direct loading with the Hugging Face Datasets library.

创建时间:
2026-05-25
原始信息汇总

数据集概述:Employment by sex and age (thousands) | Africa (ILOSTAT)

该数据集由 Electric Sheep Africa 重新打包发布,源自国际劳工组织(ILO)的 ILOSTAT 数据库,提供了非洲地区按性别和年龄划分的就业人数(单位:千)数据。

核心信息

  • 观测数量:31,194 条
  • 覆盖国家:53 个非洲国家
  • 时间跨度:1970年至2025年
  • 指标数量:1 个独立指标
  • 许可协议:Creative Commons Attribution 4.0 International (CC BY 4.0)

数据来源与处理

  • 来源:数据通过 ILOSTAT REST API 拉取(指标代码:EMP_TEMP_SEX_AGE_NB),并过滤至非洲国家(ISO3 国家代码)。
  • 出版商:国际劳工组织(ILO)
  • 处理方式:Electric Sheep Africa 对原始数据进行了标准化和重打包,以 Parquet 格式发布,便于通过 load_dataset() 直接使用。

地理覆盖范围(示例)

数据涵盖 53 个非洲国家,以下为观测数量最多的前 15 个国家:

国家代码 行数 起始年份 结束年份
ZAF (南非) 2,118 1994 2024
MUS (毛里求斯) 2,115 1990 2024
EGY (埃及) 1,761 1970 2024
TUN (突尼斯) 1,585 1989 2023
BWA (博茨瓦纳) 1,182 1985 2024
MLI (马里) 1,104 1997 2024
RWA (卢旺达) 1,008 1988 2025
ZMB (赞比亚) 953 1986 2024
GHA (加纳) 939 1988 2024
MAR (摩洛哥) 928 1982 2022
SYC (塞舌尔) 920 1981 2024
AGO (安哥拉) 900 1992 2025
ZWE (津巴布韦) 852 1982 2024
TZA (坦桑尼亚) 843 2001 2024
SEN (塞内加尔) 787 1991 2024

数据模式(Schema)

数据集包含以下主要字段:

列名 类型 描述 示例
ref_area string ISO 3166-1 alpha-3 国家代码 AGO
ref_area.label string 国家英文名称 Angola
source string ILOSTAT 数据源代码 BA:13951
source.label string 数据源英文名称 LFS - Employment Survey
indicator string ILOSTAT 指标代码 EMP_TEMP_SEX_AGE_NB
indicator.label string 指标英文名称 Employment by sex and age (thousands)
sex string 性别分类(SEX_T=总计, SEX_M=男性, SEX_F=女性) SEX_T
sex.label string 性别标签 Total
classif1 string 第一个分类变量(如年龄) AGE_YTHADULT_YGE15
classif1.label string 分类标签 Age (Youth, adults): 15+
time int64 观测年份 2025
obs_value float64 观测值(单位:千) 13984.984
obs_status string 观测状态标志 B
obs_status.label string 状态标签 Break in series
note_classif string 分类注释代码 C6:2289
note_classif.label string 分类注释 Nonstandard age group: Including ages…
note_indicator string 指标注释代码 I11:264
note_indicator.label string 指标注释 Break in series: Methodology revised
note_source string 数据源注释代码 R1:3513
note_source.label string 数据源注释 Repository: ILO-STATISTICS - Micro da…

主要指标

  • EMP_TEMP_SEX_AGE_NB:按性别和年龄划分的就业人数(单位:千)

分类维度

  • sex(3 个唯一值):SEX_T(总计)、SEX_M(男性)、SEX_F(女性)

数据质量与注意事项

  • 数据为年度频率,不包含月度或季度序列。
  • 当同一国家×年份组合存在多个数据源时,使用 ILO 选择的“最佳数据源”。
  • 分类字段(如 sex、classif1)仅在指标发布相应细分时才有值。
  • 部分观测值可能带有状态标志(如“序列断裂”),需谨慎使用。

使用示例

python from datasets import load_dataset

ds = load_dataset("electricsheepafrica/africa-ilo-emp-temp-sex-age-nb-employment-by-sex-and-age-thousands") df = ds["train"].to_pandas()

引用方式

bibtex @misc{africa_ilo_emp_temp_sex_age_nb_employment_by_sex_and_age_thousands_2025, title = {Employment by sex and age (thousands) | Africa (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_TEMP_SEX_AGE_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Africa}, howpublished = {url{https://huggingface.co/datasets/electricsheepafrica/africa-ilo-emp-temp-sex-age-nb-employment-by-sex-and-age-thousands}} }

搜集汇总
数据集介绍
africa-ilo-emp-temp-sex-age-nb-employment-by-sex-and-age-thousands 数据集图片
构建方式
该数据集由Electric Sheep Africa团队从ILOSTAT官方REST API接口直接抽取,针对非洲53个国家的ISO3国家代码进行过滤,并整合了国际劳工组织(ILO)根据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调后的标准化指标数据。数据集以Parquet格式封装,确保机器学习的即用性,研究人员可通过单行命令快速加载。
特点
数据集涵盖1970年至2025年间非洲53个国家的劳动力就业观测值,共计31,194条记录,聚焦于“按性别与年龄划分的就业人数(千人)”这一核心指标。数据按性别(总、男、女)进行分类,包含丰富的元信息列,如数据来源、观察值状态、分类注释等,便于用户评估数据质量并追溯来源,具有较高的透明度和可解释性。
使用方法
使用HuggingFace Datasets库的load_dataset函数即可直接加载该数据集,转换为pandas DataFrame后进行分析。用户可按国家代码进行筛选,按时间序列绘制特定指标的观测值变化趋势,或通过数据透视表构建国家×年份的矩阵格式,以支持时间序列预测、表格回归与分类等下游任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT编制,并由Electric Sheep Africa于2025年重新打包发布,聚焦于非洲53个国家1970年至2025年间的就业数据,涵盖性别与年龄的细分维度,总计31,194条观测记录。作为劳动统计领域的权威来源,ILOSTAT整合了来自各国劳动力调查、家庭收入调查及行政记录的数据,并遵循国际劳工统计学家会议(ICLS)的定义进行标准化处理。该数据集的发布填补了非洲大陆在长期、可比性劳动统计数据方面的空白,为研究非洲劳动力市场的结构性变迁、性别差异以及人口老龄化对就业的影响提供了关键数据支撑,在区域发展经济学和劳动经济学领域具有重要的学术与应用价值。
当前挑战
该数据集面临的核心挑战在于非洲各国数据质量与采集标准的不一致性。首先,领域方面,非洲大陆存在大量非正规经济就业,其统计口径在各国间差异显著,单纯依赖官方调查数据难以全面反映真实就业状况;其次,构建过程中,数据源标注的“最佳来源”选择机制虽能优化代表性,但诸如“序列中断”(Break in series)等标识揭示了方法论修订或调查框架变更导致的时间序列不连贯问题,同时,部分国家数据覆盖年份稀疏,如仅提供近二十年的记录,限制了长周期趋势分析的稳健性。此外,分类变量中非标准年龄组的存在进一步增加了跨国比较的复杂性。
常用场景
经典使用场景
该数据集作为非洲大陆劳动就业状况的权威统计资源,经典使用场景聚焦于多维度就业趋势分析。研究者可基于53个国家、跨越半个世纪的时序观测,按性别与年龄层次精细剖析就业人口分布格局。借助其丰富的分类维度,包括性别细分(总人数、男性、女性)及年龄组别划分,学术界得以构建面板数据模型,开展非洲区域性劳动力市场演变的纵向比较研究。例如,可通过固定效应模型或动态面板回归,探究不同年龄层就业弹性随时间的变化轨迹,或是评估性别就业差距在经济社会发展进程中的收敛与分化特征。数据集的年度频次与多国覆盖特性,使其成为计量经济学分析中不可或缺的基石。
解决学术问题
该数据集在学术层面主要解决了非洲劳动经济研究中长期面临的数据碎片化与可比性缺失的困境。通过国际劳工组织(ILO)统一协调的统计口径,它有效克服了各国因调查方法、定义差异带来的测量偏误,为跨国比较研究提供了标准化的基准。研究者得以系统性地探讨人口结构变迁对就业市场的冲击效应,量化性别就业不平等的动态演变,以及评估经济周期与制度变革(如劳工政策调整)对特定群体就业的影响。数据集的存在催生了关于非洲“人口红利”实现路径、非正规就业转化机制等前沿议题的实证检验,显著提升了该区域劳动经济学研究的严谨性与全球对话能力。
衍生相关工作
该数据集衍生了一系列具有影响力的相关工作,推动了非洲劳动经济学与计算社会科学领域的交叉融合。经典衍生成果包括基于该数据训练的就业预测模型,例如利用长短期记忆网络(LSTM)与时间序列分解技术,预测未来五年内非洲各国的分性别、分年龄就业趋势。另有学者将该数据集与宏观经济面板(如GDP、通货膨胀率)融合,构建了非洲就业弹性贝叶斯层次模型,揭示了产业结构转型对就业吸收能力的非线性影响。此外,围绕数据可视化与交互式仪表盘的工具开发也颇为活跃,如构建非洲就业地图集,实现国家间就业结构的实时对比。数据集的标准化格式与HuggingFace平台的无缝集成,进一步催生了可复用的机器学习基线,便于后来者直接开展基准测试与模型改进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务