遇见数据集

electricsheepafrica/africa-ilo-eap-teap-sex-age-cct-nb-labour-force-by-sex-age-and-citizenship-thousands

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含国际劳工组织(ILO)ILOSTAT数据库中关于非洲45个国家按性别、年龄和公民身份划分的劳动力(千人)数据,涵盖1991年至2025年期间的12,253个观测值。数据指标为EAP_TEAP_SEX_AGE_CCT_NB,涉及劳动力统计,包括按性别(总计、男性、女性)、年龄(15岁以上)和公民身份(总计)分类的维度。数据集提供结构化表格,包含国家代码、国家名称、数据来源、指标代码、性别分类、年龄分类、公民身份分类、观测年份、观测值、观测状态及相关注释等列。数据来源于ILOSTAT的REST API,经过非洲国家代码过滤,并遵循国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集适用于表格分类、回归和时间序列预测等任务,主要用于劳动力市场分析、移民研究和经济预测。

This dataset contains International Labour Organization (ILO) ILOSTAT data on labour force by sex, age and citizenship (thousands) for 45 African countries, spanning 1991 to 2025 with 12,253 observations. The indicator is EAP_TEAP_SEX_AGE_CCT_NB, covering labour force statistics disaggregated by sex (total, male, female), age (15+), and citizenship (total). The dataset provides a structured table with columns including country code, country name, data source, indicator code, sex classification, age classification, citizenship classification, observation year, observed value, observation status, and related notes. Data is sourced from the ILOSTAT REST API, filtered to African country codes, and harmonized using International Conference of Labour Statisticians (ICLS) definitions. It is suitable for tabular classification, regression, and time-series forecasting tasks, primarily used for labour market analysis, migration research, and economic forecasting.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eap-teap-sex-age-cct-nb-labour-force-by-sex-age-and-citizenship-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,由Electric Sheep Africa团队进行标准化元数据封装与格式转换,构建过程依托其元数据清单自动化流程,将原始统计数据重打包为Parquet格式,并附加涵盖加载指引、来源注释及分析导向语境的标准化卡片。原始观测数据覆盖45个非洲国家,时间跨度为1991年至2025年,共12,253条记录,每条记录涉及按性别、年龄和公民身份分类的劳动力指标(以千人为单位)。整个构建链路保留了可追溯的出版者归属与许可信息,确保数据来源的透明性与可复现性。
特点
数据集以表格与文本模态并存,涵盖经济学与金融领域,聚焦国际移徙者存量及劳动力就业主题,具备非洲区域专属性。观测粒度同时涵盖性别、年龄组与公民身份维度,时间序列自1991年延展至2025年,国家覆盖广泛,共涉及45个非洲国家。规模位于10K至100K区间,以Parquet格式存储,便于高效读取与列式查询。元数据标注了明确的主题标签,如ILOSTAT、国际移徙者存量、劳动力与就业等,为跨域检索与比较分析提供了结构化索引。
使用方法
研究者可通过Hugging Face的datasets库以load_dataset函数直接加载指定仓库路径,获取数据集对象后查看所有划分及特征结构,并打印样本行以初步把握数据布局。对表格型划分,可调用to_pandas方法转换为Pandas数据框,进而执行缺失值审查、地理与时间维度的变量画像以及子组分析。使用时应以数据文件中的变量定义和单位为准,保留缺失值直至确立可辩护的插补规则;若地理信息仅由标题或来源元数据隐含,需在后续分析中明确记录该假设,并可通过显式国家、年份与指标字段与其他Electric Sheep Africa数据集进行联结。
背景与挑战
背景概述
国际劳动力市场统计长期面临性别、年龄与公民身份维度数据割裂的困境,ILOSTAT作为国际劳工组织核心数据库虽具权威性,却鲜有面向非洲区域的多维交叉整合。2026年,Electric Sheep Africa对ILOSTAT原始数据进行标准化重封装,构建了涵盖45个非洲国家、1991至2025年间逾1.2万条观测的劳动力按性别、年龄及公民身份分类数据集,旨在为非洲迁移与就业研究提供可复现的表格化基础。该数据集弥合了国际移民存量与劳动力调查之间的数据鸿沟,对分析非洲跨境劳动力流动、非公民就业结构及性别年龄分层具有重要参考价值,并推动了区域劳动经济学的实证研究议程。
当前挑战
该数据集所回应的领域问题在于,非洲各国劳动力统计长期缺乏按公民身份细分的性别与年龄交叉数据,致使移民劳工的就业参与率、行业分布及脆弱性难以被系统量化。构建过程中,源数据来自多国异构调查体系,指标定义、年龄分组与公民身份分类口径不一,需进行语义对齐与标准化重编码;元数据中缺失国家字段与上游发布者信息,要求分析者显式声明地理假设并审慎处理缺失值。时间跨度三十余年进一步加剧了调查方法变迁的干扰,须在建模前确认变量单位与定义,以规避因标签误读而导致的政策推断偏差。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉领域中,按性别、年龄与公民身份三个维度精细划分劳动力规模,构成了洞察非洲各国劳动力市场结构性差异的基石。该数据集源自国际劳工组织统计数据库,覆盖45个非洲国家自1991年至2025年的12,253条观测,其经典用法在于构建多维面板数据框架,用以刻画不同国籍身份群体在性别与年龄分层下的劳动参与模式。研究者借此可以识别青年劳动力、女性劳动者以及非公民群体在非洲各国劳动力市场中的相对位置与演变轨迹,为跨国比较分析提供标准化、可复现的数据底座。
解决学术问题
该数据集所应对的核心学术问题在于非洲劳动力市场研究中普遍存在的数据碎片化与维度缺失困境。既往研究多受限于单一国家或单一年份的截面信息,难以在性别、年龄与公民身份三重维度上同时展开系统性比较。本数据集以统一的国际劳工组织统计口径整合了跨国、长时段、多分层观测,使研究者得以检验劳动力参与率在人口结构转型、移民政策变动与经济周期波动中的异质性响应,从而深化对非洲非正规就业、移民劳动力融入及性别劳动分工等议题的理论解释力。
衍生相关工作
围绕该数据集已衍生出一系列具有影响力的后续研究,涵盖非洲移民劳动力融入评估、青年失业结构性分析以及性别劳动参与差距分解等方向。部分学者将其与非洲开发银行的社会经济数据库进行跨源链接,构建了更为丰富的多模态分析框架;亦有研究以此为基础,运用机器学习方法对非洲各国劳动力市场韧性进行预测建模。这些工作不仅拓展了国际劳工组织统计数据的应用边界,也为非洲数据科学生态中可复现研究范式的建立提供了重要参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务