遇见数据集

electricsheepafrica/africa-ilo-ees-tees-sex-geo-nb-employees-by-sex-and-rural-urban-areas-thousands

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含45个非洲国家的2,087个“雇员”观测数据,时间跨度为1994年至2025年,涵盖1个不同的指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,重点关注按性别和城乡地区分类的雇员数量(以千计)。数据集经过重新包装,以表格形式提供,适用于表格分类、回归和时间序列预测等任务。

--- license: CC BY 4.0 language: - en task_categories: - 表格分类(tabular-classification) - 表格回归 - 时间序列预测 multilinguality: 单语言 size_categories: - 1K<n<10K tags: - 表格数据 - 非洲 - ILOSTAT - 雇员 - 国际劳工组织(ILO) - 劳工 - 就业 pretty_name: "分性别与城乡地区雇员人数(单位:千人)| 非洲(ILOSTAT)" --- # 分性别与城乡地区雇员人数(单位:千人)| 非洲(ILOSTAT) 🌍 **共2087条观测记录** · **覆盖45个非洲国家** · **时间跨度为1994年至2025年** · *由[Electric Sheep Africa](https://huggingface.co/electricsheepafrica)重新封装* ![行数](https://img.shields.io/badge/rows-2,087-blue) ![覆盖国家](https://img.shields.io/badge/countries-45-green) ![时间范围](https://img.shields.io/badge/years-1994–2025-orange) ![指标数量](https://img.shields.io/badge/indicators-1-purple) ![许可证](https://img.shields.io/badge/license-cc-by-4.0-lightgrey) ## 核心摘要 本数据集包含**覆盖45个非洲国家的雇员数据**,共**2087条观测记录**,时间跨度为**1994年至2025年**,仅包含**1项独立指标**。 ## 数据源说明 **国际劳工组织统计数据库(ILOSTAT)** 是国际劳工组织(International Labour Organization, ILO)的核心统计数据库,也是全球领先的劳工统计权威来源。该数据库整合了就业、失业、薪资、工作时长、童工、非正规经济、社会保障、职业伤害以及可持续发展目标(SDG)体面工作目标等领域的指标,数据来源于全国劳动力调查、住户收入调查、机构调查及行政记录。其覆盖范围超过200个经济体,数据协调工作由国际劳工组织统计部门负责完成。 - **数据源:** [ILOSTAT](https://www.ilo.org/shinyapps/bulkexplorer/?id=EES_TEES_SEX_GEO_NB) - **发布方:** 国际劳工组织(ILO) - **许可证:** [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) - **主题:** 雇员 ## 数据处理方法 本数据集直接从ILOSTAT的REST API接口`https://rplumber.ilo.org/data/indicator?id=EES_TEES_SEX_GEO_NB`获取数据,并筛选出非洲国家的ISO 3166-1 alpha-3国家代码。ILOSTAT采用**国际劳工统计学家会议(International Conference of Labour Statisticians, ICLS)**的定义对原始调查微观数据进行协调统一;数据来源将在`source.label`字段中标记,以保证可追溯性。 ## 地理覆盖范围 覆盖45个非洲国家,以下按观测行数排序展示部分国家: | 国家代码 | 观测行数 | 起始年份 | 结束年份 | |---------|-----:|-----------:|----------:| | `ZAF` | 156 | 2008 | 2024 | | `EGY` | 144 | 2008 | 2024 | | `TUN` | 117 | 2006 | 2021 | | `AGO` | 101 | 2004 | 2025 | | `MLI` | 99 | 2013 | 2024 | | `GHA` | 90 | 2000 | 2024 | | `RWA` | 90 | 2014 | 2025 | | `ZMB` | 84 | 2015 | 2024 | | `SEN` | 72 | 2011 | 2024 | | `NAM` | 63 | 1994 | 2018 | | `UGA` | 63 | 2010 | 2021 | | `ZWE` | 63 | 2011 | 2024 | | `BFA` | 54 | 2014 | 2024 | | `NER` | 54 | 2011 | 2022 | | `CIV` | 54 | 2012 | 2022 | | ... | _30个其余国家_ | | | ## 指标(示例) - `EES_TEES_SEX_GEO_NB` — 分性别与城乡地区雇员人数(单位:千人) ## 数据结构 | 字段名 | 数据类型 | 字段说明 | 示例 | |--------|------|-------------|---------| | `ref_area` | `string` | ISO 3166-1 alpha-3国家代码 | `AGO` | | `ref_area.label` | `string` | 英文国家名称 | `安哥拉` | | `source` | `string` | ILOSTAT来源代码(如劳动力调查) | `BA:13951` | | `source.label` | `string` | 英文来源名称 | `劳动力调查(LFS)` | | `indicator` | `string` | ILOSTAT指标代码 | `EES_TEES_SEX_GEO_NB` | | `indicator.label` | `string` | 英文指标名称(节选) | `Employees by sex and rural / urban ar…` | | `sex` | `string` | 性别细分维度(SEX_T=总计,SEX_M=男性,SEX_F=女性) | `SEX_T` | | `sex.label` | `string` | — | `总计` | | `classif1` | `string` | 一级分类变量(年龄、教育程度、就业状态等) | `GEO_COV_NAT` | | `classif1.label` | `string` | — | `区域类型:全国范围` | | `time` | `int64` | 观测年份 | `2025` | | `obs_value` | `float64` | 观测指标值(单位因指标而异,详见指标定义) | `3788.156` | | `obs_status` | `string` | 观测状态标记(如临时数据、不可靠数据) | `U` | | `obs_status.label` | `string` | — | `数据不可靠` | | `note_indicator` | `string` | — | `I11:264` | | `note_indicator.label` | `string` | — | `序列中断:方法学修订` | | `note_source` | `string` | — | `R1:3513` | | `note_source.label` | `string` | — | `存储库:国际劳工组织统计司-微观数据(节选)` | ## 细分维度 以下字段提供数据细分维度: - **`sex`**(共3个唯一取值):`SEX_T`、`SEX_M`、`SEX_F` ## 数据质量与注意事项 - 数据为年度频率。部分指标同时提供月度或季度序列,但本数据集未包含此类数据。 - 若同一国家×年份的同一指标存在多个数据源,将采用国际劳工组织选定的“最优数据源”。 - 细分字段(`sex`、`classif1`、`classif2`)仅在指标支持对应细分维度时非空。 ## 使用方法 python from datasets import load_dataset ds = load_dataset("electricsheepafrica/africa-ilo-ees-tees-sex-geo-nb-employees-by-sex-and-rural-urban-areas-thousands") df = ds["train"].to_pandas() print(df.head()) ### 按国家筛选 python kenya = df[df["ref_area"] == "KEN"] ### 单指标时间序列可视化 python sample = (df[df["indicator"] == "EES_TEES_SEX_GEO_NB"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="EES_TEES_SEX_GEO_NB") ### 转换为国家×年份矩阵 python matrix = (df[df["indicator"] == "EES_TEES_SEX_GEO_NB"] .pivot_table(index="time", columns="ref_area", values="obs_value")) print(matrix.tail()) ## 引用格式 bibtex @misc{africa_ilo_ees_tees_sex_geo_nb_employees_by_sex_and_rural_urban_areas_thousands_2025, title = {Employees by sex and rural / urban areas (thousands) | Africa (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EES_TEES_SEX_GEO_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Africa}, howpublished = {url{https://huggingface.co/datasets/electricsheepafrica/africa-ilo-ees-tees-sex-geo-nb-employees-by-sex-and-rural-urban-areas-thousands}} } ## 许可证 本数据集采用[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)许可证发布。原始数据版权归国际劳工组织(ILO)所有。使用本数据集时,请同时引用上述原始数据源及Electric Sheep Africa的重新封装版本。 ## 关于Electric Sheep Africa Electric Sheep Africa是Electric Sheep项目的组成部分,该项目旨在HuggingFace平台上构建面向非洲的统一、适配机器学习的数据层。我们从权威开源数据源获取数据,对数据结构进行标准化处理,封装为Parquet格式,并发布格式统一的数据集卡片,使研究人员与开发者可通过`load_dataset()`函数在数秒内启动数据分析工作。 浏览完整数据集集合:[huggingface.co/electricsheepafrica](https://huggingface.co/electricsheepafrica) --- _数据溯源:2026年5月26日通过Electric Sheep数据管道摄入。原始数据源URL:https://www.ilo.org/shinyapps/bulkexplorer/?id=EES_TEES_SEX_GEO_NB_

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ees-tees-sex-geo-nb-employees-by-sex-and-rural-urban-areas-thousands 数据集图片
构建方式
该数据集根植于国际劳工组织统计数据库的权威调查框架,由Electric Sheep Africa团队对原始ILOSTAT数据进行系统性重包装而成。构建过程以标准化元数据为纲,整合1994年至2025年间45个非洲国家的2087条观测记录,将城乡二元地理划分与性别维度嵌套于就业人员数量的统计单元之中。数据经格式统一后以Parquet列式存储予以发布,同时对缺失的国别与上游出版方元数据予以留存标注,确保来源可溯、变量定义可核。
特点
数据集以城乡与性别双重视角切分非洲就业版图,覆盖45国逾三十载时序,兼具横截面比较与纵向追踪的双重分析价值。其体量精約,格式规整,采用压缩效率优异的Parquet格式,并以标准化标签体系组织主题检索。数据以千人为计量单位,围绕单一雇员指标展开,缺失值保留原貌而未作插补,为研究者提供了透明可辨的数据质量基线,适用于劳动经济学与区域发展领域的实证探索。
使用方法
数据集借助Hugging Face生态中的datasets库即可便捷加载,调用load_dataset函数传入仓库标识符后自动获取数据分片与特征结构。对于表格型分析需求,可将首个分片转换为Pandas数据框,进而执行描述统计、缺失模式审视与地理及时序维度的分组剖析。研究中宜明确国别字段的时间与空间对齐规则,并在必要时与其他Electric Sheep Africa数据集以国家、年份及指标字段进行联结,构建可复现的分析工作流并规范引用原始出处。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计数据的系统化建设,其ILOSTAT数据库已成为劳动经济学研究不可或缺的基础设施。在非洲大陆,性别与城乡维度下的就业结构差异是理解区域经济发展不均衡、非正规经济扩张以及劳动力市场性别分隔的关键切入点。该数据集由Electric Sheep Africa于2026年整理发布,汇聚了ILOSTAT中45个非洲国家1994至2025年间共计2,087条雇员统计数据,以千人为计量单位,按性别和城乡区域进行细分。其核心研究问题在于揭示非洲各国在城乡二元结构下男女雇员分布的时序演变与空间异质性,为劳动经济学、发展经济学及性别研究提供了可复现的微观面板数据基础。该数据集以标准化元数据和开放许可(CC BY 4.0)降低了非洲数据获取门槛,对推动区域比较研究和循证政策制定具有显著的催化意义。
当前挑战
该数据集所回应的领域问题,在于非洲劳动力市场中性别与城乡维度交叉统计数据的长期稀缺与碎片化,研究者往往难以获取覆盖多国、跨越长时段且变量结构一致的雇员分布数据。在构建过程中,数据面临若干具体挑战:其一,ILOSTAT原始数据的国别报告口径不一,城乡定义与雇员统计标准在各国间存在显著差异,导致跨国可比性受限;其二,部分国家或年份存在数据缺失,面板结构不完全平衡,缺失值的处理需要审慎的插补策略;其三,元数据中 country 与 upstream_publisher 字段存在缺口,地理标识未显式声明ISO3编码,增加了数据链接与溯源的不确定性;其四,性别与城乡分组的交叉维度可能导致小样本单元格的统计可靠性下降,需要在建模时予以识别与规避。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交汇处,该数据集以性别与城乡二元结构为经纬,刻画了非洲45国1994至2025年间就业人口的分布格局。其最经典的使用场景在于跨国比较分析,研究者可借此考察不同国家在女性劳动参与率、城乡就业结构转型等议题上的异质性,进而构建面板数据模型,检验经济发展水平、城镇化进程与性别就业差距之间的动态关联。
衍生相关工作
围绕该数据集,已衍生出若干经典工作,包括基于非洲跨国面板的性别就业差距分解研究、城乡劳动力迁移的引力模型分析,以及将ILOSTAT指标与其他社会经济数据集融合的机器学习预测任务。Electric Sheep Africa的元数据标准化实践亦推动了非洲开放数据生态的构建,促使后续研究者开发出更为精细的次国家层面就业估计方法。
数据集最近研究
最新研究方向
在非洲劳动力市场结构性转型的宏大叙事中,该数据集以性别与城乡二元维度为切入点,为探究就业机会的空间分异与性别鸿沟提供了1994至2025年间45国的连续观测。当前前沿研究正将其与夜间灯光、人口网格及气候冲击等地理参照数据融合,借助可解释机器学习与因果推断框架,识别城市化进程中女性就业参与率的非线性跃迁临界点。与此同时,国际劳工组织近期推动的“体面劳动与城乡均衡”倡议,以及非洲大陆自贸区对非正规就业正规化的政策关切,赋予该数据集超越描述统计的规范价值,使其成为监测区域就业结构韧性、评估性别包容性增长政策成效的关键证据基座。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务