遇见数据集

electricsheepafrica/africa-ilo-luu-xlu2-sex-edu-rt-combined-rate-of-time-related-underemployment-and

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别和教育划分的时间相关就业不足和失业综合率(LU2)| 非洲(ILOSTAT),是一个关于劳动力未充分利用的表格数据集,专注于非洲地区。它包含5,907个观测值,覆盖34个非洲国家,时间跨度为1991年至2025年。核心指标是LUU_XLU2_SEX_EDU_RT,即按性别和教育划分的时间相关就业不足和失业综合率(百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API直接获取,并过滤为非洲国家代码。数据集包含多列,如国家代码(ref_area)、国家名称、数据来源(source)、指标代码(indicator)、性别分类(sex)、教育分类(classif1)、年份(time)、观测值(obs_value)、观测状态(obs_status)以及相关注释列,支持按性别(总计、男性、女性)等维度进行细分。数据为年度频率,经过ILO标准化处理,适用于表格分类、回归或时间序列预测等NLP相关任务。数据集由Electric Sheep Africa重新打包发布,采用CC-BY-4.0许可证。

--- license: CC BY 4.0 language: - 英语 task_categories: - 表格分类(tabular-classification) - 表格回归(tabular-regression) - 时间序列预测(time-series-forecasting) multilinguality: 单语(monolingual) size_categories: - 1000 < 样本数 < 10000 tags: - 表格数据(tabular) - 非洲(africa) - ILOSTAT(ILOSTAT) - 劳动力未充分利用其他衡量指标(other-measures-of-labour-underutilization) - 国际劳工组织(ILO) - 劳动力(labour) - 就业(employment) pretty_name: "按性别与教育程度划分的时间型不充分就业与失业综合率(LU2) | 非洲(ILOSTAT)" --- # 按性别与教育程度划分的时间型不充分就业与失业综合率(LU2) | 非洲(ILOSTAT) 🌍 **5907条观测样本** · **34个非洲国家** · **1991–2025年** · *由[Electric Sheep Africa](https://huggingface.co/electricsheepafrica)重新整理发布* ![行数](https://img.shields.io/badge/rows-5,907-blue) ![覆盖国家](https://img.shields.io/badge/countries-34-green) ![时间跨度](https://img.shields.io/badge/years-1991–2025-orange) ![指标数量](https://img.shields.io/badge/indicators-1-purple) ![许可证](https://img.shields.io/badge/license-cc-by-4.0-lightgrey) ## 核心摘要 本数据集包含**5907条观测样本**的`劳动力未充分利用其他衡量指标`数据,覆盖**34个非洲国家**,时间跨度为**1991–2025年**,涵盖**1项专属指标**。 ## 数据源说明 **ILOSTAT(国际劳工组织统计数据库)**是国际劳工组织(ILO)的核心统计数据库,是全球领先的劳动力统计权威来源。其收录的指标涵盖就业、失业、薪资、工作时长、童工、非正规经济、社会保障、职业伤害以及可持续发展目标(SDG)体面工作相关目标——数据来源于全国劳动力调查、家庭收入调查、机构调查以及行政记录,覆盖全球200余个经济体,由国际劳工组织统计司负责数据标准化工作。 - **原始来源**:[ILOSTAT](https://www.ilo.org/shinyapps/bulkexplorer/?id=LUU_XLU2_SEX_EDU_RT) - **发布方**:国际劳工组织(ILO) - **许可证**:[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) - **主题**:劳动力未充分利用其他衡量指标(other-measures-of-labour-underutilization) ## 数据处理方法 本数据集直接从ILOSTAT的REST API接口`https://rplumber.ilo.org/data/indicator?id=LUU_XLU2_SEX_EDU_RT`拉取数据,并筛选出非洲地区的ISO3国家代码对应数据。ILOSTAT采用国际劳工统计会议(ICLS,International Conference of Labour Statisticians)定义对原始调查微观数据进行标准化处理;数据来源会在`source.label`字段中标记,以保证可追溯性。 ## 地理覆盖范围 34个非洲国家,以下为按行数排序的前10个国家示例: | 国家代码 | 行数 | 起始年份 | 结束年份 | |---------|-----:|-----------:|----------:| | `ZAF` | 816 | 2008 | 2024 | | `RWA` | 392 | 2014 | 2025 | | `GHA` | 344 | 1991 | 2024 | | `MUS` | 332 | 2012 | 2019 | | `ZMB` | 317 | 2017 | 2024 | | `UGA` | 303 | 2010 | 2021 | | `AGO` | 297 | 2019 | 2025 | | `SEN` | 278 | 2011 | 2024 | | `BWA` | 271 | 2006 | 2024 | | `ZWE` | 267 | 2011 | 2024 | | `MLI` | 204 | 2018 | 2024 | | `EGY` | 195 | 2016 | 2024 | | `NGA` | 185 | 2019 | 2024 | | `ETH` | 139 | 2005 | 2021 | | `KEN` | 129 | 2019 | 2022 | | ... | _其余19个国家_ | | | ## 指标(示例) - `LUU_XLU2_SEX_EDU_RT` — 按性别与教育程度划分的时间型不充分就业与失业综合率(LU2,单位:%) ## 数据结构 | 字段名 | 数据类型 | 字段说明 | 示例值 | |--------|------|-------------|---------| | `ref_area` | 字符串(string) | ISO 3166-1 alpha-3 国家代码 | `AGO` | | `ref_area.label` | 字符串(string) | 英文国家名称 | `Angola` | | `source` | 字符串(string) | ILOSTAT 来源代码(如劳动力调查) | `BA:13951` | | `source.label` | 字符串(string) | 英文来源名称 | `LFS - Employment Survey` | | `indicator` | 字符串(string) | ILOSTAT 指标代码 | `LUU_XLU2_SEX_EDU_RT` | | `indicator.label` | 字符串(string) | 英文指标名称 | `Combined rate of time-related underem…` | | `sex` | 字符串(string) | 性别细分维度(`SEX_T` 表示总计,`SEX_M` 表示男性,`SEX_F` 表示女性) | `SEX_T` | | `sex.label` | 字符串(string) | — | `Total` | | `classif1` | 字符串(string) | 第一分类变量(年龄、教育程度、就业状态等) | `EDU_AGGREGATE_TOTAL` | | `classif1.label` | 字符串(string) | — | `Education (Aggregate levels): Total` | | `time` | 64位整数(int64) | 观测年份 | `2025` | | `obs_value` | 64位浮点数(float64) | 观测指标值(单位详见对应指标定义) | `11.141` | | `obs_status` | 字符串(string) | 观测状态标记(如临时数据、不可靠数据) | `U` | | `obs_status.label` | 字符串(string) | — | `Unreliable` | | `note_classif` | 字符串(string) | — | `C3:2620` | | `note_classif.label` | 字符串(string) | — | `Nonstandard education level: Includin…` | | `note_indicator` | 字符串(string) | — | `I11:264` | | `note_indicator.label` | 字符串(string) | — | `Break in series: Methodology revised` | | `note_source` | 字符串(string) | — | `R1:3513` | | `note_source.label` | 字符串(string) | — | `Repository: ILO-STATISTICS - Micro da…` | ## 细分维度 以下字段提供数据细分维度: - **`sex`**(共3个唯一取值):`SEX_T`、`SEX_M`、`SEX_F` ## 数据质量与注意事项 - 数据为年度频率。部分指标同时发布月度或季度序列,但本数据集未包含此类数据。 - 当同一国家×年份的同一指标存在多个数据源时,将采用国际劳工组织选定的“最优数据源”。 - 细分维度字段(`sex`、`classif1`、`classif2`)仅在指标支持对应细分时才会非空。 ## 使用示例 python from datasets import load_dataset ds = load_dataset("electricsheepafrica/africa-ilo-luu-xlu2-sex-edu-rt-combined-rate-of-time-related-underemployment-and") df = ds["train"].to_pandas() print(df.head()) ### 筛选单个国家 python kenya = df[df["ref_area"] == "KEN"] ### 单指标时间序列可视化 python sample = (df[df["indicator"] == "LUU_XLU2_SEX_EDU_RT"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="LUU_XLU2_SEX_EDU_RT") ### 转换为国家×年份矩阵 python matrix = (df[df["indicator"] == "LUU_XLU2_SEX_EDU_RT"] .pivot_table(index="time", columns="ref_area", values="obs_value")) print(matrix.tail()) ## 引用格式 bibtex @misc{africa_ilo_luu_xlu2_sex_edu_rt_combined_rate_of_time_related_underemployment_and_2025, title = {Combined rate of time-related underemployment and unemployment (LU2) by sex and education | Africa (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=LUU_XLU2_SEX_EDU_RT}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Africa}, howpublished = {url{https://huggingface.co/datasets/electricsheepafrica/africa-ilo-luu-xlu2-sex-edu-rt-combined-rate-of-time-related-underemployment-and}} } ## 许可证 本数据集采用[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)许可协议发布。 原始数据版权归国际劳工组织(ILO)所有。使用本数据集时,请同时引用上述原始数据源以及Electric Sheep Africa的重新整理版本。 ## 关于Electric Sheep Africa Electric Sheep Africa是Electric Sheep使命的一部分:旨在HuggingFace平台上构建统一的、适用于机器学习的非洲地区数据层。我们从权威开放数据源拉取数据,标准化数据结构,以Parquet格式打包,并发布格式统一的数据集卡片,以便研究人员与开发者仅需调用`load_dataset()`即可快速开展工作。 浏览完整数据集集合:[huggingface.co/electricsheepafrica](https://huggingface.co/electricsheepafrica) _数据溯源:2026年5月26日通过Electric Sheep数据流水线获取。原始数据源URL:https://www.ilo.org/shinyapps/bulkexplorer/?id=LUU_XLU2_SEX_EDU_RT_

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-luu-xlu2-sex-edu-rt-combined-rate-of-time-related-underemployment-and 数据集图片
构建方式
该数据集源自国际劳工组织统计数据库(ILOSTAT)中关于劳动力未充分利用的指标记录,由Electric Sheep Africa团队按照标准化元数据规范进行重新封装。原始数据涵盖34个非洲国家1991至2025年间与时间相关的工作不足与失业综合比率(LU2)的观测值,按性别与教育程度分类,经清洗与格式转换后以Parquet列式存储格式发布,形成包含5907条记录的表格数据集,构建过程中保留原始缺失值并标注了来源与发布者等元数据缺口,以确保分析链条可追溯。
使用方法
研究者可通过Hugging Face的datasets库调用load_dataset函数加载该数据集,获取默认划分后查看特征结构与样本记录,并借助to_pandas方法转换为数据框以适配常规分析流程。使用前应查阅仓库文件确认变量定义与计量单位,明确国家、年份与指标字段后开展缺失值概览、地理与时间维度的分布剖析,并可依据显式国家、年份与指标字段与其他Electric Sheep Africa数据集进行连接,在建模前审慎处理缺失值并记录任何地理假设。
背景与挑战
背景概述
国际劳工组织长期致力于劳动市场统计标准的制定与数据发布,其ILOSTAT数据库为全球劳动力市场分析提供了权威基准。在此背景下,Electric Sheep Africa于2026年将ILOSTAT中关于非洲地区性别与教育维度的劳动力利用不足综合指标(LU2)数据加以整理,发布了覆盖34个非洲国家、时间跨度为1991至2025年的面板数据集。该数据集聚焦于时间相关就业不足与失业的复合比率,为探究非洲劳动力市场结构性问题、教育回报差异及性别不平等提供了量化基础,亦为劳动经济学与区域发展研究提供了可复现的数据支撑。
当前挑战
该数据集所面对的领域问题在于精准刻画非洲劳动力市场中时间相关就业不足与失业的叠加状态,其复合指标须兼顾统计口径的一致性与跨国可比性。构建过程中,源数据跨越三十余年,各国统计能力与报告标准差异显著,导致缺失值与口径漂移难以避免;性别与教育维度的交叉分层进一步加剧了样本稀疏问题;此外,数据集元数据中地理标识与上游出版者信息存在缺漏,为下游分析的变量对齐与溯源带来挑战。如何在保留原始数据真实性的前提下,妥善处理缺失机制与定义歧义,构成该数据集应用的核心难点。
常用场景
经典使用场景
在劳动经济学与非洲发展研究的交叉领域,该数据集通常被用于刻画非洲国家劳动力市场中时间相关就业不足与失业的叠加态势。研究者借助其涵盖1991至2025年、34个非洲国家的5907条观测,按性别与教育程度两个维度展开横截面与时序分析,考察不同性别和受教育群体在劳动力利用不足方面的结构性差异。数据集的表格化组织方式便于直接进行分组聚合与趋势比较,常被用于绘制区域劳动力市场脆弱性图谱,并为跨国比较研究提供一致的口径基础。
解决学术问题
该数据集回应了非洲劳动力市场研究中长期存在的测量口径不统一与细分维度缺失问题。传统失业率指标难以捕捉时间相关就业不足这一隐性劳动利用不足形态,而将LU2综合比率按性别与教育程度拆分后,研究者得以检验教育扩张是否真正改善了劳动利用效率,以及性别不平等在就业不足中的表现。该数据集使跨国面板分析成为可能,为探究教育回报、性别差距与劳动市场制度之间的关系提供了可复用的经验基础,对发展经济学与劳动政策评估具有实质意义。
实际应用
在实际应用层面,该数据集可服务于国际组织与非洲各国统计部门在就业监测与政策制定中的需求。劳工政策分析人员能够依据性别与教育分层结果,识别劳动利用不足最为严重的群体,从而设计更具针对性的技能培训与就业促进项目。发展金融机构与研究人员亦可将其作为国别风险评估的输入变量,结合其他社会经济数据构建预警或评估模型。由于数据以parquet格式发布并附有标准化的加载指引,便于在可复现的研究流程与自动化分析管道中直接调用。
数据集最近研究
最新研究方向
在非洲劳动力市场监测与包容性增长议题持续升温的背景下,该数据集以ILOSTAT的LU2指标为核心,整合了34个非洲国家1991至2025年间按性别与教育程度分组的工时相关就业不足与失业合并率,为刻画劳动力利用不足的结构性特征提供了长时序、跨国别的微观证据基础。当前前沿研究正借助此类面板数据,运用机器学习与计量模型识别性别与教育维度上的异质性脆弱群体,并探索就业不足与非正规经济、技能错配之间的动态关联。该数据集亦支撑联合国可持续发展目标中体面工作议程的量化评估,为非洲各国制定精准劳动力政策、缩小性别与教育鸿沟提供可复现的数据支撑,具有显著的学术与政策意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务