遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-edu-geo-nb-employment-outside-the-formal-sector-by-sex-educat

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲23个国家从2000年至2025年期间,按性别、教育程度和城乡地区划分的非正规部门就业人数(以千计)的统计数据。数据集共有19,782条观察值,核心指标为EMP_PIFL_SEX_EDU_GEO_NB,数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取并经过筛选处理。数据集提供了多维度的分类信息,包括性别(总计、男性、女性、其他)、教育程度分类和地理区域类型等字段,并包含数据质量标记和来源注释。该数据集由Electric Sheep Asia重新打包发布,采用CC-BY-4.0许可协议。

This dataset contains statistical data on employment outside the formal sector (in thousands) disaggregated by sex, education level, and rural/urban areas for 23 Asian countries from 2000 to 2025. It comprises 19,782 observations with the core indicator EMP_PIFL_SEX_EDU_GEO_NB, sourced from the International Labour Organizations ILOSTAT database via its REST API and filtered for Asian countries. The dataset provides multi-dimensional classification including sex (total, male, female, other), education classification, and geographic area type, along with data quality flags and source annotations. Repackaged by Electric Sheep Asia and released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-edu-geo-nb-employment-outside-the-formal-sector-by-sex-educat 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接抽取指标EMP_PIFL_SEX_EDU_GEO_NB的数据,并依据ISO3国家代码筛选出亚洲地区。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据来源涵盖劳动力调查、家庭收入调查等,每项观测均标注来源以便追溯。Electric Sheep Asia在此基础上重新打包为Parquet格式,规范字段结构并发布至HuggingFace平台,形成涵盖23个亚洲国家、时间跨度为2000至2025年的19782条观测记录。
使用方法
研究者可通过HuggingFace datasets库以一句load_dataset命令加载数据并转换为Pandas DataFrame,随即开展灵活分析。典型操作包括按国家代码筛选特定经济体、提取单一指标的时间序列并绘图、或利用透视表构建国家与年份的二维矩阵以观察区域差异。数据集同时支持表格分类、回归及时间序列预测等机器学习任务,为亚洲非正规就业的实证研究与政策评估提供便捷的数据接口。
背景与挑战
背景概述
非正规部门就业统计长期构成全球劳动治理的薄弱环节。国际劳工组织(ILO)依托国际劳工统计学家会议(ICLS)第15至17届决议框架,自2000年代起系统推进非正规经济指标的方法论标准化。该数据集由ILO统计部门(Department of Statistics)经ILOSTAT平台于2025年发布,涵盖23个亚洲国家2000至2025年间按性别、教育程度及城乡地域分层的非正规部门就业规模(千人),共计19,782条观测。其核心研究问题在于揭示亚洲发展中经济体非正规就业的结构性分层机制,为体面劳动监测与SDG目标8评估提供可比性基准数据。Electric Sheep Asia将其以ML-ready格式重新封装,显著提升了劳动经济学与计算社会科学领域的实证研究可及性。
当前挑战
该数据集所回应的领域难题,在于非正规就业的跨国可比性测量:各国劳动统计口径差异、抽样与行政记录混合、非标准教育层级归类,以及非正规部门界定本身在ICLS标准演进中的变动,皆使观测值的语义对齐面临结构性困难。构建过程的挑战体现于三方面:其一,ILO以'最佳来源'规则处理同一国家—年份多源冲突,可能引入选择性偏差;其二,性别与教育等分层维度仅在指标发布该细分时才非空,导致缺失机制非随机;其三,观测状态标志与序列断裂注释揭示了数据质量异质性。这些挑战共同构成非正规就业时序建模与跨国比较研究中亟待方法论回应的核心命题。
常用场景
经典使用场景
在非正规经济部门的劳动统计研究中,该数据集构成了刻画亚洲地区非正规就业格局的核心经验基础。研究者常以性别、教育程度与城乡分布为分析维度,借助面板回归与时间序列建模,揭示非正规就业的规模变迁与结构性差异,进而评估不同国家在体面劳动议程中的进展。
解决学术问题
该数据集有效缓解了亚洲地区非正规就业统计长期存在的口径不一与覆盖不足问题。通过ILO统一协调的ICLS定义,它为劳动经济学中关于非正规部门与教育回报、性别差距及城乡二元结构的实证检验提供了可比的跨国面板数据,推动了非正规就业决定因素与后果的学术争鸣。
实际应用
在政策实践层面,该数据集服务于国际组织与各国劳工部门的监测需求。它可用于追踪可持续发展目标中体面劳动指标的实现进度,辅助识别非正规就业高发群体,并为社会保障扩面、技能培训与城乡就业促进等干预措施的设计与评估提供量化依据。
数据集最近研究
最新研究方向
在全球非正规经济治理与体面劳动议程持续深化的背景下,该数据集为亚洲23国非正规部门就业的性别与教育分层研究提供了长时段、高粒度的观测基础。当前前沿研究聚焦于运用面板计量与时序预测方法,识别女性与低学历群体在非正规就业中的结构性脆弱性,并结合城乡异质性探讨结构转型与劳动力市场制度变迁的调节效应。伴随国际劳工组织关于非正规经济统计标准(ICLS)的更新以及可持续发展目标SDG 8的监测需求,该数据集亦被用于检验非正规就业规模与教育回报率、性别差距之间的动态关联,为亚洲发展中国家的社会保障扩展与就业正规化政策评估提供实证支撑,具有重要的比较研究价值与政策意涵。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务