遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-geo-nb-employment-outside-the-formal-sector-by-sex-and-ru

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲23个国家在2000年至2025年期间的非正规经济就业数据,具体指标为按性别和城乡地区划分的非正规部门就业(千人)。数据集共有1,690个观测值,来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并过滤为亚洲国家。数据以表格形式组织,包含国家代码、指标代码、性别分类(总计、男性、女性等)、年份、观测值(就业人数,单位千)以及数据来源和质量标志等列。该数据集适用于表格分类、回归或时间序列预测等机器学习任务,旨在提供亚洲地区非正规部门就业的标准化、机器学习就绪的数据。

This dataset contains informal economy employment data for 23 Asian countries from 2000 to 2025, with the specific indicator Employment outside the formal sector by sex and rural / urban areas (thousands). It includes 1,690 observations, sourced from the International Labour Organization (ILO)s ILOSTAT statistical database, retrieved via API and filtered for Asian countries. The data is organized in tabular format, with columns such as country code, indicator code, sex disaggregation (total, male, female, etc.), year, observed value (employment in thousands), and data source and quality flags. The dataset is suitable for machine learning tasks like tabular classification, regression, or time-series forecasting, providing standardized, ML-ready data on informal sector employment in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-geo-nb-employment-outside-the-formal-sector-by-sex-and-ru 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口直接拉取指标EMP_PIFL_SEX_GEO_NB的原始记录,并依据ISO3国家代码筛选出亚洲地区的数据。ILOSTAT采用国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查等微观数据进行标准化处理,确保跨国可比性,同时保留来源标签以追溯原始调查信息。最终由Electric Sheep Asia重新打包为Parquet格式,形成涵盖23个亚洲国家、2000至2025年间共计1690条观测的规范数据集。
特点
数据集聚焦于非正规部门就业人口(千人),按性别(总计、男性、女性、其他)及城乡区域(国家层面)进行多维分解。时间跨度为2000至2025年,覆盖塞浦路斯、蒙古、越南、印度等23个亚洲国家,每条记录包含国家代码、来源标签、指标代码、性别分类、观测年份、数值及状态标志等丰富元数据。数据以年度频率为主,指标值单位随定义变化,且通过来源标签和注释列提供了数据修订、方法变更等质量线索,便于使用者评估数据可靠性。
使用方法
研究人员可通过HuggingFace的datasets库以load_dataset()方法直接加载该数据集,并转换为Pandas数据框进行后续分析。典型操作包括按ref_area字段筛选特定国家、按indicator字段提取目标指标的时间序列、利用pivot_table生成国家与年份的交叉矩阵。此外,可结合sex和classif1等分类字段进行分组统计,以探究不同性别与城乡区域下非正规就业的分布特征,为劳动经济学和区域发展研究提供定量基础。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计监测,其核心数据库ILOSTAT汇集两百余个经济体的就业、失业、工资及非正规经济等指标,为政策制定与学术研究提供权威基准。在此框架下,Electric Sheep Asia于2025年对ILOSTAT原始数据进行再封装,发布亚洲地区非正规部门外就业数据集,涵盖23个亚洲国家、2000至2025年间1690条观测记录,按性别与城乡维度细分。该数据集聚焦非正规经济这一全球南方国家普遍面临的结构性议题,为探究亚洲劳动力市场非正规化趋势、性别差异及城乡分化提供了标准化、可直接加载的机器学习就绪数据层,有效填补了区域细分数据在可访问性与可复现性方面的空白。
当前挑战
非正规就业度量本身面临概念界定与跨国可比性的根本困难。国际劳工统计学家会议(ICLS)虽提供定义框架,但各国劳动力调查在抽样设计、问卷措辞及非正规部门识别标准上差异显著,ILOSTAT虽经协调仍难以完全消除异质性;部分国家序列存在断点,如方法论修订或数据来源更替,导致时间序列连续性受损。多源数据整合中,同一国家同年份可能对应多个来源,ILO择优选用的策略虽提升一致性,却可能引入选择偏差。此外,性别与城乡维度的细分数据在部分年份或国家缺失,观测状态标记(如临时性、不可靠)提示数据质量参差,对建模的稳健性与预测可靠性构成直接挑战。
常用场景
经典使用场景
在非正规经济部门的劳动统计研究中,该数据集构成了一个典型的面板数据资源,用以支撑对就业形态变迁的纵向剖析。研究者依托其涵盖二十三个亚洲国家、跨度逾二十年的千余条观测,得以运用时间序列分析或固定效应模型,揭示非正规就业在性别与城乡维度上的动态演化。该数据集的经典使用场景包括:绘制分性别的非正规就业趋势曲线,比较城乡区域间的就业结构差异,以及构建国家层面的非正规就业比率指标,进而服务于劳动经济学中关于非正规部门规模测算与周期波动的实证检验。
解决学术问题
该数据集有效缓解了亚洲地区非正规就业比较研究中长期存在的数据碎片化与口径不一问题。通过国际劳工组织标准化后的国际劳工统计数据库来源,它提供了统一分类框架下的性别与城乡分解指标,使学者能够跨越国别界限,探究非正规就业的性别差距、城乡二元结构以及经济发展水平与非正规就业规模之间的关联。其意义在于为检验非正规部门女性化假说、结构转型理论等学术命题提供了可靠的经验基础,并推动了劳动统计方法在非正规经济测度领域的规范化进程。
衍生相关工作
围绕该数据集,已衍生出一系列与非正规就业测度及亚洲劳动市场分析相关的经典工作。国际劳工组织基于同一指标框架发布了多份全球与非正规经济报告,如《世界非正规就业妇女》等,为后续比较研究奠定了方法论基石。学术界亦利用该数据或其源数据库,开展了关于非正规就业与贫困、性别不平等、城乡迁移等议题的跨国实证分析,部分研究进一步结合微观调查数据,检验了非正规就业的异质性与动态特征。这些工作共同丰富了对亚洲非正规经济部门的理论认识与政策讨论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务