遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-eco-mts-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲26个国家在2000年至2025年期间的非正规经济就业数据,共48,917个观测值,涵盖1个核心指标:按性别、经济活动和婚姻状况划分的非正规部门就业比例(%)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过标准化处理,使用ICLS(国际劳工统计学家会议)定义进行协调。数据集结构包括国家代码、指标代码、性别分类(总计、男性、女性等)、经济活动和婚姻状况分类、观测年份、数值以及数据质量标志等列。数据以年度频率发布,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Asia重新打包,旨在为亚洲提供统一的机器学习就绪数据层。

This dataset contains 48,917 observations of informal economy employment data across 26 Asian countries, spanning 2000–2025, covering 1 distinct indicator: the share of employment outside the formal sector by sex, economic activity, and marital status (%). The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via API and harmonized using ICLS (International Conference of Labour Statisticians) definitions. The schema includes columns for country codes, indicator codes, sex disaggregation (total, male, female, etc.), economic activity and marital status classifications, observation year, values, and data quality flags. Data is annual frequency and suitable for tabular classification, regression, and time-series forecasting tasks. The dataset is repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia on HuggingFace.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-eco-mts-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的中央统计数据库ILOSTAT,通过其REST API接口直接提取指标EMP_PIFL_SEX_ECO_MTS_RT的原始记录,并依据亚洲ISO3国家代码进行筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行标准化调和,确保跨区域可比性。Electric Sheep Asia在此基础上进行重新封装,将数据统一为Parquet格式并发布至HuggingFace平台,同时保留来源标签以实现可追溯性。
特点
数据集涵盖26个亚洲国家,时间跨度为2000至2025年,共计48,917条观测记录,聚焦于非正规部门就业份额这一非正规经济核心指标。数据按性别、经济活动部门和婚姻状况三个维度进行 disaggregation,提供SEX_T、SEX_M、SEX_F、SEX_O等性别分类以及经济活动和婚姻状况的细分类别。字段设计包含来源代码、指标代码、观测状态标志及分类注释,便于用户评估数据质量与口径变化。
使用方法
用户可通过HuggingFace datasets库以load_dataset函数直接加载数据集,并转换为Pandas DataFrame进行后续分析。典型操作包括按ref_area列筛选特定国家(如印度尼西亚IDN),按indicator列提取单一指标并依据time列排序以绘制时间序列图,或利用pivot_table方法构建国家×年份矩阵以进行面板数据分析。该数据集适用于表格分类、回归及时间序列预测等任务,亦可用于非正规就业的跨国比较研究。
背景与挑战
背景概述
非正规经济部门就业的规模与结构长期是发展经济学与劳动经济学的核心议题,其测量精度直接关系到社会保障政策的设计与减贫成效评估。国际劳工组织(ILO)自二十世纪中叶起持续推动非正规就业统计的标准化,依托国际劳工统计学家会议(ICLS)的决议框架,在全球范围内协调各国劳动力调查的微观数据。在此背景下,ILO统计司于2025年通过其公开数据平台ILOSTAT发布本数据集,后由Electric Sheep Asia重新封装为机器学习就绪格式。数据集覆盖26个亚洲国家、2000至2025年间逾四万八千条观测记录,按性别、经济活动部门与婚姻状况三重维度细分,为探究亚洲非正规就业的性别差异、行业分布与家庭结构关联提供了迄今最系统的面板数据基础,对比较劳动制度研究与SDG体面工作目标的监测具有重要支撑价值。
当前挑战
该数据集所回应的领域问题,在于非正规就业的跨国可比测量本身即面临概念界定与操作化的双重张力:不同国家劳动力调查对非正规部门的判定标准、抽样的覆盖范围及参考期设定各异,ILOSTAT虽经统一调和,仍难以完全消除口径差异导致的序列断裂。就构建过程而言,数据集面临多源异构数据的整合困境,各国调查年份不连续、指标缺失普遍,面板结构高度非平衡;分类维度上的空值仅在实际发布细分项时填充,迫使建模者审慎处理缺失机制。此外,观测状态标志中标注为不可靠或临时性的记录、以及序列断裂的断点提示,均要求使用者在时间序列分析与跨国比较中引入稳健性检验,以避免对估计趋势的误读。
常用场景
经典使用场景
在劳动经济学与计量社会科学领域,该数据集最经典的使用场景在于围绕非正规部门就业份额构建跨国别、跨性别与跨经济活动的面板分析框架。研究者借助其2000至2025年覆盖26个亚洲国家的年度观测,得以系统刻画非正规就业的时序演变轨迹,并运用面板回归、固定效应模型或时间序列预测方法,检验性别差异、婚姻状况与经济部门结构对非正规就业比重的交互影响。
衍生相关工作
围绕该数据集已衍生出一系列劳动统计与计量分析工作,包括基于ILOSTAT多指标构建的非正规就业预测模型、亚洲区域非正规经济比较研究,以及将本数据与社会保障覆盖率、工资水平等指标链接的跨主题分析。相关成果多见于国际劳工组织报告、区域发展研究期刊及机器学习驱动的劳动力市场监测应用。
数据集最近研究
最新研究方向
在全球非正规经济研究持续深化的背景下,该数据集凭借其覆盖26个亚洲国家、时间跨度长达四分之一世纪的非正规部门就业份额微观面板数据,正推动劳动经济学与发展经济学交叉领域的前沿探索。近期研究聚焦于利用其性别、经济活动部门与婚姻状况的多维交叉分类,借助时间序列预测与面板回归方法,揭示亚洲地区非正规就业的性别差异演化机制、经济周期冲击的非对称效应以及婚姻状态对劳动参与轨迹的调节作用,为国际劳工组织体面劳动议程与联合国可持续发展目标中非正规就业监测提供高分辨率实证依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务