遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-age-eco-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别、年龄和经济活动划分的非正规部门外就业比例(%)| 亚洲(ILOSTAT),包含172,738条观测数据,覆盖28个亚洲国家,时间跨度为2000年至2025年。数据集专注于非正规经济主题,核心指标为EMP_PIFL_SEX_AGE_ECO_RT,用于衡量非正规部门外就业的百分比。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过亚洲国家代码过滤。数据集包含结构化字段,如国家代码、国家名称、数据来源、指标代码、性别分类(如总计、男性、女性)、年龄组分类、经济活动分类、观测年份、观测值(百分比)以及数据质量标志(如可靠性状态)。数据按年度频率提供,并经过ILO的标准化处理,以确保与国际劳工统计学家会议(ICLS)定义一致。该数据集适用于表格分类、回归和时间序列预测等机器学习任务,旨在为研究人员和开发者提供亚洲地区劳动力市场的标准化、ML就绪数据。

This dataset, titled Share of employment outside the formal sector by sex, age and economic activity (%) | Asia (ILOSTAT), contains 172,738 observations across 28 Asian countries, spanning from 2000 to 2025. It focuses on the informal economy theme, with the core indicator being EMP_PIFL_SEX_AGE_ECO_RT, which measures the percentage share of employment outside the formal sector. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved via REST API and filtered for Asian ISO3 country codes. The dataset includes structured columns such as country code, country name, data source, indicator code, sex disaggregation (e.g., total, male, female), age group classification, economic activity classification, observation year, observed value (percentage), and data quality flags (e.g., reliability status). Data is provided at annual frequency and harmonized by ILO to align with International Conference of Labour Statisticians (ICLS) definitions. It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, aiming to offer standardized, ML-ready data for Asias labor market to researchers and developers.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-age-eco-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的中央统计数据库ILOSTAT,通过其REST API接口直接获取指标EMP_PIFL_SEX_AGE_ECO_RT的原始数据,并依据亚洲ISO3国家代码进行筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)的定义对各国劳动力调查等微观数据进行统一 harmonization,确保跨国可比性,最终由Electric Sheep Asia重新打包为HuggingFace数据集,保留了来源标签以支持溯源。
特点
数据集涵盖2000至2025年间28个亚洲国家的172,738条观测记录,聚焦于非正规部门就业份额(按性别、年龄和经济活动分类)。其特点包括多维度 disaggregation(性别、年龄组、经济活动部门)、丰富的元数据列(如来源标签、观测状态、注释信息),以及遵循CC-BY-4.0开放许可。数据以年度频率发布,部分指标可能包含临时或不可靠标记,便于用户评估质量。
使用方法
用户可通过HuggingFace的datasets库以load_dataset()函数加载数据集,并转换为Pandas DataFrame进行灵活分析。典型操作包括按国家(如ref_area=='IDN')筛选、提取单一指标的时间序列、或透视成国家×年份矩阵。数据集支持表格分类、回归和时间序列预测等任务,使用时应引用ILO原始来源及Electric Sheep Asia的再包装工作。
背景与挑战
背景概述
非正规部门就业占比是衡量劳动力市场结构与发展质量的关键指标,长期受到国际劳工组织与各国统计机构的关注。该数据集由国际劳工组织(ILO)统计部门基于全球劳动力调查微数据 harmonize 后发布,经 Electric Sheep Asia 于2025年重新打包,覆盖亚洲28个国家、2000至2025年间172,738条观测,聚焦非正规就业占比在性别、年龄与经济 activity 维度的分布。其核心研究问题在于揭示亚洲非正规经济的规模、演变与异质性,为体面劳动监测、SDG目标评估及非正规就业政策设计提供可比数据基础,对劳动经济学与发展研究具有重要参考价值。
当前挑战
所解决的领域问题涉及非正规就业占比的跨时空精确测度,其挑战在于非正规部门定义随国际劳工统计学家会议标准修订而演变,导致跨国与跨期比较面临口径不一致风险。构建过程中的挑战尤为突出:各国劳动力调查在抽样设计、问题措辞、参考期与覆盖范围上差异显著,需依赖 ILO 的标准化调和与‘最佳来源’筛选;部分年份或年龄组存在数据缺失、序列断裂与不可靠标记,且性别、年龄与经济 activity 的交叉分类导致样本稀疏,影响估计稳健性与时间序列预测的可靠性。
常用场景
经典使用场景
在非正规经济与劳动力市场核算这一研究领域,该数据集凭借其覆盖28个亚洲国家、2000至2025年间172,738条观测记录之规模,成为刻画正规部门之外就业占比动态演化的经典数据来源。研究者通常依据性别、年龄组与经济 activity 三重分类维度,对各国非正规就业比例展开横截面比较与时间序列分析,进而识别不同人口群体在非正规劳动市场中的脆弱性差异。
衍生相关工作
基于该数据集及其所属的ILOSTAT非正规经济指标族系,学界相继开展了非正规就业与贫困脆弱性关联分析、非正规部门规模与经济增长关系的面板研究,以及非正规就业性别差异的跨国分解。Electric Sheep Asia对ILOSTAT原始数据的规范化重打包,亦推动了以机器学习方法处理劳动统计表格数据的方法论探索,为后续亚洲劳动力市场数据集的构建提供了可复用的工程范式。
数据集最近研究
最新研究方向
在全球非正规经济研究持续深化的背景下,该数据集以其覆盖28个亚洲国家、跨越2000至2025年的172,738条观测,为刻画非正规部门就业的性别、年龄与经济 activity 多维异质性提供了独特的高频面板资源。当前前沿研究聚焦于运用机器学习与因果推断方法,识别非正规就业占比变动的结构性驱动因素,并评估疫情冲击、数字化转型及社会保障政策对非正规就业的异质性效应。该数据集亦被用于训练时间序列预测模型,以监测亚洲地区非正规经济的动态演化,为ILO体面劳动议程及SDG目标8的进展评估提供实证基础,对推动区域劳动力市场治理与包容性增长具有重要的学术与政策意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务