遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-edu-mts-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲26个国家从2000年至2025年的非正规经济就业比例数据,共有48,354个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取并过滤为亚洲国家。数据集的核心指标是“按性别、教育和婚姻状况分类的非正规部门就业比例(%)”,指标代码为EMP_PIFL_SEX_EDU_MTS_RT。数据以表格形式组织,包含国家代码、国家名称、数据来源、指标代码、性别分类(如总计、男性、女性)、教育水平分类、婚姻状况分类、观测年份、观测值以及数据质量状态等列。数据集旨在提供亚洲地区非正规就业的详细统计信息,适用于表格分类、回归和时间序列预测等机器学习任务。数据已由Electric Sheep Asia重新打包,以方便在HuggingFace平台上使用。

This dataset contains 48,354 observations on the share of employment outside the formal sector in 26 Asian countries from 2000 to 2025. The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via its REST API and filtered for Asian countries. The core indicator is Share of employment outside the formal sector by sex, education and marital status (%), with the code EMP_PIFL_SEX_EDU_MTS_RT. The data is organized in tabular format, including columns for country code, country name, data source, indicator code, sex disaggregation (e.g., total, male, female), education level classification, marital status classification, observation year, observed value, and data quality status. The dataset aims to provide detailed statistics on informal employment in Asia, suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting. It has been repackaged by Electric Sheep Asia for ease of use on the HuggingFace platform.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-edu-mts-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口直接提取指标EMP_PIFL_SEX_EDU_MTS_RT的原始记录,并依据亚洲ISO3国家代码进行系统性筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)制定的定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一协调,原始数据经Electric Sheep Asia重新打包为Parquet格式,保留了来源标签以确保可追溯性,最终形成涵盖26个亚洲国家、时间跨度为2000至2025年的结构化表格数据。
使用方法
研究者和开发者可通过HuggingFace的datasets库以load_dataset()函数直接加载数据集,并转换为Pandas数据框进行后续分析。典型操作包括按ref_area字段筛选特定国家(如印度尼西亚)、按indicator字段提取单一指标的时间序列并按年份排序,或利用pivot_table将数据重塑为国家与年份的交叉矩阵。数据集支持表格分类、回归及时间序列预测等任务,适用于非正规就业份额的跨国比较、趋势演变及性别与教育差异的量化研究。
背景与挑战
背景概述
非正规部门就业的规模与结构是发展经济学与劳动经济学长期关注的核心议题,其不仅关系到劳动者福祉与社会保护覆盖,更折射出经济体正规化进程的深层张力。国际劳工组织(ILO)自建库以来,持续通过ILOSTAT平台整合各国劳动力调查与住户调查数据,以国际劳工统计学家会议(ICLS)标准加以协调。该数据集由Electric Sheep Asia于2025年从ILOSTAT REST API采集并重新封装,覆盖26个亚洲国家、2000至2025年间48,354条观测,按性别、教育程度与婚姻状况细分,为亚洲非正规就业的跨国比较与纵向追踪提供了标准化、可机读的数据基础,对劳动政策评估与机器学习建模均具重要支撑价值。
当前挑战
非正规就业统计所涉领域问题在于概念界定与跨时段可比性:非正规部门与非正规就业的边界随ICLS决议修订而变动,各国调查口径、抽样框架与参考期亦存在差异,导致序列断点与测量误差难以避免。构建过程中,原始微数据经多次协调后仍存在部分国家年份缺失、性别与教育维度分类非标准化、观测值被标注为临时或不可靠等情形,加之部分国家同一年份存在多源数据,需依ILO“最优来源”原则加以取舍,进一步增加了数据清洗与协调的复杂度。这些局限要求使用者在建模与推断时审慎对待数据的时空间不均衡与指标异质性。
常用场景
经典使用场景
在劳动经济学与计量社会科学领域,该数据集最经典的使用场景在于构建以国家为截面、以年度为时序的面板数据框架,对非正规部门就业份额进行趋势刻画与结构分解。研究者依托性别、教育程度与婚姻状况的三维交叉分类维度,运用固定效应模型或工具变量策略,辨析不同人口群体在非正规就业市场中的参与率变动轨迹,并借此评估劳动力市场正规化进程的异质性特征。
解决学术问题
该数据集有效缓解了亚洲地区非正规经济比较研究中长期存在的数据碎片化与口径不一致困境。通过国际劳工组织对国际劳工统计学家会议定义的系统性调和,数据集为检验教育回报率与非正规就业之间的倒U型关系、性别歧视在非正规部门中的结构性固化、以及婚姻状况对劳动参与决策的调节效应等经典学术命题,提供了跨二十六国的可比性实证基础,显著提升了相关比较研究的内部效度与外部推广能力。
实际应用
在政策实践层面,该数据集为国际发展机构与各国劳工部门提供了量化监测工具,用以追踪体面劳动议程中非正规就业比例的时序进展。社会保障部门可据此识别非正规就业高度集中的性别与教育群体,精准设计技能培训与正规化激励方案。同时,金融机构与小额信贷组织能够将区域非正规就业强度纳入风险评估模型,辅助制定差异化的普惠金融产品策略。
数据集最近研究
最新研究方向
在全球非正规经济研究持续深化的背景下,该数据集凭借其覆盖26个亚洲国家、跨越2000至2025年的48,354条观测记录,成为探究非正规就业性别与教育分层问题的关键实证资源。当前前沿研究聚焦于利用此类高维度面板数据,结合机器学习与时间序列预测方法,揭示性别、教育程度及婚姻状况对非正规就业比例的交互影响机制,尤其关注南亚与东南亚国家在结构转型中的异质性路径。该数据集与联合国可持续发展目标8(体面劳动)及ILO第17届国际劳工统计学家会议关于非正规就业定义的修订紧密关联,为政策评估提供了标准化跨国比较基准。其发布推动了亚洲非正规部门动态监测的定量化转向,对理解后疫情时代劳动力市场脆弱性及社会保障扩展具有重要学术与政策意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务