遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-ins-mts-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的非正规经济数据,专门针对亚洲地区。它涵盖了24个亚洲国家从2006年至2025年的7,126个观测值,核心指标为按性别、公共/私营部门和婚姻状况划分的非正规部门就业比例(EMP_PIFL_SEX_INS_MTS_RT)。数据通过ILOSTAT REST API获取,并经过标准化处理,包括国家代码、来源、指标、性别分类、时间、观测值及状态等字段。数据集适用于表格分类、回归和时间序列预测任务,旨在提供机器学习就绪的亚洲劳动力市场非正规就业数据。

This dataset contains Informal economy data from the International Labour Organization (ILO) ILOSTAT database, specifically for the Asia region. It includes 7,126 observations across 24 Asia countries spanning 2006–2025, with the core indicator being Share of employment outside the formal sector by sex, public/private sector and marital status (EMP_PIFL_SEX_INS_MTS_RT). Data is pulled directly from the ILOSTAT REST API and normalized, featuring fields such as country codes, sources, indicators, sex disaggregation, time, observed values, and status flags. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, designed to provide ML-ready data on informal employment in Asian labour markets.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-ins-mts-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的权威统计数据库ILOSTAT,聚焦亚洲地区非正规经济部门就业状况。构建过程中,通过ILOSTAT的REST API接口直接获取指标代码为EMP_PIFL_SEX_INS_MTS_RT的原始数据,并依据ISO3国家代码筛选出24个亚洲国家,时间跨度为2006年至2025年。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查等微观数据进行标准化调和,数据来源在source.label列中标注以确保可追溯性。最终由Electric Sheep Asia重新打包为机器学习就绪的Parquet格式,并发布在HuggingFace平台。
特点
数据集包含7,126条观测记录,覆盖24个亚洲国家,时间跨度达20年,提供非正规部门就业份额的年度数据。其核心特点在于多维度分解:按性别(总计、男性、女性、其他)、公共/私营部门及婚姻状况进行交叉分类,并包含来源、指标、注释等元数据列以增强数据透明度。数据集以表格形式组织,适用于表格分类、回归及时间序列预测任务,且所有数据均遵循CC-BY-4.0开放许可,便于学术研究与开发应用。
使用方法
使用者可通过HuggingFace的datasets库便捷加载数据,调用load_dataset函数指定数据集名称即可获取训练集并转换为Pandas DataFrame。针对具体分析需求,可灵活筛选:例如按ref_area列选择特定国家(如印度尼西亚),或按indicator列提取单一指标并排序以生成时间序列图。亦可利用pivot_table方法将数据重塑为国家×年份矩阵,便于横向比较。数据集支持直接用于统计建模、趋势分析及机器学习任务,使用时需遵循CC-BY-4.0许可并引用原始来源。
背景与挑战
背景概述
国际劳工组织长期致力于全球劳动力市场统计监测,其维护的ILOSTAT数据库为劳动经济学与非正规经济研究提供了权威数据基础。该数据集由Electric Sheep Asia于2025年基于ILOSTAT REST API重新封装发布,涵盖24个亚洲国家2006至2025年间非正规部门就业份额的7126条观测记录,按性别、公私部门及婚姻状况多维 disaggregation。数据集核心研究问题在于揭示亚洲发展中经济体非正规就业的结构性差异与演变趋势,为政策制定者评估体面劳动目标进展提供量化依据。其影响力在于降低了跨国比较研究的门槛,推动了机器学习在劳动统计预测中的应用。
当前挑战
非正规就业的界定与测度本身即构成劳动统计领域的核心难题,国际劳工组织虽通过国际劳工统计学家会议定义进行协调,但各国劳动力调查在抽样设计、问卷措辞及参考期上存在显著异质性,导致跨国可比性受限。数据构建过程中,原始API仅提供聚合结果,部分国家年份缺失严重,且非正规部门就业常与农业自雇及家庭无偿劳动边界模糊,观测值存在方法修订断点与不可靠标记。此外,性别与婚姻状况交叉分类后样本稀疏,时序预测面临高维稀疏与结构突变双重挑战,对模型稳健性提出更高要求。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最经典的使用场景在于构建亚洲二十四国非正规部门就业占比的面板数据,用以刻画不同性别、公共或私营部门以及婚姻状况下非正规就业的动态演进轨迹。研究者通常借助其时间序列结构,运用固定效应模型或合成控制法,评估劳动市场制度改革、经济周期波动与性别差异对非正规就业的差异化影响,进而揭示亚洲劳动力市场二元结构的长期变迁规律。
衍生相关工作
围绕该数据集,学界衍生出一系列比较劳动市场研究成果,包括亚洲非正规就业与经济增长关系的跨国计量分析、女性劳动参与率与非正规部门关联的性别经济学探讨,以及基于ILOSTAT多指标整合的非正规经济预测模型。这些工作不断拓展数据集的再利用边界,并促使Electric Sheep Asia等平台持续扩充亚洲劳动统计数据的机器学习就绪型资源库。
数据集最近研究
最新研究方向
在全球非正规经济研究持续深化的背景下,该数据集以其覆盖亚洲24国、跨越2006至2025年的7126条观测值,为探究非正规就业的性别差异、公私部门分割及婚姻状况影响提供了独特的面板数据基础。当前前沿研究聚焦于运用机器学习与时间序列预测方法,识别非正规就业份额的动态演化模式及其驱动因素,尤其关注性别与婚姻状况的交互效应如何塑造不同经济体中的劳动力市场分层。该数据集亦呼应了国际劳工组织关于体面劳动与可持续发展目标8的监测需求,为评估政策干预效果、追踪非正规经济规模变化提供了可复用的标准化数据资源,对推动亚洲区域劳动力市场比较研究与循证政策制定具有重要的学术价值与现实意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务