遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-eco-est-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别、经济活动和机构划分的非正规部门就业份额 | 亚洲(ILOSTAT)”,包含57,937个观测值,覆盖25个亚洲国家,时间跨度为2000年至2025年,专注于非正规经济领域。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为亚洲国家代码。数据集包含一个核心指标:EMP_PIFL_SEX_ECO_EST_RT,即按性别、经济活动和机构规模划分的非正规部门就业份额(百分比)。数据集提供了详细的列结构,包括国家代码、国家名称、数据来源、指标代码、性别分类、经济活动和机构规模分类、观测年份、观测值、观测状态等字段。数据经过ILO的标准化处理,遵循国际劳工统计学家会议(ICLS)定义,并标注了数据来源和质量信息。该数据集适用于表格分类、表格回归和时间序列预测等任务,旨在为亚洲地区的劳动力市场研究提供机器学习就绪的数据支持。

This dataset, titled Share of employment outside the formal sector by sex, economic activity and establishment | Asia (ILOSTAT), contains 57,937 observations across 25 Asian countries, spanning the years 2000 to 2025, with a focus on the informal economy. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved via the REST API and filtered to Asian ISO3 country codes. It includes one core indicator: EMP_PIFL_SEX_ECO_EST_RT, which represents the share of employment outside the formal sector by sex, economic activity, and establishment size (%). The dataset provides a detailed schema with columns such as country code, country name, data source, indicator code, sex disaggregation, economic activity and establishment size classifications, observation year, observed value, and observation status. The data is harmonized by the ILO using International Conference of Labour Statisticians (ICLS) definitions and includes source and quality flags. It is suitable for tabular classification, tabular regression, and time-series forecasting tasks, designed to offer machine learning-ready data for labor market research in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-eco-est-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接抽取指标EMP_PIFL_SEX_ECO_EST_RT的原始数据,并依据ISO3国家代码筛选出亚洲地区25个国家的记录。ILOSTAT采用国际劳工统计学家会议(ICLS)标准定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一协调,确保跨区域可比性。数据经Electric Sheep Asia重新打包为HuggingFace数据集格式,保留来源标签以实现可追溯性,最终形成涵盖2000至2025年、共计57937条观测值的结构化表格数据。
使用方法
研究者可通过HuggingFace的datasets库以一行代码加载数据集:load_dataset("electricsheepasia/asia-ilo-emp-pifl-sex-eco-est-rt-share-of-employment-outside-the-formal-sector-by-s"),并转换为Pandas DataFrame进行灵活操作。典型用法包括按ref_area列筛选特定国家(如印度尼西亚IDN),或按indicator列提取单一指标后依时间排序绘制趋势图。此外,可利用pivot_table函数将数据重塑为国家×年份矩阵,便于跨国比较分析。
背景与挑战
背景概述
非正规经济部门就业的测算长期以来构成劳动统计领域的核心议题,其数据质量直接关系到体面劳动监测与结构性就业政策的制定。国际劳工组织(ILO)依托国际劳工统计学家会议(ICLS)框架,自二十世纪末系统整合各国劳动力调查与住户收入调查等微观数据,逐步建立起跨国的非正规就业指标。本数据集由Electric Sheep Asia于2025年重新封装,源自ILOSTAT的EMP_PIFL_SEX_ECO_EST_RT指标,覆盖亚洲25个国家、2000至2025年间57,937条观测记录,按性别、经济活动部门与机构规模多维 disaggregation,为比较劳动经济学与亚洲非正规就业研究提供了稀缺的跨国面板基础。
当前挑战
该数据集所回应的领域问题在于如何以跨国可比口径刻画非正规部门就业的结构性分布,其困难源于非正规经济概念本身随ICLS定义演进不断调整,各国调查工具、抽样设计与参考期差异显著。构建层面,原始数据受制于各国统计能力不均衡,部分国家仅零星年份可得,且同一国家×年份可能存在多源并存,需依赖ILO的“最佳来源”规则加以取舍;机构规模与经济活动的交叉分类进一步稀疏了单元格,观测状态标记(如不可靠、序列断裂)频现,对时间序列建模与跨截面比较的稳健性构成实质挑战。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最经典的使用场景在于刻画亚洲地区非正规部门就业的性别差异与结构演变。研究者借助其涵盖二十五个亚洲国家、时间跨度逾二十载的纵向观测,可按性别、经济活动门类与机构规模等维度切割样本,进而绘制非正规就业占比的时序趋势图,或构建面板回归模型以检验非正规性的决定因素。
解决学术问题
该数据集有效回应了非正规就业测度中长期存在的可比性难题。既往研究多依赖零散国别调查,口径不一,难以开展跨国比较。通过ILOSTAT统一协调与国际劳工统计学家会议定义,该数据集为检验非正规就业与性别不平等、经济周期及正规化政策之间的因果关联提供了标准化证据基础,推动了非正规经济实证研究的规范化与可累积性。
实际应用
在政策实践中,该数据集可服务于国际组织与各国劳工部门的监测评估需求。借助其分国别、分性别的就业指标,决策者可识别非正规就业高发群体与区域,评估社会保障扩面政策的覆盖缺口,亦可用于设计针对女性非正规劳动者的技能培训与创业扶持项目,助力体面劳动议程的落地。
数据集最近研究
最新研究方向
在全球南方非正规经济持续占据劳动力市场主导地位的背景下,该数据集为探究亚洲地区非正规就业的结构性成因与动态演化提供了高分辨率的面板数据基础。近期研究前沿聚焦于运用机器学习方法对非正规就业份额进行高精度时序预测与跨国聚类分析,尤其关注性别差异、经济活动部门及企业规模三重维度下的异质性模式。与此同时,国际劳工组织推动的"非正规经济向正规经济转型"政策议程以及联合国可持续发展目标8.3的监测需求,使该数据集成为评估转型进展与设计靶向干预措施的关键证据来源。研究者亦开始将其与贸易冲击、技术采纳及气候适应等外生变量融合,以识别非正规部门对宏观扰动的差异化响应机制,从而深化对亚洲劳动力市场韧性与包容性增长路径的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务