遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-eco-edu-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲27个国家在2000年至2025年期间的非正规经济数据,共有157,608个观察值,专注于一个指标:按性别、经济活动和教育程度划分的非正规部门就业占比(%)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过亚洲国家代码过滤。数据集涵盖了多个维度的细分,包括性别(总计、男性、女性等)、经济活动和教育水平,并提供了数据来源、观察状态和注释等信息。数据以年度频率发布,经过ILO的标准化处理,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 157,608 observations of informal economy data across 27 Asia countries, spanning the years 2000 to 2025, and focuses on one indicator: the share of employment outside the formal sector by sex, economic activity and education (%). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via REST API and filtered for Asian country codes. It includes disaggregation dimensions such as sex (total, male, female, etc.), economic activity, and education level, along with metadata on data sources, observation status, and notes. The data is published annually and harmonized by ILO, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-eco-edu-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
非正规经济部门就业占比是衡量劳动力市场结构转型与体面劳动实现程度的关键指标,国际劳工组织依托其全球劳动统计数据库长期开展系统性监测。该数据集由Electric Sheep Asia团队通过ILOSTAT REST API直接抽取指标EMP_PIFL_SEX_ECO_EDU_RT的原始记录,依据亚洲ISO3国家代码进行地理筛选,并统一转换为Parquet格式。底层数据源自各国劳动力调查、家庭收入调查及行政记录,经国际劳工组织按国际劳动统计学家会议定义进行跨国口径调和,每条观测均标注来源标签以保障可追溯性,最终形成覆盖27个亚洲国家、时间跨度自2000年至2025年的结构化面板。
特点
该数据集以157,608条观测记录构成规模可观的长时序截面资源,涵盖27个亚洲经济体,年度频率清晰呈现非正规就业占比的动态演变。数据维度设计细致,按性别、经济活动部门及教育程度三个分类变量进行交叉 disaggregation,使研究者能够捕捉不同社会群体在非正规部门中的分布差异。每条记录携带完整来源标识、观测状态标记及方法学注释,便于识别数据修订与序列断裂。整体以表格形式组织,字段命名规范,既满足监督学习与时间序列预测的输入要求,也适合开展多维分组统计与跨国比较分析。
使用方法
研究者可通过HuggingFace datasets库以单行代码加载数据集,并直接转换为pandas数据框开展分析。典型操作包括按ISO3国家代码筛选特定经济体、按指标代码提取单变量时间序列并绘制趋势图,以及利用透视表将数据重塑为国家与年份的二维矩阵。由于数据包含性别、经济活动及教育程度等分类维度,使用者可在分组聚合后实施跨国比较或面板回归。加载后的数据框保留全部来源与状态注释字段,支持在研究流程中进行质量审查与稳健性检验。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计监测,其ILOSTAT数据库为就业、失业、非正规经济等议题提供权威跨国数据。在此背景下,亚洲地区非正规部门就业占比数据集应运而生,由Electric Sheep Asia于2025年重新打包发布,覆盖27个亚洲国家、2000至2025年间157,608条观测记录。该数据集聚焦于按性别、经济活动和教育程度细分的非正规就业比例,其核心研究问题在于揭示亚洲发展中经济体非正规就业的结构性差异与演变趋势,为劳动力市场政策制定和SDG体面劳动目标评估提供关键实证基础,对发展经济学和劳动社会学领域具有重要参考价值。
当前挑战
该数据集所回应的领域问题在于非正规就业的精确测度与跨国可比性:非正规经济边界模糊,各国调查口径与统计能力参差不齐,ILO需依据国际劳工统计学家会议(ICLS)定义进行复杂协调。构建过程中的挑战尤为突出:原始数据源自各国劳动力调查和家庭收入调查,抽样设计、覆盖范围和变量定义存在显著异质性;部分国家年份数据缺失或中断,序列不连续;观测状态标记(如临时性、不可靠)提示数据质量波动;分类维度(性别、经济活动、教育)并非所有国家均完整发布;加之非正规就业本身对经济周期和政策变动高度敏感,致使跨期比较和趋势推断面临较大不确定性。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最为经典的使用场景在于刻画亚洲各国非正规部门就业比重的时序演变与结构差异。研究者可依托其涵盖27个亚洲国家、2000至2025年间逾十五万条观测记录,按性别、经济活动部门与教育程度三重维度进行交叉分组,进而构建面板数据模型,系统比较不同国家非正规就业的规模与变动轨迹。此类分析常用于识别非正规就业在性别间的分布不均衡,以及教育层级与部门属性对就业正规化程度的调节效应,为区域劳动力市场结构转型提供量化依据。
解决学术问题
该数据集有效回应了非正规就业测度中长期存在的口径不一与跨国可比性不足这一学术难题。依托国际劳工组织基于国际劳工统计学家会议定义所进行的标准化调和,该数据集将各国差异化的劳动力调查微观数据整合为统一指标,使研究者得以在一致框架下开展跨国比较与趋势分析。其意义在于推动非正规经济研究从零散的国别描述转向可复现的定量比较,为检验制度质量、教育扩张与性别平等如何影响非正规就业比重等理论命题提供了可靠的经验基础。
衍生相关工作
围绕该数据集,已有若干衍生性研究工作相继展开。部分研究将其与国际劳工组织其他劳动力市场指标数据集链接,构建多维劳动力市场脆弱性指数,用以探讨非正规就业与贫困、工作时间及社会保护覆盖之间的关联。另有工作将其作为基准数据,检验机器学习模型在面板数据缺失值插补与时序预测中的表现,推动劳动统计数据的智能化处理。这些衍生工作不仅拓展了非正规就业数据的分析边界,也为亚洲区域劳动统计数据的二次开发与跨源融合提供了可借鉴的范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务