遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-ste-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按就业状况分列的(按性别)正规部门外就业占比(%)| 亚洲(ILOSTAT)”,包含了关于非正规经济的数据。具体涵盖28个亚洲国家从2000年至2025年期间的5,593个观测值,主要指标为“EMP_PIFL_SEX_STE_RT”,即按就业状况分列的(按性别)正规部门外就业占比(百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动统计的主要来源,通过协调各国劳动力调查、家庭收入调查、机构调查和行政记录等数据,采用国际劳工统计学家会议(ICLS)的定义进行标准化。数据集提供了详细的字段,包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、就业状况分类、观测年份、观测值、观测状态标志以及相关注释等,支持按国家、年份、性别和就业状况进行细分分析。数据以年度频率发布,并包含了数据质量说明,如当同一国家×年份存在多个数据源时,使用ILO选择的“最佳来源”。该数据集由Electric Sheep Asia重新打包,旨在为亚洲地区提供统一、适用于机器学习的数据层。

The dataset is titled Share of employment outside the formal sector by status in employment (by sex) (%) | Asia (ILOSTAT). It contains 5,593 observations on informal economy data across 28 Asia countries, spanning the years 2000–2025, covering one distinct indicator: EMP_PIFL_SEX_STE_RT — Share of employment outside the formal sector by status in employment (by sex) (%). The data is sourced from ILOSTAT, the ILOs central statistics database and a leading global source for labour statistics, which harmonizes raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions from national labour force surveys, household income surveys, establishment surveys, and administrative records. The dataset includes detailed columns such as country code, country name, source code, source label, indicator code, indicator label, sex disaggregation, employment status classification, observation year, observed value, observation status flags, and related notes. It supports disaggregation by country, year, sex, and employment status. Data is annual frequency, and when multiple sources exist for the same country×year, the ILO-selected best source is used. Repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia on HuggingFace.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-ste-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集以国际劳工组织(ILO)的ILOSTAT中央统计数据库为数据源,通过REST API接口直接提取指标代码为EMP_PIFL_SEX_STE_RT的原始记录,并依据ISO 3166-1 alpha-3国家代码筛选出28个亚洲经济体,时间跨度为2000年至2025年。ILOSTAT按照国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查等原始微观数据进行统一协调与标准化,形成具有跨区域可比性的就业非正规部门占比指标。经Electric Sheep Asia重新打包为Parquet格式,并保留来源标签与注释字段,最终生成包含5593条观测值的结构化数据集。
特点
数据集聚焦于亚洲地区非正规部门就业占比这一劳动统计核心议题,涵盖28个国家、2000至2025年的年度数据,并按性别(总计、男性、女性及其他)进行细分。其显著特征在于严格遵循国际统计标准,提供统一的指标编码、来源标识及质量标记,如观测状态、分类注释和序列断点提示,增强了数据的可追溯性与透明度。数据以长表格式存储,包含国家、来源、指标、性别分类、时间及观测值等字段,便于进行多维分析与面板建模,同时保留了原始调查来源信息以支持方法学审查。
使用方法
研究人员可通过HuggingFace数据集库以一行代码加载数据,并转换为Pandas数据框进行后续分析。典型应用包括筛选单一国家的时间序列、按指标提取并排序以绘制趋势图、或利用透视表构建国家与年份的矩阵以观察区域模式。数据以年度频率发布,适合进行描述性统计、跨国比较、非正规就业性别差异分析以及时间序列预测等任务。使用时需注意观测状态标记和注释字段,以识别序列断点或数据可靠性问题,并遵循CC-BY-4.0许可要求引用原始ILO来源及Electric Sheep Asia的再打包工作。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计的标准化与可及性,其ILOSTAT数据库汇集了200余个经济体的劳动力调查、住户收入调查及行政记录,是劳动经济学与就业政策研究的基础设施。非正规经济部门就业占比作为衡量发展中国家劳动力市场结构的关键指标,直接关联体面劳动、社会保障覆盖及贫困脆弱性等议题。Electric Sheep Asia于2025年对ILOSTAT原始数据进行标准化重封装,构建了覆盖28个亚洲国家、2000至2025年间5,593条观测的非正规就业占比数据集,按性别与就业身份多维分解。该数据集为亚洲非正规经济动态监测、性别就业差距分析及时间序列预测提供了可直接调用的机器学习就绪数据资源。
当前挑战
非正规就业的界定长期受国际劳工统计学家会议(ICLS)定义演进的影响,不同国家劳动力调查在就业身份分类、非正规部门边界及参考期设定上的差异,导致跨国比较存在系统性偏差。原始数据中部分国家年份缺失严重,观测状态标记为“不可靠”或“序列中断”的样本需谨慎处理,时序预测任务面临稀疏与不规则采样挑战。数据集仅涵盖年度频率,未纳入月度或季度序列,限制了高频动态建模。性别维度的SEX_O类别样本极少,可能引发分类任务中的类别不平衡问题。就业身份分类的聚合与细分层级并存,特征工程需根据分析目标合理选择粒度以避免信息冗余或损失。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最经典的使用场景在于刻画亚洲各国非正规部门就业的性别差异与结构演变。研究者借助其涵盖28个亚洲国家、2000至2025年的5,593条观测,按性别与就业身份分类,系统分析非正规就业占比的时序趋势与横截面差异。藉由对就业身份维度的细分,可辨识自营劳动者、家庭帮工等群体在非正规部门中的相对份额,进而揭示亚洲劳动力市场二元结构的动态特征。
衍生相关工作
该数据集已催生一系列围绕亚洲非正规经济的衍生研究。部分工作将其与ILO其他指标(如工资、工时、社会保护)横向联结,构建多维度体面劳动指数;另有研究运用面板回归与时序预测方法,探讨非正规就业对收入不平等与贫困率的影响。在机器学习社区,它常被用于表格分类与回归任务的基准测试,并支撑了面向亚洲劳动市场的可复现数据管线和可视化工具的开发。
数据集最近研究
最新研究方向
在全球南方非正规经济持续扩张的背景下,该数据集为亚洲28国非正规就业份额的性别差异与就业身份分层研究提供了长时段面板支撑。前沿研究聚焦于非正规就业的性别鸿沟如何随产业结构转型与数字平台经济兴起而演化,并借助时间序列预测与面板回归方法,识别制度变迁、贸易冲击及危机事件对非正规部门规模的非对称影响。相关热点亦呼应国际劳工组织推动的向正规化转型议程及可持续发展目标第八项体面劳动监测需求,为比较政治经济学与劳动政策评估提供可复现的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务