遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-ocu-nb-employment-outside-the-formal-sector-by-sex-and-oc

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含8,795个观测值,涵盖27个亚洲国家,时间跨度为2000年至2025年,核心指标为EMP_PIFL_SEX_OCU_NB,即按性别和职业划分的非正规部门就业人数(单位:千)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Asia重新打包,适用于表格分类、回归和时间序列预测等任务。数据集包含国家代码、性别分类、职业分类、年份、观测值等列,并提供数据来源和质量说明,如观测状态标志和方法论修订注释。

This dataset contains 8,795 observations of informal economy data across 27 Asia countries, spanning 2000–2025, covering 1 distinct indicator EMP_PIFL_SEX_OCU_NB (Employment outside the formal sector by sex and occupation in thousands). Sourced from the International Labour Organization (ILO) ILOSTAT database and repackaged by Electric Sheep Asia, it is suitable for tabular classification, regression, and time-series forecasting tasks. The dataset includes columns for country code, sex disaggregation, occupation classification, year, observed value, and data quality notes such as observation status flags and methodology revisions.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-ocu-nb-employment-outside-the-formal-sector-by-sex-and-oc 数据集图片
构建方式
数据集源自国际劳工组织(ILO)中央统计数据库ILOSTAT,通过其REST API接口(https://rplumber.ilo.org/data/indicator?id=EMP_PIFL_SEX_OCU_NB)直接抽取原始记录,并依据ISO 3166-1 alpha-3国家代码筛选出27个亚洲国家,时间跨度为2000年至2025年。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行标准化调和,源调查信息记录于source.label字段以保证可追溯性。最终由Electric Sheep Asia重新打包为Parquet格式,形成包含8,795条观测值的机器学习就绪数据集。
特点
数据集聚焦于亚洲地区非正规部门就业的性别与职业分布,以千人为单位度量,涵盖27个亚洲国家,时间序列横跨四分之一世纪。核心指标为EMP_PIFL_SEX_OCU_NB,按性别(总计、男性、女性、其他)和职业技能等级进行多维 disaggregation。数据以年度频率发布,包含完整的源调查标识、观测状态标记及方法学修订注释,为劳动经济学、非正规经济研究及性别就业差距分析提供高粒度、可追溯的跨国面板数据。
使用方法
使用者可通过HuggingFace datasets库以load_dataset函数加载数据,并转换为Pandas DataFrame进行灵活操作。针对特定国家分析,可依据ref_area字段筛选,如df[df['ref_area'] == 'IDN']获取印度尼西亚数据。针对时间序列研究,可选取单一指标并按时间排序后绘制趋势图。针对跨国比较,可利用pivot_table将数据重塑为国家×年份矩阵,便于进行横截面或面板回归分析。数据集亦适用于表格分类、回归及时间序列预测等机器学习任务。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计的标准化与传播,其ILOSTAT数据库汇集了涵盖就业、失业、工资、非正规经济等在内的多维指标,构成劳动经济学与政策评估的核心基础设施。在此背景下,Electric Sheep Asia于2025年对ILOSTAT中“非正规部门外就业(按性别与职业,千人)”指标进行系统性抓取与重包装,形成了覆盖27个亚洲国家、2000至2025年、共计8795条观测的亚细亚面板数据集。该数据集以帕拉quet格式发布,旨在为机器学习驱动的劳动市场分析、非正规就业性别差异研究及可持续发展目标监测提供可直接加载的结构化资源,其权威来源与长时序跨度显著提升了亚洲非正规经济实证研究的可复现性。
当前挑战
非正规就业的测度本身即面临概念边界模糊、跨国统计口径异质性与调查覆盖不全等固有难题,该指标要求将非正规部门外就业按性别与职业技能层级细分,对原始劳动力调查的样本量和分类精度提出严苛要求。数据集构建过程中,ILO虽通过国际劳工统计学家会议定义进行协调,但部分国家在特定年份采用不同调查工具或修订方法,导致序列断裂,且少数观测值被标记为不可靠或临时性,需在建模时予以甄别。此外,27国在时间跨度上的不均衡——如土耳其拥有2000至2024年完整记录,而格鲁吉亚仅覆盖2019年后——对跨国面板分析及时间序列预测方法的稳健性构成实质性挑战。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最经典的使用场景在于刻画亚洲二十七国非正规部门就业的性别与职业结构变迁。研究者常以年度为时间轴,将观察值按国别、性别及职业分类交叉制表,构建非正规就业比重的面板数据,进而运用固定效应模型或时间序列分解技术,揭示不同技能层级职业中男女非正规就业的分布差异与演变轨迹。
解决学术问题
该数据集为解答非正规就业的性别差距与职业隔离问题提供了关键实证基础。它使学者能够量化女性在低技能非正规岗位中的过度代表现象,检验经济周期、贸易开放及产业结构转型对非正规就业性别构成的异质性影响,从而弥合既有文献中缺乏跨国、长时段、分性别职业细分的非正规就业数据的不足,推动关于非正规经济与体面劳动议题的理论对话。
衍生相关工作
围绕该数据集,学界与数据科学社区衍生出一系列经典工作。例如,有研究将其与ILOSTAT其他指标合并,构建非正规就业脆弱性指数;也有工作利用其时间序列特性开展预测建模与情景模拟。在数据工程领域,Electric Sheep Asia的标准化封装促进了机器学习就绪型数据集的推广,催生了针对亚洲劳动力市场的自动化数据管道与可视化仪表板等衍生应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务