遇见数据集

electricsheepasia/asia-ilo-emp-5nif-sex-age-rt-informal-employment-rate-by-sex-and-age-19th-icls

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲18个国家从2014年至2025年的非正规就业率数据,共有580个观测值,基于第19届国际劳工统计学家会议(ICLS)定义。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家,涵盖性别和年龄维度的分类,用于表格分类、回归和时间序列预测任务。数据集包括国家代码、性别分类、年龄组、观测年份和值等列,并提供了数据来源和质量注释。

This dataset contains informal employment rate data for 18 Asian countries from 2014 to 2025, with 580 observations based on the 19th International Conference of Labour Statisticians (ICLS) definitions. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for Asian countries, covering disaggregation by sex and age for tabular classification, regression, and time-series forecasting tasks. It includes columns such as country codes, sex classification, age groups, observation years, and values, along with source and quality annotations.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-5nif-sex-age-rt-informal-employment-rate-by-sex-and-age-19th-icls 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API提取指标EMP_5NIF_SEX_AGE_RT的原始数据,并依据国际劳工统计学家会议(ICLS)第19届会议定义进行统一整合。数据筛选范围限定于亚洲地区的ISO 3166-1 alpha-3国家代码,经过Electric Sheep Asia的二次封装,将原始调查微观数据转化为结构化表格,并以Parquet格式发布,确保机器学习的便捷调用。数据集包含580条观测记录,覆盖18个亚洲国家,时间跨度从2014年至2025年,主要涉及按性别和年龄划分的非正规就业率这一单一指标。
特点
该数据集的核心特色在于其高度标准化的多维分类体系,提供性别(SEX_T、SEX_M、SEX_F、SEX_O)及年龄分组等细分维度,便于开展交叉分析。同时,每条记录保留了ILOSTAT的源数据标签、观测状态标志及注释信息,支持追溯数据来源与系列中断等质量说明。数据频率为年度,且采用ILO筛选的‘最佳来源’优先原则,兼顾了不同国家间数据的一致性与可比性。整体上,该数据集为研究亚洲地区非正规就业的时空演变提供了规范、可复现的量化基础。
使用方法
该数据集可直接通过HuggingFace的`datasets.load_dataset()`函数加载,返回标准表格结构,便于转换为Pandas DataFrame进行后续分析。用户可以依据`ref_area`列筛选特定国家的时间序列数据,或利用`obs_value`和`time`列绘制指标的变化趋势。通过`pivot_table`操作,可将数据重塑为国家-时间矩阵,适用于面板数据分析或回归建模。此外,数据集兼容`tabular-classification`、`tabular-regression`及`time-series-forecasting`等任务场景,适合用于劳动力经济学的实证研究或机器学习模型的训练与评估。
背景与挑战
背景概述
非正规就业作为全球劳动力市场的重要特征,尤其在亚洲发展中经济体表现突出,其测算与监测对制定包容性就业政策至关重要。国际劳工组织(ILO)统计司长期致力于通过ILOSTAT数据库整合各国劳动力调查数据,以标准化的国际劳工统计学家会议(ICLS)定义来统一衡量非正规就业。该数据集由Electric Sheep Asia于2025年重新打包,涵盖18个亚洲国家2014至2025年间580条观测记录,核心指标为非正规就业率(按性别与年龄分列,采用第19届ICLS标准)。研究人员可通过该数据集便捷地获取区域层面的结构性劳动力信息,支撑跨国比较、政策评估及可持续发展目标(SDG)中体面工作的量化分析,填补了亚洲区域高时效性、标准化非正规就业面板数据的空白。
当前挑战
非正规就业定义的跨国差异性是该领域长期面临的挑战。各国劳动调查在非正规部门界定、统计口径及数据采集频率上存在显著分歧,ILOSTAT虽通过ICLS框架进行协调,但数据仍受限于原始调查的方法学断裂(如指标注释中的序列中断标记)与抽样设计差异。构建过程中,数据整合需处理多源异质性,包括不同年份调查方法更新(如从第17届到第19届ICLS的过渡)、年龄分组非标准化(如“排除15岁”等特殊标注)以及观测状态标记(如临时值、不可靠值)。此外,部分国家数据稀疏(阿富汗仅9条记录)且时间覆盖不均衡,导致跨国时序分析的完整性受限,平衡代表性样本与数据质量成为核心瓶颈。
常用场景
经典使用场景
在劳动经济学与发展研究领域,该数据集被广泛用于分析亚洲地区非正规就业率的性别与年龄差异。研究者通常利用其包含的18个国家、2014至2025年间的时间序列观测值,构建面板数据模型以探究非正规就业的动态演变规律。经典用法包括通过多元回归检验性别(男性、女性、总体)与年龄分组(青年、成年)对非正规就业率的边际效应,或运用时间序列分解技术识别经济周期、政策干预对该指标的影响。此外,该数据集常被用于跨国比较分析,揭示不同亚洲国家非正规就业结构的异质性特征。
衍生相关工作
基于该数据集已衍生出多项具有影响力的研究工作。一方面,研究者将其与ILOSTAT中的工资、失业率等其他劳动指标进行关联分析,构建了综合性的亚洲体面劳动指数。另一方面,该数据集被用作基准来评估机器学习模型对非正规就业率的预测性能,推动了劳动经济预测方法从传统计量经济学向深度学习的拓展。此外,有学者利用数据的时空结构,开发了针对亚洲区域的空间自回归面板模型,量化了邻国间非正规就业的空间溢出效应。围绕该数据集的引用规范与数据溯源方法,也促成了高质量数据集管理与复用的最佳实践指南的建立。
数据集最近研究
最新研究方向
基于国际劳工组织ILOSTAT数据库,该数据集聚焦亚洲18国2014至2025年间非正规就业率的性别与年龄差异,为追踪后疫情时代亚洲劳动力市场的结构性转型提供了关键时序证据。在全球对非正规经济治理议题持续升温的背景下,这一细粒度数据能够支撑关于非标准就业形态与社会保护缺口的前沿探讨,尤其有助于评估不同国家在推进体面劳动目标(SDG 8)上的实际进展与政策效能。其跨年度面板结构亦为构建预测模型、解析非正规就业的动态演变规律奠定了坚实的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务