遇见数据集

electricsheepasia/asia-ilo-emp-nifl-sex-ind-rt-informal-employment-rate-by-ilo-sector-and-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是关于亚洲非正规就业率的统计数据集,由国际劳工组织(ILO)的ILOSTAT数据库提供,并由Electric Sheep Asia重新打包。数据集包含10,288个观测值,覆盖25个亚洲国家,时间跨度为2004年至2025年。核心指标为按ILO部门和性别划分的非正规就业率(%),指标代码为EMP_NIFL_SEX_IND_RT。数据来源于ILO的官方统计,包括劳动力调查、家庭收入调查等,并经过ILO的标准化处理,以确保数据的一致性和可比性。数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究人员和开发者提供亚洲劳动力市场的ML-ready数据层,支持经济和社会分析。

This is a statistical dataset focused on informal employment rates across Asia. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), and repackaged by Electric Sheep Asia. The dataset contains 10,288 observations, covering 25 Asian countries and spanning the period from 2004 to 2025. Its core indicator is the informal employment rate (in percentage), categorized by ILO economic sectors and gender, with the indicator code EMP_NIFL_SEX_IND_RT. The data is derived from official ILO statistics, including labor force surveys, household income surveys and other relevant sources, and has been standardized by the ILO to ensure data consistency and comparability. This dataset is suitable for tasks such as table classification, regression and time series forecasting, and aims to provide researchers and developers with an ML-ready data layer for Asia's labor market to support economic and social analysis.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-nifl-sex-ind-rt-informal-employment-rate-by-ilo-sector-and-sex 数据集图片
构建方式
该数据集由Electric Sheep Asia基于国际劳工组织(ILO)的ILOSTAT数据库构建,通过调用ILOSTAT REST API直接抽取亚洲国家的非正规就业率指标数据。在获取原始数据后,团队依据ISO 3166-1 alpha-3国家代码筛选出25个亚洲国家,并利用ILO的ICLS统计定义对原始调查微观数据进行统一校准与标准化处理。最终将涵盖2004年至2025年间的10,288条观测记录整合为结构化的Parquet格式,形成可直接调用且兼具可追溯性的机器学习就绪数据集。
特点
该数据集汇集了亚洲地区2004至2025年间25个国家的非正规就业率,涵盖10,288条观测记录,具有丰富的时间序列与横截面特性。数据经过ILOSTAT统一标准化,按性别(总、男、女、其他)与ILO行业进行细粒度分解,每一条记录均可追溯至具体来源调查。此外,数据集提供了完备的数据质量标识,包括观测状态标记与中断系列注释,极大增强了数据的透明度与可信度,非常适合进行区域就业结构的比较分析与趋势研究。
使用方法
用户可以通过Hugging Face Datasets库的load_dataset函数直接加载该数据集,并将训练集转换为Pandas DataFrame以便进行后续分析。支持按国家筛选,例如通过过滤'ref_area'列选取印度尼西亚数据;亦可用于特定指标如非正规就业率的时间序列分析与可视化,通过按'time'列排序后绘制观测值变化。此外,通过数据透视操作,用户能够将原始长格式转换为以年份为索引、国家为列的国家×年份矩阵,便于开展面板数据分析与计量建模。
背景与挑战
背景概述
非正规就业作为劳动力市场的重要组成部分,长期受到国际劳工组织(ILO)的高度关注,尤其是在亚洲这一全球劳动力最为密集的地区。由ILO统计部门构建的ILOSTAT数据库,汇集了来自200多个经济体的劳动力调查与行政记录数据,为研究非正规经济现象提供了权威基准。在此背景下,Electric Sheep Asia于2025年将ILOSTAT中“按ILO行业和性别划分的非正规就业率”这一核心指标,针对25个亚洲国家2004至2025年的时序数据进行了重新封装与发布。该数据集包含10,288条观测值,旨在系统揭示亚洲地区非正规就业的行业与性别差异,为劳动经济学、发展经济学以及联合国可持续发展目标(SDG)中体面工作的监测提供标准化、机器可读的数据基础。其发布有效弥合了跨国劳动统计在访问门槛与格式异构方面的鸿沟,显著提升了亚洲劳动力市场研究的可复现性与数据驱动能力。
当前挑战
该数据集所面对的挑战主要体现在两个层面。在领域问题层面,非正规就业本身具有隐蔽性强、行业与性别不均衡、国别定义差异显著等特征,导致跨区域比较与模型构建面临巨大障碍;研究者需要在高缺失率与低信噪比的数据环境下,准确识别非正规就业的驱动因素与政策干预效果。在数据集构建层面,挑战源于多源异构数据的整合与清洗,ILO虽对各国劳动力调查进行了基于ICLS定义的协调,但调查年份、数据来源(如LFS与行政记录)、分类维度(如性别与行业)在横向与纵向上均存在断裂与标志不一致(如“中断序列”与“不可靠”标记),且部分国家仅覆盖有限时间窗口,进一步增加了时序建模与面板分析的复杂性。
常用场景
经典使用场景
该数据集涵盖了2004年至2025年间亚洲25个国家的非正规就业率,按国际劳工组织行业和性别进行了精细划分,共包含10,288条观测记录。其典型用途在于构建面板数据模型,以探究各国非正规就业的时序演变轨迹与跨国异质性特征。研究者常利用该数据集进行时间序列分析与多维度交叉统计,例如通过性别与行业双重维度剖析非正规就业的结构性分布,或借助可视化工具揭示特定国家非正规就业率的长期波动规律。
解决学术问题
该数据集为劳动经济学与发展经济学中的核心议题提供了实证基础,特别是针对非正规就业的测度与驱动因素分析。它解决了长期以来因微观调查数据零散、跨国可比性差而导致的研究瓶颈,使学者能够系统评估亚洲各国非正规就业率的性别差异、行业集中度及其与经济发展阶段的关联。数据集的权威来源与规范化整合,显著提升了关于劳动力市场二元结构、弱势群体就业质量以及可持续发展目标(SDG)监测等学术问题研究的可靠性与普适性。
衍生相关工作
围绕该数据集已衍生出多项具有影响力的学术与实践工作。在理论层面,研究者基于该数据验证了非正规就业与经济增长之间非线性关系的假说,并构建了刻画性别就业不平等的计量模型。在应用层面,数据集的标准化格式推动了自动化劳动力市场监测平台的开发,如基于该数据搭建的非正规就业预警系统,能够实时追踪各国就业质量波动。同时,该数据集也被纳入国际劳工组织全球劳动力市场数据库,为跨区域比较研究提供了基准参考,并催生了关于亚洲非正规就业收敛性的多国协作分析项目。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务