遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-how-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲26个国家在2000年至2025年期间的非正规经济部门就业比例数据,具体指标为“按性别和实际每周工作小时数划分的非正规部门就业比例(%)”。数据集共有4,251个观测值,来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为亚洲国家。数据以表格形式组织,包含国家代码、年份、性别分类、观测值等列,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Asia重新打包,旨在为亚洲提供统一的、适合机器学习的数据层。

This dataset contains data on the share of employment outside the formal sector by sex and weekly hours actually worked (%) for 26 Asian countries from 2000 to 2025. It includes 4,251 observations sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered to Asian countries. The data is organized in tabular format with columns such as country code, year, sex disaggregation, observed value, and is suitable for tasks like tabular classification, regression, and time-series forecasting. The dataset is repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-how-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口直接获取非正规经济部门就业份额的原始指标数据,并依据亚洲ISO3国家代码进行筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)的标准化定义对各国劳动力调查、家庭收入调查等微观数据进行统一调和,数据中保留了来源标签以确保可追溯性。最终由Electric Sheep Asia重新打包为Parquet格式,形成涵盖26个亚洲国家、时间跨度为2000至2025年的4251条观测记录。
特点
数据集聚焦于亚洲地区非正规部门就业份额的性别与周工作时长分布,具有显著的时空覆盖广度与维度细化特征。其核心变量包括国家代码、性别分类、周工作时长区间及观测值,并附有观测状态标记与注释信息以标识数据可靠性。数据集以年度频率呈现,部分国家存在序列中断或方法论修订的标注,为劳动经济学、非正规经济研究及性别就业差异分析提供了结构化且可复用的面板数据基础。
使用方法
研究者可通过HuggingFace的datasets库以一行代码加载数据集,并转换为Pandas数据框进行灵活分析。典型用法包括按国家代码筛选特定国家的时间序列、按指标代码提取单一指标的趋势变化,或利用透视表将数据重构为国家与年份的交叉矩阵。该数据集适用于表格分类、回归及时间序列预测等任务,亦可结合性别与工作时长维度开展非正规就业的异质性研究。
背景与挑战
背景概述
非正规经济部门就业规模长期以来构成劳动经济学与发展经济学的核心议题,其测量精度直接影响体面劳动议程的推进。国际劳工组织(ILO)依托全球劳动统计数据库(ILOSTAT),整合各国劳动力调查与家庭收入调查等微观数据源,按国际劳工统计学家会议(ICLS)定义进行标准化调和,构建了覆盖200余个经济体的非正规就业指标体系。本数据集由Electric Sheep Asia于2025年从ILOSTAT接口摄取并重新封装,聚焦亚洲26国的非正规部门就业占比,按性别与周实际工时双重维度展开,涵盖2000至2025年共4251条年度观测,为追踪亚洲劳动力市场非正规化进程提供了跨国可比的基础数据资源。
当前挑战
非正规就业的领域难题在于其概念边界随ILCS决议修订而持续演化,各国调查口径、抽样设计与参考周期存在系统性差异,导致跨国可比性先天受限。构建层面,数据源自多套调查体系,指标中断、口径调整与观测状态标记(如不可靠、临时性)频繁出现,且性别与工时维度的分类变量仅在特定国家年份非空,稀疏性与非随机缺失并存;部分国家序列起始年份偏晚或终止较早,时间跨度参差不齐,对纵向建模构成实质障碍。如何在保留溯源信息的同时实现跨国、跨时期的稳健推断,是该数据集面临的核心方法论挑战。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集构成了一项极具代表性的跨国面板观测资源,其经典使用场景聚焦于刻画亚洲26国非正规部门就业占比的时序演变轨迹。研究者依托2000至2025年间4,251条观测记录,得以按性别与周实际工作时长双重维度对非正规就业份额进行精细化分解,进而运用面板回归、时间序列预测或聚类分析等方法,揭示不同国家非正规经济规模的异质性及其动态收敛特征,为理解亚洲劳动力市场结构转型提供量化基准。
解决学术问题
该数据集有效回应了非正规就业测度中长期存在的可比性缺失与维度单一两大痼疾。借助ILO基于国际劳工统计学家会议定义所实施的标准化调和流程,它解决了跨国比较中定义分歧与调查口径异质性带来的偏误问题;同时,按性别与工时分层披露的设计,弥补了既往研究多止步于总量刻画而难以揭示性别差距与工时强度交互效应的不足,为检验非正规就业的性别分化假说、非自愿工时约束理论等议题提供了严谨的实证基础。
衍生相关工作
围绕该数据集及其所依托的ILOSTAT指标框架,已衍生出一系列具有影响力的后续研究。学者们在此基础上构建了非正规就业脆弱性指数,并将其与贫困率、社会保障覆盖率等指标进行跨库链接分析;部分研究将其与ILO其他指标(如工资、工时、童工)整合,形成多维度体面劳动评估体系。同时,该数据集被广泛用于机器学习模型的可解释性研究,作为表格分类与回归任务中检验算法在稀疏面板数据上表现的标准基准之一。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务