遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-geo-mts-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲23个国家从2000年至2025年的非正规经济部门就业数据,共有11,902个观测值,涵盖一个核心指标:按性别、城乡地区和婚姻状况划分的非正规部门就业占比(%)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过处理,以确保数据的一致性和可追溯性。数据集包含多个字段,如国家代码、国家名称、数据来源、指标代码、性别分类、分类变量、观测年份、观测值、数据状态标志等,支持按国家、年份、性别等维度进行细分分析。数据集适用于表格分类、表格回归和时间序列预测等任务,旨在为研究亚洲劳动力市场和非正规经济提供机器学习就绪的数据支持。数据以CC-BY-4.0许可证发布,使用时需引用原始来源和重新打包方。

This dataset contains 11,902 observations of informal economy data across 23 Asian countries, spanning from 2000 to 2025, covering one distinct indicator: the share of employment outside the formal sector by sex, rural/urban areas, and marital status (%). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and processed for consistency and traceability. It includes fields such as country codes, country names, data sources, indicator codes, sex disaggregation, classification variables, observation years, observed values, and data status flags, enabling detailed analysis by country, year, sex, and other dimensions. The dataset is suitable for tabular classification, tabular regression, and time-series forecasting tasks, providing machine-learning-ready data for studying labor markets and the informal economy in Asia. It is released under the CC-BY-4.0 license, requiring citation of both the original source and the repackaging entity.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-geo-mts-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,经由Electric Sheep Asia团队重新打包而成。数据通过ILOSTAT REST API直接获取,并依据ISO 3166-1 alpha-3国家代码筛选出亚洲23个国家的数据,时间跨度覆盖2000年至2025年。原始数据来自各国劳动力调查、家庭收支调查及行政记录,经ILO统计部门依据ICLS定义进行统一协调与处理,确保了跨国可比性。每一观测值均附有来源标识、观测状态及指标注释,便于溯源与质量控制。
特点
该数据集聚焦亚洲地区非正规部门就业占比这一关键指标,按性别、城乡区域及婚姻状况进行了精细的维度划分,共包含11,902条观测记录。数据具有年度频率,涵盖23个亚洲国家,并针对每个国家提供了不同年份的序列数据,如土耳其、印度、越南等国拥有较长时间跨度。数据集还包含丰富的数据质量标记,如观测状态(可靠、不可靠)及系列断裂注释,为研究者提供了识别数据异常与口径变化的依据。此外,每个指标均附有完整的元数据描述,便于理解其统计口径与来源。
使用方法
使用者可通过HuggingFace的datasets库便捷加载数据,示例代码展示了如何将数据转换为Pandas DataFrame。数据集支持按国家筛选,如提取印度尼西亚的观测值;亦可对特定指标进行时间序列分析,通过排序时间变量绘制趋势图。数据表结构设计支持透视操作,用户能够轻松构建国家×年份的矩阵,便于进行跨国的比较研究或面板数据分析。对于需要深入探究非正规经济领域的研究者,本数据集提供了标准化且易于集成的数据接口,大幅降低了数据清洗与整理的负担。
背景与挑战
背景概述
在亚洲劳动力市场深刻转型的背景下,非正规就业的测度对于理解经济脆弱性与性别不平等具有关键意义。国际劳工组织(ILO)统计司长期致力于通过其核心数据库ILOSTAT协调各国劳动力调查数据,依据国际劳工统计学家会议(ICLS)定义实现跨国可比。2025年,Electric Sheep Asia将ILOSTAT中该特定指标重塑为机器学习就绪的表格数据集,覆盖23个亚洲国家、2000至2025年的11,902条观测值,围绕按性别、城乡及婚姻状况划分的非正规部门就业占比展开,凸显了区域内部劳动力结构异质性与时间演变的深层规律。该数据集以统一范式整合了来源标签与质量标记,为劳动经济学、发展研究及数据科学领域提供了珍贵的时间序列资产,推动了亚洲非正规经济的量化比较分析。
当前挑战
该领域面临的核心挑战在于非正规就业界定的跨国差异:各国对'非正规部门'遵循ICLS框架的程度不一,导致指标近似可比而非完全等效,跨区比较需审慎。数据构建层面,ILOSTAT虽优先采用'最佳来源',但多国观测值可能源自不同调查类型(如劳动力调查或住户收入调查),且存在方法修订导致的序列断裂(如Break in series标记),这些破坏时间序列的连续性。此外,性别与地理分布等维度细分存在大量缺失值,部分年度数据标记为不可靠(如obs_status='U'),加之年度频率限制与月/季序列的剔除,均增加了模型推断与纵向分析的难度,要求使用者具备处理异质性来源与不完整面板数据的严谨方法论素养。
常用场景
经典使用场景
该数据集聚焦于亚洲23个国家2000至2025年间非正规部门就业比例的年度观测,涵盖性别、城乡及婚姻状况等多维细分维度。其核心价值在于为劳动经济学、发展经济学及区域研究提供标准化的面板数据基础,常被用于追踪非正规就业的时空演变趋势、评估各国劳动市场结构转型进程,以及构建跨国比较分析框架。凭借ILOSTAT的权威来源与细致分类,研究者可借助时间序列分析、面板回归或机器学习模型,挖掘非正规就业与宏观经济、政策干预之间的内在关联,成为探究亚洲劳动市场动态的关键实证工具。
衍生相关工作
该数据集的衍生工作广泛见于劳动经济学与机器学习交叉领域。基于此数据,研究者构建了非正规就业预测模型,利用梯度提升或时间序列网络捕捉性别、区域及时间特征的非线性影响;亦衍生出非正规就业脆弱性指数,综合多维度加权评估国家风险。此外,相关研究将该数据与ILO其他就业指标、世界银行治理数据关联,分析制度环境对非正规经济的调节效应,并延伸至非正规就业与贫困、教育回报率关系的因果推断。这些工作不仅深化了理论认知,也为数据集的迭代更新提供了方法学参考。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区非正规部门就业比例的性别、城乡及婚姻状况维度分解,为追踪非正规经济动态提供了精细化的时空数据支撑。当前研究前沿方向集中于利用此类ILOSTAT高频面板数据,结合机器学习与时间序列模型,揭示非正规就业与宏观经济波动、社会保障政策及劳动力市场制度变迁之间的深层关联,尤其关注疫情后非正规就业的韧性特征与性别不平等演化。同时,该数据与SDG体面工作目标监测体系紧密挂钩,为评估亚洲各国在促进包容性就业方面的进展提供了可量化的实证基础,助力于跨国产出比较与政策影响评估,推动实现更公平、更可持续的劳动力市场转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务