electricsheepasia/asia-ilo-emp-pifl-sex-geo-dsb-rt-share-of-employment-outside-the-formal-sector-by-s
收藏数据链接:
官方服务:
资源简介:
该数据集包含关于亚洲非正规经济的数据,具体指标为“按性别、农村/城市地区和残疾状况划分的正式部门外就业比例(%)”。数据集涵盖14个亚洲国家,时间跨度为2006年至2024年,共包含1,861个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过处理和重新打包,以表格形式提供,适用于表格分类、回归和时间序列预测等任务。数据集包括国家代码、年份、观测值以及按性别、地区类型和残疾状况等维度进行分解的列,旨在支持劳动市场和非正规经济研究。
This dataset contains 1,861 observations of informal economy data across 14 Asia countries, spanning 2006–2024, covering 1 distinct indicator: Share of employment outside the formal sector by sex, rural / urban areas and disability status (%). It is sourced from ILOSTAT, the ILOs central statistics database, and includes disaggregated dimensions such as sex, geographic area type, and disability status, repackaged for machine learning applications in tabular and time-series analysis.
提供机构:
electricsheepasia搜集汇总
数据集介绍

构建方式
在国际劳工组织(ILO)推动全球非正规经济就业统计标准化的背景下,该数据集由Electric Sheep Asia对ILOSTAT官方数据库进行系统性重打包构建而成。原始数据通过ILO的REST API接口直接获取,该接口以国际劳工统计学家会议(ICLS)的统一定义对各国劳动力调查、家庭收入调查及行政记录等原始微观数据进行协调与标准化处理。构建过程严格筛选亚洲ISO3国家代码,覆盖14个亚洲国家,时间跨度为2006至2024年,最终形成包含1861条观测值的结构化表格数据集,并保留了来源标签列以支持数据溯源。
特点
该数据集聚焦于非正规部门外就业份额这一非正规经济核心指标,以性别、城乡区域和残疾状况作为多维 disaggregation 维度,揭示亚洲劳动力市场中非正规就业的结构性差异。数据集涵盖蒙古、塞浦路斯、斯里兰卡等14个亚洲国家,时间序列横跨近二十年,兼具截面与时间双重变化特征。数据以年度频率发布,包含观测状态标记及非标准定义注释等质量元数据,能够满足表格分类、回归及时间序列预测等多类机器学习任务的需求,为研究亚洲非正规经济动态提供了细粒度且可追溯的实证基础。
使用方法
研究者可通过HuggingFace datasets库以load_dataset函数直接加载该数据集,并将其转换为Pandas数据框进行后续分析。典型使用方式包括:基于ref_area列筛选特定国家(如印度尼西亚)的观测记录;针对单一指标按时间排序以绘制时间序列趋势图;或通过pivot_table方法将数据重塑为国家与年份的交叉矩阵,便于开展跨国比较。数据亦可直接用于表格分类、回归预测及时间序列建模等任务,所有列均包含明确的标签与注释信息,支持从数据清洗到模型训练的完整工作流。
背景与挑战
背景概述
非正规经济就业的测度长期以来构成劳动统计学与发展经济学的核心议题,其与体面劳动、社会保障覆盖及性别平等诸多目标密切交织。国际劳工组织(ILO)依托国际劳工统计学家会议(ICLS)第15至17届决议所确立的概念框架,自2000年代起系统汇编非正规就业指标,ILOSTAT数据库由此成为全球最具权威性的劳动统计来源。本数据集由Electric Sheep Asia于2024年从ILOSTAT REST API采集并重新封装,覆盖2006至2024年间14个亚洲国家的1861条观测,以性别、城乡地域及残疾状况三重维度刻画正规部门以外就业占比,为亚洲非正规就业的跨国比较与历时追踪提供了标准化的机器学习就绪数据层,对劳动政策评估与包容性增长研究具有显著的方法论支撑价值。
当前挑战
该数据集所回应的领域问题在于:非正规就业测量长期受制于定义歧异、抽样框偏差与自雇身份识别困难,致使跨国可比性面临严峻考验。构建过程中的具体挑战包括:各国劳动力调查对ICLS标准的采纳程度参差,残疾状况分类跨越非标准定义与断点修订,占比指标因分母口径不一而须审慎解释;部分观测带有不可靠或临时性状态标记,样本在国别与年份间高度不平衡,蒙古与塞浦路斯两国贡献了近半数记录,而阿富汗、东帝汶等国仅存单年截面,此种稀疏性与异构性对时间序列建模与因果推断构成实质限制。
常用场景
经典使用场景
在非正规经济就业研究的广袤图景中,该数据集凭借其独特的性别、城乡与残疾状况三维交叉分类框架,构筑了刻画亚洲地区非正规就业分布的核心工具。研究者通常将1,861条观测数据装载为面板结构,运用时间序列分解、面板回归或聚类分析等方法,追踪2006至2024年间14个亚洲国家非正规就业比重的演变轨迹。其经典用法在于通过性别与城乡维度的交互透视,揭示女性与农村劳动者在非正规部门中的过度集中现象,从而为劳动力市场分层理论提供实证基石。
实际应用
在政策实践层面,该数据集构成国际组织与各国劳工部门制定非正规就业干预策略的关键证据来源。国际劳工组织可据此监测体面劳动议程在亚洲的落实进度,各国政府则能借助其细分指标识别高风险群体,进而设计面向女性、农村居民及残障人士的定向技能培训与社会保障方案。发展金融机构亦可将之纳入项目评估框架,衡量非正规经济正规化进程的实际成效。其年度更新机制确保政策制定者能够追踪干预措施的动态效应,为循证决策提供持续支撑。
衍生相关工作
围绕该数据集所衍生的研究工作,已逐步形成一条从描述性统计迈向因果推断的学术脉络。早期文献多聚焦于非正规就业比重的国别差异及其与人均收入、教育水平的关联;随后,学者开始利用其面板结构开展双重差分与合成控制分析,评估贸易自由化、数字化转型等外生冲击对非正规就业的异质性影响。部分研究将该数据与世界银行微观调查匹配,构建多层模型以分离个体特征与宏观制度环境的效应。这些工作共同拓展了非正规经济研究的方法论边界,并强化了亚洲比较劳动研究的实证基础。
以上内容由遇见数据集搜集并总结生成



